Tensor-Level Allocation让Qwen 3.5 4B低比特量化推理提升16.67%
社区将该方法应用于Qwen 3.5 4B IQ2_XS量化,报告【推理性能提升16.67%】。仍需独立复现。https://www.reddit.com/r/LocalLLaMA/comments/1vvc6pw/qwen_35_4b_iq2_xs_1667_reasoning_performance_from/[2]
本期重点集中在本地模型优化与Agent 工具链。社区分享了量化、MTP、基准测试及跨运行时观测等实用进展,也暴露了隐性计费问题。