本周社区热点集中在本地模型优化小模型框架突破EAGLE推测解码合并入llama.cpp、Qwen3.6-27B在Agent框架下超越Fable5,以及多项实用工具与移动端推理进展引发关注。

模型动态

EAGLE推测解码正式合并到llama.cpp

EAGLE推测解码支持已合并入llama.cpp,可显著加速本地推理,对部署和优化有重要意义。Reddit社区热议。[2]

Nemotron等≤120B模型长上下文能力对比

在128GB共享内存上对比Nemotron等4个≤120B模型,评估长上下文能力,发现部分模型性能衰减。[6]

Qwen 3.6 35B-A3B Q4 vs Gemma 4 12B Q8对比讨论

开发者在32GB统一内存设备上对比Qwen 3.6 35B-A3B Q4Gemma 4 12B Q8,讨论量化对速度和能力的影响。[7]

产品工具

Pixel 10 Pro成功运行Gemma 12B模型

在Google Pixel 10 Pro上使用Termux运行Gemma 12B,功耗低于10瓦,达6.5pp 1.3tg,展示移动端运行中等模型的可行性。[4]

开源AI代码审查工具lgtmaybe发布

lgtmaybe支持任意LLM提供商(含本地Ollama),并行审查并反射消除误报,保护隐私。项目地址:https://www.reddit.com/r/LocalLLaMA/comments/1u5yytz/building_lgtmaybe_a_pr_reviewer_for_any_model/[5]

技巧教程

27B小模型凭借Agent框架超越Anthropic Fable5

karminski-牙医分享Iterative-Contextual-Refinements框架,通过BFS探索+DFS优化+路由闭环,让Qwen3.6-27B在CGRE测试以95.5分超越Fable5的94.1分,代价是25-40x token消耗。框架:https://t.co/PuiNaqmUkE 论文:https://t.co/LHRC7qLjuG[1]

从零推导GPTQ量化补偿数学

Reddit用户从零推导GPTQ4-bit量化不破坏模型perplexity的原因——权重被视为相关而非独立变量,为量化理解提供理论基础。[3]

行业资讯

AI不会取代软件工程师:Simon Willison发文反驳夸大叙事

Simon Willison发表长文探讨AI为何不会取代软件工程师,反驳夸大其词的叙事,对从业者具启发价值。链接:https://simonwillison.net/2026/Jun/14/why-ai-hasnt-replaced-software-engineers/[8]