本期关注GMC剪枝免训练削减80%多模态Token,以及Qwen3.5-0.8B在超低成本设备上的部署实测。社区也带来多项本地模型Agent工作流反馈。

模型动态

GMC剪枝免训练减少约80%多模态Token

紫东太初提出GMC核心集剪枝,免训练减少约80% Token,并尽量保持多模态能力,效果仍待独立验证。[1]

Motif 3发布314B总参数与NVFP4版本

新模型Motif 3采用【314B总参数、13B激活参数】设计,并提供NVFP4版本;当前尚缺系统基准与完整实测。[4]

Nemotron 3.5 Lightning本地实测表现不及预期

用户在M5 Pro以Q5量化运行Nemotron 3.5 Lightning,占用约24GB、速度65 token/s,Agent表现偏弱。[8]

产品工具

小红书上线自动更新的Read Skills Top 100榜单

小红书推出Read Skills Top 100页面并自动更新排名,榜首为占星应用,社区创作者已有两个Skill进入前十。[2]

Manus向部分老用户开放限时免费使用

Manus面向买过会员或通过Lenny's Newsletter领取会员的用户开启限免,仅支持Manus 1.6和Lite。[3]

技巧教程

Qwen3.5-0.8B在20美元级CPU上低内存运行

开发者用自制C运行时,在无GPU/NPU的Cortex-A53上运行Qwen3.5-0.8B,内存低于512MiB[5]

单卡编码模型实测暴露最终审查可靠性不足

社区在32GB显存下比较27B Q8、35B Q6等模型,发现均不适合独立担任【最终代码审查者】,仍需人工复核。[6]

开发者分享极简本地Agent工作流工具组合

实践方案用SearxNG封装搜索,并以llama.cpp扩展控制推理与预算,适合pi.dev和本地模型的轻量Agent。[7]