本期速报聚焦两大热点:一是Cohere开放未发布编码模型早期访问,二是Fireworks AI训练平台支持Nemotron 3 Ultra微调。此外,社区分享了多个实用技巧:用Gemma 4 12B在12GB VRAM跑出120 tok/s、KV缓存量化新方法KVarN性能卓越,以及Codex远程控电脑的新玩法。

模型动态

Cohere 开放未发布编码模型早期访问

Cohere 为 LocalLLaMA 社区提供未发布编码模型的早期访问权限,引发广泛关注。这是开源社区的重大利好消息。项目地址:https://www.reddit.com/r/LocalLLaMA/comments/1tylzy2/coheres_unreleased_coding_model_early_access_for/[1]

产品工具

Fireworks AI 训练平台支持 Nemotron 3 Ultra 微调

Fireworks AI 宣布其训练平台扩展,支持美国领先开源模型Nemotron 3 Ultra进行SFTDPO微调,且训练基础设施可直接用于服务,对模型微调从业者价值很高。[2]

Better VRAM Estimator 工具推荐

Reddit 用户推荐了更好的 VRAM 估算网站和工具(结合 LM Studio),帮助开发者预估模型运行所需显存。链接:https://www.reddit.com/r/LocalLLaMA/comments/1tym480/better_vram_estimator/[6]

技巧教程

12GB VRAM 实现 Gemma 4 12B 120 tok/s 推理

社区分享在12GB VRAM上利用QAT MTP实现Gemma 4 12B模型120 tok/s的推理速度,展示了高效的量化与加速技巧,对硬件受限的开发者非常实用。[3]

KV 缓存量化新方法 KVarN 性能媲美 q8_0

KV缓存量化基准测试显示KVarN方法在6位时匹配q8_0,4位匹配q5_0,性能显著提升。这是模型推理优化的前沿技巧,值得关注。[4]

Codex 远程控电脑新玩法:帮助亲友修电脑

社区分享在朋友或父母电脑上安装Codex并开启远程控制,可利用computer use功能直接帮他们修电脑,是Codex的创意实用场景。[5]

行业资讯

AI CEO 联合警告国会产生物武器风险

OpenAIAnthropicMicrosoft的AI CEO们共同警告国会,AI使生物武器设计和制造变得过于容易,呼吁加强监管。这是重要的政策新闻。[7]