本期重点集中在本地推理优化AI工具更新:llama.cpp、Gemini CLI和Codex均有版本进展,社区还分享了多卡部署与极低体积模型实践。

模型动态

开发者从零训练250M模型并压缩至60MB

开发者用300亿Token训练250M参数模型,量化后仅约60MB,可在普通CPU运行。详情:https://www.reddit.com/r/MachineLearning/comments/1vv2nkh/i_developed_my_own_quantized_llm_from_scratch/[4]

产品工具

豆包上线技能、连接器与工作伙伴功能

豆包新增【技能】连接器工作伙伴,强化任务执行、工具调用与多模型协作。[1]

llama.cpp 0.2.0正式发布

llama.cpp发布0.2.0版本,同步提供更新日志、源码与预构建包。项目地址:https://www.reddit.com/r/LocalLLaMA/comments/1vv4mei/llamacpp_version_020_is_out/[2]

Gemini CLI夜间版修复macOS沙盒隔离问题

Gemini CLI发布v0.56.0-nightly,修复macOS Seatbelt对Docker套接字与二进制文件的沙盒隔离。版本:https://github.com/google-gemini/gemini-cli/releases/tag/v0.56.0-nightly.20260822.g5411f113c[7]

Codex发布rust-v0.150.0-alpha.6

Codex发布rust-v0.150.0-alpha.6版本,当前摘要未披露具体变更。版本地址:https://github.com/openai/codex/releases/tag/rust-v0.150.0-alpha.6[8]

技巧教程

Sharp模板集成NInfer后输出Token减少42%

社区将Sharp提示模板集成NInfer,在【相同速度】下声称减少42%输出Token。参考:https://www.reddit.com/r/LocalLLaMA/comments/1vv3b6o/sharp_template_to_ninfer_42_output_tokens_same/[3]

GLM-5.2本地推理中ubatch size影响显著

实测显示ubatch size会明显影响GLM-5.2量化模型吞吐,涉及多张RTX PRO 6000的参数调优。详情:https://www.reddit.com/r/LocalLLaMA/comments/1vv628b/glm52_local_inference_ubatch_size_made_a_much/[5]

社区讨论llama.cpp多AMD显卡分配请求

实践者探索用llama.cpp将请求分配至多张AMD显卡,重点关注PCIe通信瓶颈与资源利用。讨论:https://www.reddit.com/r/LocalLLaMA/comments/1vv69vu/have_llamacpp_spread_requests_across_multiple/[6]