本期亮点:OpenAI Codex桌面应用【使用量增长6倍】周活超500万,显示AI编程工具普及加速;LangChain发布Fleet agents企业集成新方案,支持Slack/Teams渠道;本地推理社区Ornith-1.0-35B迎来原生MTP投机解码优化,单GPU推理速度提升。

模型动态

Ornith-1.0-35B GGUF更新:原生MTP投机解码,单GPU推理速度提升30-35%

Ornith-1.0-35B模型GGUF版本更新,实现原生MTP投机解码,单GPU推理速度提升至【1.3-1.35倍】,对本地推理优化有重要参考。项目地址:https://www.reddit.com/r/LocalLLaMA/comments/1ui4yn6/ornith1035b_gguf_update_native_mtp/[4]

产品工具

LangSmith推出沙盒、评估等工程能力更新,助力构建agent飞轮

Harrison Chase介绍LangSmith新增沙盒环境评估工具和模型集成能力,旨在帮助开发者构建和优化agent飞轮[1]

Fleet agents可集成到Slack、Teams等企业协作渠道

LangChain推出Fleet agents新功能,支持在【Slack、Teams】等企业渠道中分发AI agent,提供企业级协作集成方案。[2]

OpenAI Codex桌面应用使用量自2月以来增长6倍,周活超500万

OpenAI Codex桌面应用自2月以来【使用量增长6倍】,周活跃用户超500万,几乎全体OpenAI员工日常使用,AI编程工具加速普及。[3]

技巧教程

分享监控llama.cpp内存使用脚本,帮助优化本地模型运行

有开发者分享了监控llama.cpp内存使用情况的脚本,帮助用户在有限硬件上分析和优化模型运行资源消耗,实用性强。脚本地址:https://www.reddit.com/r/LocalLLaMA/comments/1ui0u4v/script_to_monitor_llama_cpp_and_analyze_memory/[6]

行业资讯

社区热议开源模型与开放权重区别,触及AI开源核心争议

Reddit r/LocalLLaMA社区讨论【开源模型】与【开放权重】的区别,涉及GLM 5.2、Nemotron等模型,触及开源AI社区对许可和透明度的核心争议。[5]