本期重点聚焦【智能体开发工具】与模型部署优化:OpenAI、LangChain、Devin持续完善协作和发布流程,Muse Spark 1.2则在长时程Agent评测中取得明显进步。

模型动态

Muse Spark 1.2在Agent Arena实现2.3倍净提升

Muse Spark 1.2 xHigh净提升由0.9%升至2.1%,Bash错误恢复达11.4%,但部分交互指标回落。[6][6][7]

LFM2.5-DSpark推理优化最高提速3.2倍

Hugging Face发布LFM2.5-DSpark推理优化方案,宣称最高【3.2倍速度提升】。详情:https://huggingface.co/blog/LiquidAI/lfm25-dspark[8]

产品工具

Exa插件让ChatGPT与Codex接入海量网络资料

OpenAI推出Exa插件,可让ChatGPT Work与Codex访问【1000亿+网站、论文和文档】。[1]

ChatGPT Sites支持多人协作编辑与自动化代码管理

ChatGPT Sites新增【协作者编辑】功能,成员可共同修改项目,Codex负责Git管理与CI流程。[3]

Devin将Slack Code集成到编码智能体工作流

Devin接入Slack Code,可主动创建专用代码频道,集中处理团队开发任务与持续协作。[4]

LangSmith Deployment预览构建进入公开测试

LangSmith支持从PR分支自动创建临时Agent部署,开发者可在合并前验证行为、追踪与反馈。[5]

技巧教程

本地模型大横评将覆盖量化精度与思考强度

karminski-牙医将测试多款模型的3至8bit量化及Qwen3.8-27B六档思考强度,提供本地部署选型参考。[2]

行业资讯

Gemma系列开放模型下载量突破十亿

Google宣布Gemma下载量突破10亿,显示其开放模型生态已形成广泛开发者采用。[9]