本期重点聚焦商业Agent评测Agent持续进化。本地推理工具、浏览器自动化及多智能体协作也出现实用更新。

模型动态

Qwen发布CommerceAgentBench评测商业智能体能力

Qwen发布CommerceAgentBench,面向真实商业流程评估Agent,并称Qwen3.8-Max在开源权重模型中整体领先。详情:https://x.com/Alibaba_Qwen/status/2094641743056732205[1][1]

WikiSkill让Agent沉淀任务经验并持续进化

Google Research提出WikiSkill框架,将Agent执行任务时的踩坑经验沉淀为持久技能库,支持后续任务复用。详情:https://t.co/BFXDUUgFdY[5]

清华AIR与域变换提出可自进化的具身WAM框架

研究团队提出具身In-Context Causal Learning与WAM框架,在参数冻结下实现能力提升,面向机器人学习与世界模型。详情:https://www.qbitai.com/2026/09/482337.html[7]

产品工具

Browser Use推出CLI降低浏览器Agent开发门槛

Browser Use CLI让AI智能体更方便调用和操作浏览器,可用于自动化任务与工作流集成。详情:https://x.com/browser_use/status/2094649145244135570[2]

ExLlamav3更新本地推理卸载与模型支持

ExLlamav3新增CPU卸载MoE专家、磁盘卸载及GLM、Qwen模型支持,并加入自校准优化,提升有限显存设备的推理效率。项目讨论:https://www.reddit.com/r/LocalLLaMA/comments/1w44jnv/exllamav3_recent_updates_cpu_offload_glm53flash/[3]

社区为Qwen3.8-Flash-Next-GGUF加入MTP支持

社区发布MTP支持,面向Qwen3.8-Flash-Next-GGUF提升本地推理吞吐,适合消费级GPU部署。详情:https://www.reddit.com/r/LocalLLaMA/comments/1w42biu/mtp_released_for_qwen38flashnextgguf/[4]

Codex rust-v0.152.0正式版增强终端与MCP能力

Codex更新rust-v0.152.0,新增Vim搜索、凭据刷新提示、扩展MCP名称格式,并支持单工具输出Token限制。详情:https://github.com/openai/codex/releases/tag/rust-v0.152.0[8]

技巧教程

xAI内部实践展示多Grok Bot协作工作流

xAI分享五类Grok Bot实践:通过长期记忆、工具、云端电脑和Bot互派任务,协作完成项目、运营与拓客。详情:https://t.co/7wHnMh7Xxg[6]