本期重点关注Agent真实评测具身智能进展:DeepSeek-V4-Pro在Agent Arena表现和成本均有突破,机器人模型正从单点能力走向长程任务执行。

模型动态

DeepSeek-V4-Pro升至Agent Arena开源模型第二

DeepSeek-V4-Pro性能提升6.3%,单任务中位成本仅0.21美元;代码、工作分类均列开源模型第二。[2][2]

相同GRPO配方在不同规模模型上产生不同结果

研究者在三个从零训练模型上复用SFT与GRPO流程,结果差异明显,性能与模型规模没有简单对应关系。https://www.reddit.com/r/MachineLearning/comments/1vszsit/same_grpo_recipe_on_three_fromscratch_llms/[7]

产品工具

OpenAI开源Codex Harness助力企业将Agent接入现有工具

Codex Harness负责Agent循环,企业可自行控制界面、上下文、工具与审批,接入内部应用和运营看板。https://t.co/shi2vwqxh4[1]

原生macOS工具集中管理各类编码Agent会话

Rust+GPUI应用支持按Agent和项目浏览,以SQLite全文搜索检索中文与代码,并可一键恢复原项目会话。https://t.co/1zZHNiNHzp https://t.co/hgVQthafMW[8]

硬件动态

墨奇智能发布具身智能模型架构MoRA

墨奇智能首次系统展示MoRA架构,并通过机器人完成长程任务,体现具身智能向复杂任务执行演进。https://www.qbitai.com/2026/08/476078.html[3]

行业资讯

华尔街实测显示千问办公Agent综合排名第一

华尔街实测8款主流Agent,千问在办公场景综合排名第一;报道同时强调成本是商业化关键。https://www.qbitai.com/2026/08/476070.html[4]

Agent Arena转向大规模真实长程任务评测

Agent Arena基于全球用户真实任务,允许模型调用搜索、文件系统和终端,重点衡量任务结果而非单项分数。https://x.com/arena/status/2090240608447418869[5]

Harrison Chase:Agent评测市场缺少自动改进闭环

当前市场充斥可观测性与评测平台,但缺少能建议修复并自动补充评测的Agent系统,闭环调优或成新机会。https://x.com/hwchase17/status/2090233856192569500[6]