本期重点关注AI智能体在软件工程领域的应用进展,包括Anthropic的多智能体框架、Cognition的新基准APEX-SWE以及解决AI Agent代码验证问题的开源工具ProofShot

模型动态

Anthropic分享使用多智能体框架提升Claude软件工程能力

Anthropic工程博客介绍了如何使用多智能体框架来提升Claude在前端设计和长期自主软件工程任务中的能力。这代表了AI智能体架构的重要技术进展。博客链接:https://t.co/HWvmXk1ykn[1][1]

产品工具

开源工具ProofShot让AI Agent录制视频证明代码有效

针对AI Agent常声称完成任务但实际代码存在问题的痛点,ProofShot通过让AI【录制视频】来证明代码真的能运行。该项目【开源】且安装简单。项目地址:https://t.co/ZYq1xdZjf2[5]

OpenAI发布基于提示词的青少年安全策略

OpenAI为gpt-oss-safeguard发布了提示词驱动的【青少年安全】策略。这些策略旨在帮助识别和审核青少年相关内容,并将安全要求转化为用于实时过滤或离线分析的分类器。详情:https://t.co/t5i1CZNLnF[6]

Manus AI平台限时推出任务消耗积分减半活动

Manus宣布,从现在到3月30日,用户在Manus Desktop上运行的每个任务消耗的积分减少50%。这意味着用户可以以一半的成本获得相同的任务结果。[8]

技巧教程

开发者分享使用Codex独立构建Notion AI语音输入功能的经验

开发者Ryan仅凭自己,利用Codex成功构建了Notion的AI语音输入功能。他通过让Codex理解上下文并参考现有移动端功能,最终将该功能发布到网页和桌面端。[7]

行业资讯

Anthropic经济指数揭示用户使用Claude的行为演变

报告显示,随着经验增长,用户更倾向于与Claude进行仔细迭代,而非给予完全自主权。长期用户会尝试【更高价值】的任务,并获得更成功的响应。同时,用户任务分布更加分散,前10大任务占比下降。[2][3][2]

Cognition Labs与Mercor AI合作推出软件工程新基准APEX-SWE

双方合作推出APEX-SWE基准测试,旨在评估AI模型在现实软件工程任务上的表现,以解决传统编码基准无法反映实际软件构建和维护过程的问题。[4]