Claude Anthropic分享使用多智能体框架提升Claude软件工程能力 Anthropic工程博客介绍了如何使用多智能体框架来提升Claude在前端设计和长期自主软件工程任务中的能力。这代表了AI智能体架构的重要技术进展。博客链接:https://t.co/HWvmXk1ykn[1][1]
开源工具ProofShot让AI Agent录制视频证明代码有效 针对AI Agent常声称完成任务但实际代码存在问题的痛点,ProofShot通过让AI【录制视频】来证明代码真的能运行。该项目【开源】且安装简单。项目地址:https://t.co/ZYq1xdZjf2[5]
OpenAI OpenAI发布基于提示词的青少年安全策略 OpenAI为gpt-oss-safeguard发布了提示词驱动的【青少年安全】策略。这些策略旨在帮助识别和审核青少年相关内容,并将安全要求转化为用于实时过滤或离线分析的分类器。详情:https://t.co/t5i1CZNLnF[6]
Manus Manus AI平台限时推出任务消耗积分减半活动 Manus宣布,从现在到3月30日,用户在Manus Desktop上运行的每个任务消耗的积分减少50%。这意味着用户可以以一半的成本获得相同的任务结果。[8]
OpenAI / Notion 开发者分享使用Codex独立构建Notion AI语音输入功能的经验 开发者Ryan仅凭自己,利用Codex成功构建了Notion的AI语音输入功能。他通过让Codex理解上下文并参考现有移动端功能,最终将该功能发布到网页和桌面端。[7]
Claude Anthropic经济指数揭示用户使用Claude的行为演变 报告显示,随着经验增长,用户更倾向于与Claude进行仔细迭代,而非给予完全自主权。长期用户会尝试【更高价值】的任务,并获得更成功的响应。同时,用户任务分布更加分散,前10大任务占比下降。[2][3][2]
Cognition Labs与Mercor AI合作推出软件工程新基准APEX-SWE 双方合作推出APEX-SWE基准测试,旨在评估AI模型在现实软件工程任务上的表现,以解决传统编码基准无法反映实际软件构建和维护过程的问题。[4]