本期重点:OpenAI推出Codex Record & Replay录制工作流为技能,并发布GPT-5.5 Instant在健康领域表现媲美前沿思考模型;Anthropic展示Claude编程机器狗速度提升20倍;Devin Review新增自动安全审查;Hugging Face发布MosaicLeaks研究测试代理保密性。

模型动态

OpenAI发布GPT-5.5 Instant,健康问答能力与前沿思考模型持平

GPT-5.5 Instant在健康相关问题上与【前沿思考模型】持平,每周超2.3亿用户使用ChatGPT咨询健康问题。模型经全球数百名医生反馈训练,免费用户可用。[3][4][5][3][5]

产品工具

OpenAI Codex推出Record & Replay功能,可录制工作流为可编辑技能

OpenAI为Codex推出Record & Replay功能,用户可录制重复性工作流(如报销、请假)并转为可编辑的【技能】,支持控制录制起止。正在部分市场灰度测试。[1][2]

Cognition Devin Review新增自动安全审查,自动发现漏洞并生成修复PR

Devin Review现在每个PR自动进行安全审查,发现扫描器遗漏的漏洞,按严重程度排名并附带CWE ID,自动生成可合并的修复PR[8][9][10]

行业资讯

Anthropic公开Project Fetch第二阶段:Claude编程机器狗速度提升20倍

Anthropic发布Project Fetch第二阶段结果,Opus 4.7单独编程速度比去年最佳人类团队快约【20倍】,但机器狗仍未能成功取回沙滩球。详情:https://t.co/CgbBtRf85e[6][6][7][7]

Hugging Face发布MosaicLeaks研究:测试研究代理能否保守秘密

Hugging Face发布MosaicLeaks研究,测试研究代理在任务中能否保守秘密,评估AI安全与隐私边界。论文地址:https://huggingface.co/blog/ServiceNow/mosaicleaks[11]