OpenAI OpenAI新模型GPT-5.2-chat-latest进入LMArena前五 据LMArena榜单,GPT-5.2-chat-latest以1478分位列第五,与Gemini-3-Pro持平,在编码和指令跟随类别表现突出,较前代提升40分。[5][6][6][5]
OpenAI OpenAI调整编码评估标准,因SWE-bench Verified已饱和 OpenAI建议改用SWE-bench Pro作为前沿编码评估标准,称因测试设计问题和公共仓库污染,原SWE-bench Verified已饱和,行业需建立更强基准。[9]
OpenAI OpenAI发布gpt-realtime-1.5语音模型,多项能力显著提升 gpt-realtime-1.5在Realtime API中上线,带来更可靠的指令跟随和工具调用,内部评估显示Big Bench Audio推理能力提升5%,转录准确率提升10.23%。[7][8]
Google发布多模态函数调用与Veo 3.1视频模板更新 Gemini Interactions API现支持【多模态函数调用】,工具可直接返回图像。同时Gemini App上线Veo 3.1新模板,可用【参考图片和描述】生成视频。教程:https://www.philschmid.de/interactions-multimodal-fc[10][11][12]
Cognition发布Devin Review,可智能修复PR代码问题 Devin Review重新设计代码审查界面,能自动发现PR问题并直接修复,用户可在界面内应用改动,无需离开平台。项目地址:https://devinreview.com[13][14]
Claude / DeepSeek / Kimi Anthropic指控DeepSeek、月之暗面等发起工业规模蒸馏攻击 Anthropic称识别到来自DeepSeek、Moonshot AI和MiniMax的工业级蒸馏攻击,涉超2.4万虚假账号及1600万次对话,用于提取Claude能力训练自家模型,引发对模型安全的讨论。链接:https://www.anthropic.com/news/detecting-and-preventing-distillation-attacks[1][2][3][1][2][4]