本期重点:GLM-5.2正式发布并开源,在多个评测中表现突出;Anthropic分析Claude Code的40万次会话数据,揭示AI编码行为模式。

模型动态

智谱发布GLM-5.2,MIT开源且多项评测领先

智谱GLM-5.2以MIT许可证开源,支持1M上下文。在Agent Arena排名第10(开放模型第1),Code Arena前端排名第2,并成为首个在Terminal-Bench超80%的开放权重模型。API定价与5.1相同。项目地址:https://github.com/THUDM/GLM-5.2[1][2][3][4][5][6][7]

产品工具

MiniMax M3在Agent Arena排名第18,成为第5开放模型

MiniMax M3在Agent Arena排行榜上升至第18位,超越前代M2.7,在任务成功率和bash错误修复上提升明显,工具幻觉保持行业最低。成为排名第5的开放权重模型。[8]

OpenAI Codex扩展至欧洲更多地区,新增多项功能

OpenAI宣布Codex正在欧洲经济区、英国和瑞士扩展,新增计算机使用、Chrome扩展、【个性化记忆】和Chronicle功能。[9]

Manus新增消息排队功能:任务运行时可提前输入指令

Manus更新支持在任务运行期间排队消息,用户可在任务完成前输入后续指令,提升多步骤工作流的连贯性。[13]

技巧教程

AWS SageMaker AI推出P-EAGLE并行推测解码

AWS宣布在SageMaker上实现P-EAGLE并行推测解码,可显著提升LLM推理吞吐并降低延迟,适用于生产部署场景。[14]

硬件动态

Google Cloud推出Brazos液冷系统,支持1000W+芯片散热

Google Cloud发布Brazos液冷技术,专为超过1000W的下一代AI芯片设计,可集成至现有风冷数据中心,解决高功耗散热瓶颈。[15]

行业资讯

Anthropic发布Claude Code经济研究:超半数会话用于写代码

Anthropic分析40万次Claude Code会话发现,超50%用于编写或修复代码,近1/5用于操作软件。该研究框架可追踪Claude Code规模化后的任务价值变化。[10][11]

OpenAI提出模拟部署方法以预判模型实际行为

OpenAI分享新研究:通过模拟部署用真实匿名用户请求测试候选模型响应,可提前预测模型行为。该方法有助于在发布前发现风险。[12]