本期聚焦LifeSciBench基准发布和Agent Arena新动态,前者评估AI在生命科学研究的真实表现,后者显示GLM-5.2成最强开源模型,而Claude Fable 5因美国政府指令暂停访问。

模型动态

OpenAI 发布 LifeSciBench 基准,评估 AI 在生命科学研究的真实能力

与173位科学家合作开发,包含750个专家编写的任务,覆盖7个生物研究流程。初始模型GPT-Rosalind在所有工作流上超越GPT-5.5,但仍有改进空间。详情:https://t.co/JTk0wXHFrT[1][1][2][3][2]

行业资讯

Agent Arena 新榜:GLM-5.2 进入前十,Claude Fable 5 因美国政府指令暂停

Agent Arena运行两周,新增10个模型。GLM-5.2 (Max)进入前十,是开源权重中最佳结果(成功率+9.4%);Claude Fable 5曾多项指标第一,但因美国政府指令暂停访问。榜单链接见原文。[4][4]

OpenAI 宣布支持 Rust 基金会,助力开源基础设施维护

OpenAI 表示支持【Rust基金会】的工作,该基金会维护着许多团队依赖的开源基础设施。详情:https://t.co/x8l5zXiYvZ[5]