OpenAI OpenAI 发布 LifeSciBench 基准,评估 AI 在生命科学研究的真实能力 与173位科学家合作开发,包含750个专家编写的任务,覆盖7个生物研究流程。初始模型GPT-Rosalind在所有工作流上超越GPT-5.5,但仍有改进空间。详情:https://t.co/JTk0wXHFrT[1][1][2][3][2]
Claude / Zhipu Agent Arena 新榜:GLM-5.2 进入前十,Claude Fable 5 因美国政府指令暂停 Agent Arena运行两周,新增10个模型。GLM-5.2 (Max)进入前十,是开源权重中最佳结果(成功率+9.4%);Claude Fable 5曾多项指标第一,但因美国政府指令暂停访问。榜单链接见原文。[4][4]
OpenAI OpenAI 宣布支持 Rust 基金会,助力开源基础设施维护 OpenAI 表示支持【Rust基金会】的工作,该基金会维护着许多团队依赖的开源基础设施。详情:https://t.co/x8l5zXiYvZ[5]