本期重点关注AI自主对齐研究进展,以及【科研智能工作流】和Agent生产化的新实践。多家公司同时披露了智能体评测、成本控制与现实任务执行方面的落地案例。

产品工具

OpenAI推出连接科研问题与专业模型的Rosalind Workbench

Rosalind Workbench将科研问题、专业模型、工具与可审查输出整合到同一流程,覆盖蛋白质分析和测序任务。详情:https://t.co/03b2Q4gfaF[6]

Browser Use推出无需等待名单的iMessage浏览器智能体

该智能体可通过iMessage执行预订旅行、购物和日程安排等现实任务,拓展浏览器自动化的消息入口。[7]

Vercel展示可导出完整代码仓库的eve智能体

eve提供包含运行时、模型、技能、工具、连接器和沙箱的完整Git仓库,提升智能体实现的可控性与可迁移性。[8]

Databricks升级Genie One推动洞察转化为行动

Genie One新增能力,让AI从回答问题进一步驱动业务执行,强化企业数据分析与Agent工作流连接。详情:https://www.databricks.com/blog/beyond-answers-new-genie-one-features-turn-insights-action[9]

技巧教程

AWS分享Decathlon用Chronos-2进行大规模需求预测

Decathlon将【时间序列基础模型】Chronos-2用于全球零售需求预测,展示模型在企业生产环境中的规模化应用。详情:https://aws.amazon.com/blogs/machine-learning/how-decathlon-runs-demand-forecasting-at-scale-with-chronos-2/[10]

Clay分享每月3亿次运行的Agent评测实践

Clay采用四象限评估、生产到评估闭环及数据湖方案,支撑每月超过3亿次智能体运行。详情:https://x.com/LangChain/status/2093411543186649542[11]

UnifyGTM将智能体推理成本降低90%至95%

UnifyGTM上线前优化推理链、上下文和工具调用,使单条消息成本降低90%至95%,凸显Agent生产化的成本控制价值。详情:https://x.com/LangChain/status/2093398502063698292[12]

行业资讯

Anthropic探索由AI自主完成模型对齐

Claude仅用48小时1块GPU自主研究、训练并测试对齐方法,在10类失配问题上提升安全性且保持能力。报告:https://t.co/XpiMxgOonm[1][2][1][3][4][2][5][3]