本周多个重磅产品与新工具发布,Cognition推出高难度代码评测基准FrontierCodeLangChain发布开源Deep Agents框架及LangSmith SandboxesRunway上线Aleph 2.0视频编辑模型,Gemini App带来Canvas绘图功能,同时a16zAnthropic分享AI行业洞见,Agent Arena正式上线评估智能体。

模型动态

Cognition 推出 FrontierCode 高难度代码评测基准

Cognition发布FrontierCode,包含150/100/50个任务,每项由顶级开源维护者耗时40+小时制作,首次评估代码【可维护性】。SOTA模型在Diamond集仅得13.4/100分。博客详情:https://cognition.ai/blog/frontier-code[1][2][3]

产品工具

LangChain 发布 Deep Agents 开源框架及 Sandboxes 沙箱环境

Deep Agents支持计划、工具调用、子代理委派、文件写入等长周期任务。同时推出LangSmith Sandboxes为Agent提供独立计算环境,以及LangSmith Fleet支持在对话中创建编辑文档和网页。[4][5][6]

Runway 上线 Aleph 2.0 视频编辑模型,支持智能扩宽画面

上传视频后选择目标宽高比,Aleph 2.0自动填充画面剩余区域,使视频适配不同平台格式。已在桌面网页版开放使用。[7]

Google Gemini App 推出 Canvas 功能,一键生成复古绘图体验

用户请求Gemini 3.5 Flash还原早期2000年代PC绘图画板,模型一次生成Canvas应用,支持绘画和互动创作。[8]

Agent Arena 上线,基于百万真实会话评估智能体能力

Agent Arena提供Agent Mode进行深度研究等任务,排行榜基于5个行为信号(确认成功、赞誉/抱怨、可操控性、Bash恢复、工具幻觉),地址:http://arena.ai/agent[9][10][11]