Cognition 推出 FrontierCode 高难度代码评测基准 Cognition发布FrontierCode,包含150/100/50个任务,每项由顶级开源维护者耗时40+小时制作,首次评估代码【可维护性】。SOTA模型在Diamond集仅得13.4/100分。博客详情:https://cognition.ai/blog/frontier-code[1][2][3]
Langchain LangChain 发布 Deep Agents 开源框架及 Sandboxes 沙箱环境 Deep Agents支持计划、工具调用、子代理委派、文件写入等长周期任务。同时推出LangSmith Sandboxes为Agent提供独立计算环境,以及LangSmith Fleet支持在对话中创建编辑文档和网页。[4][5][6]
Runway Runway 上线 Aleph 2.0 视频编辑模型,支持智能扩宽画面 上传视频后选择目标宽高比,Aleph 2.0自动填充画面剩余区域,使视频适配不同平台格式。已在桌面网页版开放使用。[7]
Gemini Google Gemini App 推出 Canvas 功能,一键生成复古绘图体验 用户请求Gemini 3.5 Flash还原早期2000年代PC绘图画板,模型一次生成Canvas应用,支持绘画和互动创作。[8]
Agent Arena 上线,基于百万真实会话评估智能体能力 Agent Arena提供Agent Mode进行深度研究等任务,排行榜基于5个行为信号(确认成功、赞誉/抱怨、可操控性、Bash恢复、工具幻觉),地址:http://arena.ai/agent[9][10][11]