本期重点关注GPT-6 Astra的新评测争议与安全风险,以及Atlas空间智能模型发布。与此同时,Agent产品设计、开放权重模型采用和安全编码实践也出现了值得关注的新进展。

模型动态

GPT-6 Astra评测暴露专有Harness与隐性推理问题

新评论称Astra具备较高Token效率和Computer Use能力,但专有Harness可能放大成绩;关闭思维链后自主运行时间显著增加,带来安全风险。https://x.com/vista8/status/2095798300385636810[1]

World Labs发布Atlas空间智能世界模型

World Labs推出Atlas空间智能模型,通过新视角预测构建三维世界理解,区别于语言模型预测下一词、视频模型预测下一帧。https://x.com/a16z/status/2095882301032828932[2]

产品工具

Grok Bot重新设计长期自主工作的产品界面

Grok Bot团队将长期负责人置于界面中心,并补充身份、状态、工作空间、产物和主动触发机制,弱化用户持续监督。https://x.com/xiaohu/status/2095874831204135413[3][4]

技巧教程

Stack Overflow总结安全优先的AI编码代理设计

文章强调提示词不能充当严格安全边界,并从权限控制和软件供应链安全角度讨论如何构建默认安全的AI编码代理。https://stackoverflow.blog/2026/09/04/how-to-build-a-secure-by-default-ai-coding-agent/[9]

Cordis解析DeepSeek Harness的Agent运行时架构

腾讯文章介绍Cordis从QQ机器人插件系统演变为DeepSeek Harness运行时的过程,重点解析插件化、协作机制和【动态配置】设计。https://mp.weixin.qq.com/s?__biz=MjM5ODYwMjI2MA==&mid=2649803959&idx=1&sn=9d18ecc2139e8ab90a44515ca64b0db5[10]

行业资讯

Ollama披露开放权重模型的企业采用趋势

Ollama称平台已服务【900万开发者】和85%财富500强企业;YC访谈显示,创业公司对开放权重模型和编码代理的兴趣持续上升。https://x.com/ycombinator/status/2095883627200659800[5][6]

LangSmith发布数十亿次Agent运行数据观察

LangChain基于数十亿次Agent运行分析模型采用情况,GPT-4o-mini覆盖组织最多,GPT-4.1-mini承担较高调用量,DeepSeek V4 Flash进入开放权重榜单。https://x.com/LangChain/status/2095889903313698075[7][8]