本期聚焦GLM-5.2在编码竞技场超越Claude Opus 4.8 ThinkingCerebras启动大使计划,以及a16z揭示机器人和AI原生创业资本趋势。

模型动态

GLM-5.2在Code Arena编码排名超越Claude Opus 4.8 Thinking

GLM-5.2 (Max)在Code Arena的Frontend编码任务中排名高于Claude Opus 4.8 (Thinking),Arena公布了10组单次生成对比示例。[1]

AA-Briefcase排行榜评估现实任务,Nemotron 3 Ultra开放模型领先

AA-Briefcase新排行榜评估现实任务,Nemotron 3 Ultra在开放模型中表现突出,NVIDIA AI转发宣布。[4]

产品工具

开发者用Vibe Coding为女儿打造互动游戏,获赞审美出色

好友陈言为女儿开发互动游戏,界面、交互、配乐出色,内容情节和对话精彩,是Vibe Coding的亲子实践。体验地址见评论区。[3]

Vercel AI SDK Harness API新增对OpenCode和LangChain Deep Agents支持

Vercel AI SDK Harness API新增统一支持OpenCodeLangChain Deep Agents,简化代理部署。[8]

技巧教程

LangChain讨论构建代理时MCP vs CLI的最佳实践

LangChain团队分享在构建AI代理时选择MCP还是CLI的最佳实践与经验。[9]

行业资讯

Cerebras启动全球大使计划招募AI社区建设者

Cerebras宣布启动Ambassador Program,寻找AI社区建设者。已在柏林、墨西哥城等多地举办Cafe Compute Meetups,目标扩展更多城市。[2]

Stanford AI Lab发布Auto-psych,AI自动完成心理学研究全流程

Auto-psych系统让AI代理自动提出理论、设计实验、分析数据,实现心理学研究全流程自动化。[5]

a16z:风险投资激增机器人领域,AI原生公司资本效率更高

a16z最新图表显示VC对机器人兴趣激增;同时AI原生初创公司消耗更少资本,展现效率优势。[6][7]