GLM-5.3 Max进入Arena接受真实任务评测,社区关注其长程终端能力跃升;LangChain OSS与Agent可观测文档同步更新。

模型动态

GLM-5.3 Max进入Agent与Code Arena

GLM-5.3 Max已开放投票,覆盖长程Agent任务及WebDev,正式分数待公布。[1][2]

GLM-5.3终端评测成绩引发社区关注

社区称其Terminal Bench 3.0成绩约增【6倍】,推测【黑盒API】与复杂规划能力显著增强。[3][4]

Grok 4.6高难度浏览器任务完成105项

Browser Use称其完成105/106项任务,接近Opus 5且成本低约40%,尚待独立验证。[9]

产品工具

LangChain OSS新版扩展模型与工具调用支持

新版加入OpenAI 3.0 SDKGemini 3.7 Flash,并改进结构化输出错误处理。[5]

技巧教程

运动分析Skill可生成骑行与跑步轨迹视频

用户实测用运动分析Skill制作轨迹视频,支持【徒步、骑行和跑步】。https://t.co/CFYnn0MCHg[6]

生成标签再检索可处理超大分类体系

先让模型【生成候选标签】,再用嵌入搜索映射现有标签。https://simonwillison.net/2026/Aug/14/dont-classify-hallucinate/[7]

Databricks总结数据仓库AI Functions用法

教程介绍用AI Functions处理非结构化数据并接入分析流程。https://www.databricks.com/blog/using-aifunctions-your-data-warehouse-top-use-cases[8]