本期重点是Grok 4.6编程能力跃升,以及DeepSeek V4-Pro以低成本进入前沿模型梯队。微信公布WeLM模型,AI长片制作也出现新突破。

模型动态

Grok 4.6进入网页开发模型第一梯队

Grok 4.6WebDev获1618分、升至第7。Devin称其擅长代码探索与根因分析,内部成绩仅落后Opus 5和Fable 5。[1][2][3][1][4]

DeepSeek V4-Pro发布并获首批开发任务实测

V4-Pro-0813为1.6T参数、49B激活、1M上下文,Terminal Bench提升15.8%。用户实测建站与3D游戏尚可,但并发仅500且价格将涨。[5][6][7]

Claude 5输出明显变长且句式更复杂

数万条输出显示,Opus 5平均510词,是4.5版的【3倍】,句长增加58%。其词汇反而更简单;Fable 5比Opus 5精简38%。[8][8]

微信公布两款WeLM模型并落地小微助手

WeLM-80B每次激活30亿参数,已驱动微信小微助手,可调用原生功能和小程序。更大的WeLM-617B每次激活230亿参数。[9]

产品工具

OlmoEarth支持导出定制地球观测嵌入

OlmoEarth开放嵌入导出。用于检索、聚类。https://huggingface.co/blog/allenai/olmoearth-embeddings[10]

LangSmith推出AWS自带云部署模式

LangSmith现支持部署至客户自有【AWS云】,智能体追踪数据留在企业边界。LangChain继续负责升级、扩缩容与运维支持。[11]

技巧教程

LangChain演示构建自动化社交媒体智能体

教程用Managed Deep Agent扫描Hacker News和X,自动生成三条帖子并发送至Slack。流程涵盖自定义工具、Slack集成与持久记忆[13]

行业资讯

Higgsfield完成110分钟AI剧情长片

Higgsfield与Cully Games用【4周】制作一部110分钟AI长片,成本200万美元。真人演员仅授权肖像,Prompt、素材和角色均【免费公开】。[12]