本期重点:Code Arena发布Image-to-WebDev新榜,Opus 5领跑;DeepSeek V4 Flash本地部署与成本效率涌现新进展;具身智能刷榜乱象引发关注。

模型动态

Code Arena新增Image-to-WebDev评测:Opus 5居首,GPT-5.6/Grok/Kimi等紧随

Code Arena公布Image-to-WebDev排名,Opus 5 (Max)以1669分领先,GPT-5.6 Sol、Grok-4.5、Kimi K3、Muse Spark 1.1等均有上榜,展示多模态编码与工具调用能力。榜单详情:https://x.com/arena/status/2083596490539511856[1][1][2][3][4]

llama.cpp新增DeepSeek V4 Flash工具调用修复,社区量化测试数据频出

llama.cpp合并针对DeepSeek V4 Flash 0731工具调用问题的修复,解决循环和表现不佳问题;社区同时分享Q3_K_XL、IQ2_M等量化下在3090/3060的实测速度,为低端硬件部署提供参考。PR:https://www.reddit.com/r/LocalLLaMA/comments/1vcwaag/fix_for_deep_seek_v4_flash_0731_tool_calling_has/[5][6][7][8]

Cline:DeepSeek V4-Flash单token便宜但任务成本可能更高,实测105倍成本优势

Cline指出DeepSeek V4-Flash虽然单token价格低,但更少轮次可能导致任务总成本更高;不过ArtificialAnlys报告DeepSeek以【105倍更低成本】完成同样benchmark任务,效率优势明显。[9]

产品工具

OpenCode发布v1.18.11:修复MCP SSE重连循环与推理字段配置

OpenCodev1.18.11修复MCP SSE连接在错误响应后陷入重连循环的问题,优化交错推理字段配置,并支持在系统浏览器中打开外部链接。发布详情:https://github.com/anomalyco/opencode/releases/tag/v1.18.11[12]

行业资讯

创业邦调查:具身智能榜单成刷榜生意,超20个榜单每周制造'全球第一'

报道揭示具身智能赛道榜单刷榜产业链:超20个榜单每周炮制'全球第一',伴随融资热潮或存泡沫风险,对投资人和行业观察者有参考价值。原文:https://mp.weixin.qq.com/s?__biz=MjM5OTAzMjc4MA==&mid=2650885189&idx=3&sn=72b21a17bcce6c8fadaf78dae1c27299[10]

Ethan Mollick:AI正让每个人都成为兼职工程师和营销人员

转发引用宝洁OpenAI研究,发现组织边界正变得可渗透,AI正模糊岗位职责,推动每个人同时承担工程与营销角色,影响工作方式和组织结构。[11]