本期重点:DeepSeek V4-Flash在智能指数与象棋基准上逼近/超越前沿模型,本地部署趋势加速;B200GPU 极度稀缺恐推高推理成本;Cloudflare 开启Agents Week,多款本地 AI 工具与框架亮相。

模型动态

DeepSeek V4-Flash 智能指数得分50逼近GPT-5.4,Cline预测本地模型2年内成主流

Artificial Analysis智能指数显示,DeepSeek V4-Flash 得分50,逼近此前 GPT-5.4 xhigh 的51。Cline 称 r/LocalLLaMA 用户已在 Mac M2 Ultra 上运行该模型,预测本地模型2年内成为多数选择。[1]

DeepSeek-V4-Flash-0731 国际象棋基准超越 Fable-5、Sol 和 Kimi-K3

社区测评显示,DeepSeek-V4-Flash-0731 在国际象棋基准上超越 Fable-5、Sol 和 Kimi-K3,展示特定推理任务的能力提升[5]

产品工具

Cloudflare 开启 Agents Week,提出 Agent Cloud 概念

Cloudflare 发布Agent Cloud概念,探讨为 AI 代理时代专门构建的基础设施,官方博客已上线。面向开发者的云平台与代理结合趋势值得关注。原文:https://blog.cloudflare.com/agents-week-welcome/[3]

Code Pilot 0.64.0 全平台支持,恢复 Linux 版本

Code Pilot 已成为全平台软件,支持 Cloud Code、AI SDK、CodeX 三种 Agent 框架切换及主流 Token Plan,0.64.0 重新加入Linux 版本,适合 Linux 用户试用。[4]

Parlor v2:M3 Pro 上实现完全本地 GPT-Live 克隆

开发者分享在 Mac M3 Pro 上构建Parlor v2,实现完全本地的 GPT-Live 实时语音交互。过程包括微调 Gemma 4 12B 失败后改方案,适合本地语音助手开发者参考。[6]

GraphARC:为 AI 代理增加图工程能力的开源工具

开源仓库GraphARC上线,通过图工程减少代理执行中的意外行为,提升复杂任务处理能力。适合复杂 Agent 开发参考。[7]

技巧教程

llama.cpp 跨重启 KV 缓存持久化:预填充从54.4s降至3.5s

开发者实现 llama.cpp KV缓存持久化,在免费 Oracle ARM 服务器将同一文档预填充从54.4秒降至3.5秒,对 CPU 推理和低成本部署很有启发。[8]

硬件动态

B200 GPU 极度稀缺,推理成本预计上涨

开发者 Suhail 调查 13 家供应商均无法提供单节点 B200,价格逼近6.5-7美元/GPU小时。B200 供需失衡或推高推理成本,影响 AI 基础设施决策。[2]