本期聚焦Vercel内部运营代理受热捧,llama.cpp推出官方Mac应用;社区实测发现DeepSeek V4 FlashKV Cache量化存在质量陷阱,国产芯片DFSX被曝内存带宽翻倍。

模型动态

实测警告:DeepSeek V4 Flash 的 KV Cache 不宜量化

社区测试发现对DeepSeek V4 Flash做 Q8 KV Cache 量化带来明显质量损失,PPL、KLD 等指标显著变差,与 Qwen 397B 形成鲜明对比。原文:https://www.reddit.com/r/LocalLLaMA/comments/1vduxth/you_really_should_not_quantize_kv_cache_for/[3]

产品工具

Vercel 构建内部运营代理 @v,AI 或可运营整家公司

Vercel CEO Guillermo Rauch 透露已用@v代理处理日常运营任务,token 消耗增长迅猛。他乐观推测未来AI代理可独立运营整个公司。[1]

condense-json 1.0 发布:专注 JSON 压缩的小型库

Simon Willison 发布condense-json 1.0,一个维护一年半的 JSON 压缩工具,适合需要高效处理JSON的开发者。项目地址:https://simonwillison.net/2026/Aug/2/condense-json/#atom-everything[2]

llama.cpp 官方推出 Mac 应用 llama.app 与 llama serve

llama.cpp 官方发布llama.appMac 应用和llama serve工具,方便本地运行 LLM。官方应用此前未被多数用户注意到,对本地部署者是重要提示。原文:https://www.reddit.com/r/LocalLLaMA/comments/1vdt1i2/psa_llamaapp_mac_app_and_llama_serve_from_llamacpp/[4]

技巧教程

补丁优化:DeepSeek V4 在 M1 Ultra 128GB 跑到 16 tok/s

用户通过补丁将DeepSeek V4IQ3XXS 量化模型在 M1 Ultra 128GB 上从 5-6 tok/s 提升至15-16 tok/s,输出质量也有所改善。原文:https://www.reddit.com/r/LocalLLaMA/comments/1vdsmnk/deepseek_v4_iq3xxs_on_m1_ultra_128gb_16_toks_in/[6]

硬件动态

中国 DFSX 芯片被曝提供 2 倍于 NVIDIA GB200 的内存带宽

Reddit 社区称国产芯片DFSX内存带宽可达 NVIDIA GB200 的两倍,消息尚未证实。若属实,将是硬件突破的重要信号。原文:https://www.reddit.com/r/LocalLLaMA/comments/1vduej3/chinas_dfsx_offers_2x_the_memory_bandwidth_of/[5]

行业资讯

Whatnot CPO:AI 正在暴露“产品戏剧”现象

Whatnot 首席产品官 Tom Verrilli 在播客中讨论 AI 对产品管理职业的冲击,认为 AI 暴露了许多无效的产品戏剧,产品经理需要提升【系统思维】。[7]

檀香山机场开始循环播放 AI 生成的夏威夷主题歌曲

檀香山机场播放17首AI生成歌曲,Simon Willison 在餐厅也遭遇无法识别的模板化背景音乐。AI 合成音乐已大量渗透线下商业环境,引发讨论。[8][9]