本期AI动态聚焦硬件与模型推理:Google发布第八代TPU拆分训练/推理,社区用WinterMix实现Qwen3.5-122B高效量化;DeepSeek V4 Flash在翻译场景展现出超高性价比,多款开发者工具密集更新。

模型动态

WinterMix发布:将Qwen3.5-122B-A10B压缩至82GiB

社区发布WinterMix量化方法,将Qwen3.5-122B-A10B在原生MLX压缩至82GiB,表现优于更大体积的6-bit构建,另有68GiB版本面向Agent集群。链接:https://www.reddit.com/r/LocalLLaMA/comments/1vdcs8e/release_wintermix_qwen35122ba10b_in_native_mlx_an/[2]

用户实测:Qwen 3.5 120B自主编码表现与社区炒作有差距

Reddit用户分享Qwen 3.5 120B作为自主编码代理的真实体验,指出其实际编码与工具使用表现和社区预期存在差距,为模型选型提供现实参考。链接:https://www.reddit.com/r/LocalLLaMA/comments/1vdb1n1/realworld_reality_check_on_qwen_for_autonomous/[3]

产品工具

Codepilot 0.63.0发布:AI生成内容可加入素材库并打标签

Codepilot 0.63.0更新:可将AI生成的图片、HTML等加入素材库并打标签,同时适配DeepSeek V4 Flash 0731,新增可调推理强度。[7]

Xberg v1发布:支持101种文档格式的内容智能框架

Kreuzberg继任者Xberg v1发布,支持101种文档格式、367种代码与数据格式及音频,定位多格式内容智能处理框架。链接:https://www.reddit.com/r/LocalLLaMA/comments/1vdd795/xberg_v1_is_out/[8]

开源工具让大疆一代4G模块在macOS上免虚拟机收发短信和上网

开源方案让【大疆第一代4G模块】在macOS上无需虚拟机即可完成短信收发、eSIM Profile管理、AT指令调试与USB 4G上网。项目地址:https://t.co/gHrCGmSFss[9]

技巧教程

用DeepSeek V4 Flash替代网站翻译:速度从20-60分钟降至3分钟

开发者实测用DeepSeek V4 Flash替代网站翻译,速度从20-60分钟降至3分钟,单篇成本不到0.1元,效率与性价比大幅提升。[6]

硬件动态

Google发布第八代TPU:拆分为8t训练与8i推理

Google发布第八代TPU,拆分为TPU 8t训练与TPU 8i推理:8t单组9600颗达121 exaflops,8i延迟最多减半,适配Agent时代多轮推理需求。[1]

DGX Spark出现NVMe降速固件问题,社区搭建16卡集群

PSA:DGX Spark存在固件问题,USB-C NVMe随机断开并降速至USB 2.0;另有用户搭建16台DGX Spark集群跑DeepSeek V4 Pro。固件详情:https://www.reddit.com/r/LocalLLaMA/comments/1vd93fd/psa_dgx_spark_has_a_major_firmware_issue_causing/[4][5]