本期重点关注微软VibeVoice-ASR-BitNet通过异构量化将ASR模型压缩至1.58GB并显著提升边缘推理速度,NeurIPS 2026出现AI生成的评审意见引发学术诚信关注,同时豆包搜索能力向AI Agent开放,百度Apollo在伦敦开启与Uber合作的自动驾驶路测。

模型动态

微软发布VibeVoice-ASR-BitNet,边缘CPU推理加速

微软发布VibeVoice-ASR-BitNet,通过异构量化将ASR模型压缩至1.58GB,在边缘CPU上实现【1.6-2.3倍于Whisper.cpp】的推理速度,显著降低部署门槛。论文/代码待发布。[2]

产品工具

豆包搜索能力向AI Agent开放

字节跳动将豆包搜索能力开放给AI Agent,是搜索与Agent结合的重要产品更新,标志着搜索能力从独立工具走向组件化。[1]

开发量化工具:逐个测试权重重要性代替均匀量化

开发者开源量化工具,通过逐个测试权重分组的重要性(而非uniform或imatrix),可提升量化精度。基于Qwen3.6-27B构建了三种量化版本。实用工具。[4]

技巧教程

llama.cpp用户需更新DSV4聊天模板以修复编码智能体

llama.cpp发布重要更新,要求用户更新DSV4聊天模板以修复preserve_thinking行为,否则将影响编码智能体的表现。实操提醒。[3]

硬件动态

百度Apollo在伦敦与Uber合作启动自动驾驶路测

百度Apollo与Uber合作,在伦敦Brent区域进行第六代自动驾驶车辆RT6的公共道路测试,计划2027年向公众开放,这是欧洲市场的重要布局。[6][7]

行业资讯

NeurIPS 2026出现AI生成的评审意见引争议

NeurIPS 2026审稿流程中出现AI生成的评审意见,作者对评审机制表示困惑,涉及学术诚信重要议题,引发社区对评审质量的质疑。[5]

Vibe Coding警示:内部工具维护成本远高于开发成本

案例分享:某团队3月自建JIRA替代SaaS,7月因维护成本过高重新用回Linear。警示:【Vibe Coding开发第一版容易】,但维护成本会挤占实际工作精力。[8]