本期焦点是Gemini 3.1 Flash Live语音模型正式推出,同时社区分享了实用的【Claude使用技巧】和关于大模型语义校准能力的有趣研究。

模型动态

Gemini 3.1 Flash Live 语音模型正式推出

Google 正式发布Gemini 3.1 Flash Live语音模型,现已集成至 Gemini Live 和 Google Search Live。该模型具备更低延迟更自然的对话能力,并能在嘈杂环境中更好地完成任务。开发者可通过 Google AI Studio 的 Live API 预览版进行构建。详情:https://goo.gle/3PzM6qP[1][2][3][4][5][6]

微软发布 AsgardBench 和 GroundedPlanBench 评估基准

微软研究院发布两个新基准:AsgardBench评估具身智能体能否根据视觉观察修订计划GroundedPlanBench评估视觉语言模型(VLM)的行动规划空间定位能力,以提升机器人行为的可靠性。[14][15]

产品工具

Cline 发布免费开源本地 Web 应用

Cline 发布了一款【免费开源】的本地 Web 应用,无需账户即可使用。它启动一个本地服务,并能与 Claude Code、Codex 和 Cline 等 CLI 智能体【开箱即用】。项目地址:https://t.co/xgRuUHGIIW[7]

Y Combinator 投资 AI 原生可观测性平台 Sazabi

Y Combinator 投资的Sazabi是一个面向快速迭代工程团队的【AI 原生可观测性平台】。它承诺在几分钟内完成部署,提供自主的 AI 驱动警报,并轻松解决事故。官网:http://sazabi.com[13]

技巧教程

Reddit 用户分享 10 个节省 Claude 使用量的技巧

社区分享了 10 条实用的【Claude 使用技巧】,核心是【减少重复劳动】以节省 token 消耗。技巧包括:一次说清需求、利用项目系统提示词、先要框架再填内容、简单任务用 Haiku 模型等。[8]

行业资讯

苹果论文揭示大模型具有“语义校准”能力

一篇苹果论文发现,仅经过预训练的【基础大模型】天然具备评估自身答案置信度的语义校准能力。有趣的是,后续的强化学习和【思维链推理】训练反而会破坏这种校准,让模型变得过度自信。[9]

Google DeepMind 发布 AI 操纵行为研究报告

Google DeepMind 发布了一项针对10000人的研究,揭示了 AI 在不同领域的操纵影响力。研究发现,AI 在金融领域影响力高,但在医疗领域因现有护栏而受阻。研究旨在通过识别危险策略来建立更强的保护措施。详情:https://goo.gle/4bx8dqy[10][11][12]

a16z 分享观点:AI 竞赛的赢家将是赋能“本地英雄”的公司

a16z 分享观点,认为 AI 竞赛的赢家不是拥有最聪明模型的公司,而是最擅长让【教师、会计师、社区领袖】等“本地英雄”【效率提升十倍】的公司。因为智能通过系统传播,而采用通过人传播。[16]