谷歌在推理能力上发起强力挑战,Deep Think模式在核心AGI基准上大幅领先。微软在实时语音合成方向推出轻量级开源模型。OpenAI、Kling AI等在产品化和多模态能力上持续迭代。工具调用与智能体能力成为模型竞争的新焦点。

模型动态

微软发布实时TTS模型VibeVoice-Realtime-0.5B

事件:微软开源0.5B参数的实时文本转语音模型。 核心:延迟极低(约300毫秒),支持多角色对话和情绪捕捉,目前主要支持英文。 应用:适合接在大模型后实现实时语音输出。

Kling Video 2.6模型上线测试

事件:Kling AI的视频生成模型Kling Video 2.6在Arena平台开放测试。 特点:首次支持原生音频生成,可一步生成带语音、音效的完整视频。[4][5]

MiroThinker-v1.0模型发布并实测

事件:MiroMind AI发布面向研究智能体优化的MiroThinker-v1.0模型系列(72B/30B/8B)。 亮点:宣称支持在长上下文内进行多达600次工具调用(tool call)。 实测:有开发者用自建“外卖模拟”框架测试了其工具调用与规划能力。

产品工具

GPT-5.1 Codex Max API上线

事件:OpenAI的GPT-5.1 Codex Max模型API已开放。 应用:编程工具如Cursor已接入。[2][3]

NotebookLM大幅扩展角色定制功能

事件:Google的NotebookLM将聊天角色(Persona)定制字数上限从500扩展到10,000字。 价值:允许用户创建更复杂、专业的AI助手角色,如产品经理、教师等。

行业资讯

Google推出Gemini 3 Deep Think模式

事件:谷歌上线由Gemini 3驱动的Deep Think深度推理模式。 性能:在ARC-AGI-2测试中达到45.1%准确率,是GPT-5.1的2.5倍,在多项高难度基准中领先。 可用性:目前面向Gemini Ultra用户开放。[1]