微软发布实时TTS模型VibeVoice-Realtime-0.5B
事件:微软开源0.5B参数的实时文本转语音模型。 核心:延迟极低(约300毫秒),支持多角色对话和情绪捕捉,目前主要支持英文。 应用:适合接在大模型后实现实时语音输出。
谷歌在推理能力上发起强力挑战,Deep Think模式在核心AGI基准上大幅领先。微软在实时语音合成方向推出轻量级开源模型。OpenAI、Kling AI等在产品化和多模态能力上持续迭代。工具调用与智能体能力成为模型竞争的新焦点。