谷歌在语音合成领域推出重大更新,通过提示词工程实现了对语音属性的精细控制,降低了多角色语音生成的门槛。同时,社区实测对主流大模型的多模态能力提出了新的质疑,显示实际表现可能与官方宣传存在差距。

模型动态

谷歌发布新的Gemini TTS模型,支持通过提示词精细控制语音属性。

控制维度:可直接通过提示词控制说话人的性别、语调、语气、特定词读音、年龄等。 应用价值:无需切换不同语音模型,简化了多角色语音生成流程,已用于AI互动漫剧应用。 现存问题:中文发音仍有外国口音,音调问题有待改进。

用户实测对比GPT-5.2与Gemini 3.0的多模态能力,结论与OpenAI宣传不符。

测试方法:将去除标记框的同一案例图分别发送给GPT-5.2和Gemini 3.0进行识别。 测试结果:Gemini 3.0的表现“完爆”GPT-5.2,反驳了OpenAI关于GPT-5.2多模态能力更强的说法。