通义千问发布Qwen3-Omni-Flash新版API服务。
核心更新:显著提升音视频交互的指令遵循能力,解决闲聊时“变笨”问题。 精准控制:增强系统提示词遵循,支持特定人设、风格和长度。 多语言与语音:解决语言切换不稳定,支持119种文本、19种语音理解及10种语音生成语言。 拟人化语音:自适应语速和韵律,效果更自然。
通义千问在音视频多模态模型上取得重要迭代,提升了交互稳定性和拟真度。同时,一款名为Medeo的新型视频AI Agent开始内测,展示了自然语言驱动视频编辑的潜力。