通义千问在音视频多模态模型上取得重要迭代,提升了交互稳定性和拟真度。同时,一款名为Medeo的新型视频AI Agent开始内测,展示了自然语言驱动视频编辑的潜力。

模型动态

通义千问发布Qwen3-Omni-Flash新版API服务。

核心更新:显著提升音视频交互的指令遵循能力,解决闲聊时“变笨”问题。 精准控制:增强系统提示词遵循,支持特定人设、风格和长度。 多语言与语音:解决语言切换不稳定,支持119种文本、19种语音理解及10种语音生成语言。 拟人化语音:自适应语速和韵律,效果更自然。

产品工具

AI视频生成工具Medeo正在内测。

产品形态:通过自然语言对话生成和编辑视频的AI Agent。 核心功能:配备在线编辑器,可即时修改台词、语音、字幕,并自动对齐时间轴。 当前状态:产品名为Medeo,处于内测阶段。