Qwen 微软发布并开源VibeVoice-ASR长音频识别模型 核心功能:9B参数,单次可处理长达60分钟音频,实现ASR、说话人分离、时间戳标注三合一。 技术特点:基于Qwen2 Decoder架构,支持64K上下文,通过自定义热词提升专业场景识别准确率。 实测表现:处理3000秒音频约2分钟,平均准确率91.9%,MIT协议开源。