通义千问开源Qwen3-ASR系列语音识别与对齐模型
通义千问团队正式【开源】了Qwen3-ASR系列语音识别模型及Qwen3-ForcedAligner强制对齐模型。该系列模型基于Qwen3-Omni,具备原生流式支持,支持多达52种语言和方言,并在嘈杂环境、长音频(最长20分钟)及歌唱转录等复杂场景下表现出色。Qwen3-ForcedAligner可为11种语言提供高精度词级时间戳对齐。项目提供了完整的推理与微调栈,并已在GitHub、Hugging Face和ModelScope平台发布。GitHub: https://github.com/QwenLM/Qwen3-ASR, 论文: https://arxiv.org/abs/2503.07723。[1][2][3][4][5][6][7][8][9][10][11]