阶跃星辰发布并开源端到端语音大模型 Step-Audio-R1.1
模型特性:33B参数,65K上下文,采用双脑架构解耦推理与语音生成,实现0.92秒低延迟。 性能表现:在S2S(语音到语音)和S2T(语音到文本)基准测试中表现优异,后者甚至超过Gemini 2.5 Pro。 技术亮点:核心为MGRD框架,让模型直接基于音频声学特征进行推理,而非依赖转录文本,解决了“想得越多错得越多”的问题。 应用落地:已搭载于吉利银河M9海外版,为首个端到端语音模型量产车型。[1]