阶跃星辰的开源语音模型在架构和性能上均有突破,特别是其模态锚定推理技术,将推动音频AI向更本质的声学理解发展。同时,通义千问的生态持续活跃,社区开发者正基于其图像编辑模型进行垂直功能优化。

模型动态

阶跃星辰发布并开源端到端语音大模型 Step-Audio-R1.1

模型特性:33B参数,65K上下文,采用双脑架构解耦推理与语音生成,实现0.92秒低延迟。 性能表现:在S2S(语音到语音)和S2T(语音到文本)基准测试中表现优异,后者甚至超过Gemini 2.5 Pro。 技术亮点:核心为MGRD框架,让模型直接基于音频声学特征进行推理,而非依赖转录文本,解决了“想得越多错得越多”的问题。 应用落地:已搭载于吉利银河M9海外版,为首个端到端语音模型量产车型。[1]

开发者发布基于Qwen-Image-Edit-2511的LoRA模型LightingRemap Alpha 0.2

功能:专门用于优化图像的光影效果,提供更精准的高光和阴影控制。