OpenAI持续优化其API产品线,音频模型在多语言和可靠性上取得显著进步。开源模型领域竞争激烈,Mistral的Devstral 2在特定任务上展现出高效能,而英伟达的Nemotron 3 Nano则作为新的开源竞争者入局,主打数学与编程能力。

模型动态

OpenAI Realtime API音频模型更新,推出三个新快照,在可靠性和多语言能力上均有提升。

新模型:gpt-4o-mini-transcribe-2025-12-15(幻听减少89%)、gpt-4o-mini-tts-2025-12-15(词错误率降低35%)、gpt-realtime-mini-2025-12-15(指令遵循提升22%)。 语言增强:新模型在中文、日语、印尼语、印地语、孟加拉语和意大利语等语言上表现更强。[1][2][3]

Mistral AI Devstral 2模型实测表现优异,在Cline工具中的diff-edit失败率仅为6.52%。

性能对比:优于GLM-4.6(7.58%)和Kimi-K2(9.29%)。 模型特点:参数规模为123B,比DeepSeek V3.2小5倍,目前处于免费推广期。[4][5]

英伟达开源Nemotron 3模型家族,首款模型Nemotron 3 Nano(30B-A3B)已发布。

模型特点:300亿参数混合推理模型,支持100万上下文。 性能表现:在LMSys文本排行榜上位列开源模型第47名,在数学和编程类别中表现最佳。

行业资讯

OpenAI在iOS和Android移动端上线了对话分支功能。