本期AI行业速报重点关注DeepSeek V4 Flash正式版上线和MiniMax H3多模态模型的生态扩展,同时Qwen-Audio-3.0-ASR-Flash语音识别模型发布、Codex图像Agent新UI模式等产品动态也值得关注。

模型动态

DeepSeek V4 Flash正式版上线,Agent能力大幅超越Pro预览版

DeepSeek V4 Flash正式版发布,Agent能力大幅提升,多项基准超越V4 Pro Preview版,已支持Codex API格式,并提供Mac/Windows一键配置脚本。项目地址:https://t.co/l8PoDiEqYO[1][2]

阿里发布Qwen-Audio-3.0-ASR-Flash语音识别模型

新模型提升上下文一致性与领域术语识别,支持自定义热词和结构化转写,内部测试医学术语召回率达95.36%。模型链接:https://t.co/VxruY0Ruhi[3][3]

MiniMax H3多模态模型生态快速扩展,登录多个平台

MiniMax H3已上线LMArena、OpenRouter、Vercel AI Gateway和fal等平台,开放权重即将发布,开发者可通过generateVideo()直接调用。[5][6][7][8]

MiniMax H3展示手绘即特效等能力,被称多模态的Coding时刻

MiniMax H3发布后展示手绘转特效、精准唇形同步、原生音频和屏幕文本处理等能力,用户实测效果惊艳,被视为多模态生成领域的重大突破。[9][10][11][12]

产品工具

Codex新增图像Agent专用UI模式,批量编辑能力增强

Codex更新后,生成图片可侧边栏预览,支持评论、擦除、调整大小,可多选图片批量修改,并支持只显示图像流的专注模式,被认为是设计Agent的强力竞争者。[4]

行业资讯

GPT-5.6 Luna降价,AI应用成本拐点到来

继GPT-5.6 Luna降价后,AI行业迎来成本可控拐点,Agent应用公司有望构建可持续商业模式。[13]

米哈游蔡浩宇AI创业战略调整,九成资源聚焦Agent方向

米哈游创始人蔡浩宇的AI创业公司暂停多个项目,将九成资源聚焦于Agent方向,显示AI应用领域竞争加剧。[14]