国内视频生成赛道竞争白热化,字节与阿里相继推出支持音画同步与角色扮演的新模型。MiniMax开源VTP框架,为视觉生成的基础研究提供了新思路。小米加入开源大模型混战,推出高性价比模型。飞书AI助手展示了AI与办公场景深度集成的强大潜力。

模型动态

字节跳动发布Seedance 1.5 Pro视频生成模型,支持方言语音与画面同步生成。

[1]

阿里巴巴发布Wan 2.6视频模型,国内首发角色扮演功能。

核心升级:画质、稳定性、音效、指令遵循大幅提升,视频最长15秒。 关键功能:原生音画同步生成、角色扮演、分镜控制与多镜头切换。 文生图能力:同步升级,画面理解与生成质量接近专业级。

MiniMax开源视觉分词器预训练框架VTP,挑战扩散模型传统认知。

核心观点:证明通过扩大视觉分词器(模型、算力、数据)的规模,可以提升第二阶段DiT的生成质量,而无需为生成器增加额外计算。 开源地址:提供了GitHub、Hugging Face和论文链接。

小米开源MiMo-V2-Flash模型并上线体验API。

模型规模:总参数309B,激活参数15B,支持256K上下文。 服务与成本:推理速度达150 token/秒,API目前免费(定价为输入$0.1/百万token,输出$0.3/百万token)。

飞书AI工作助手“aily”更新,集成多项AI功能。

核心功能:支持一句话生成多维表格、播客、日程及带语音和生图的网页。 技术集成:内置豆包生图与TTS,支持MCP调用,个人账号可免费用。