阿里巴巴发布Wan 2.6视频模型,国内首发角色扮演功能。
核心升级:画质、稳定性、音效、指令遵循大幅提升,视频最长15秒。 关键功能:原生音画同步生成、角色扮演、分镜控制与多镜头切换。 文生图能力:同步升级,画面理解与生成质量接近专业级。
MiniMax / GitHub / HuggingFace
MiniMax开源视觉分词器预训练框架VTP,挑战扩散模型传统认知。
核心观点:证明通过扩大视觉分词器(模型、算力、数据)的规模,可以提升第二阶段DiT的生成质量,而无需为生成器增加额外计算。 开源地址:提供了GitHub、Hugging Face和论文链接。
小米开源MiMo-V2-Flash模型并上线体验API。
模型规模:总参数309B,激活参数15B,支持256K上下文。 服务与成本:推理速度达150 token/秒,API目前免费(定价为输入$0.1/百万token,输出$0.3/百万token)。
飞书AI工作助手“aily”更新,集成多项AI功能。
核心功能:支持一句话生成多维表格、播客、日程及带语音和生图的网页。 技术集成:内置豆包生图与TTS,支持MCP调用,个人账号可免费用。