北京智源研究院发布多模态世界模型 Emu3.5 核心创新:将图文视频统一为token,通过预测下一个token来学习世界变化规律,实现“预测世界下一秒”的能力。 关键能力:支持预测场景动态变化、生成3D交互画面、进行图像编辑与生成,并能拆解生成教学步骤图。 训练数据:包含约790年时长的视频,旨在学习时间、空间、物理、因果和意图等世界本质元素。[1][2][3]