Kimi发布K2.5技术报告,详解多模态与智能体架构
Kimi正式发布K2.5技术报告,详细阐述了其技术架构与创新。核心亮点包括:联合文本-视觉训练,使用15T视觉-文本令牌进行预训练;智能体集群(Agent Swarm)与PARL框架,可实现动态编排并行子智能体,延迟降低高达4.5倍;统一的图像-视频编码器MoonViT-3D,支持4倍时间压缩,在相同上下文长度下可处理4倍长的视频;以及Toggle令牌高效强化学习方法,可减少25-30%的令牌使用且不损失精度。技术报告链接:https://t.co/N5pwm0M4jm[1]