Kimi发布K2.5技术报告,详解多模态与智能体架构
Kimi官方发布了Kimi K2.5技术报告,详细介绍了其核心技术。报告亮点包括:采用联合文本-视觉训练,预训练使用了15T视觉-文本token;通过智能体集群(Agent Swarm)+ PARL架构实现动态编排并行子智能体,延迟降低高达4.5倍,在BrowseComp基准上达到78.4%的准确率;引入统一的图像-视频编码器MoonViT-3D,支持4倍时间压缩,可在相同上下文中处理4倍长的视频;采用Toggle令牌高效强化学习方法,在保持准确率的同时减少25-30%的令牌使用。技术报告链接:https://t.co/N5pwm0M4jm[1]