Kimi发布K2.5技术报告,详解多模态与智能体架构
Kimi正式发布K2.5技术报告,详细介绍了其多项核心技术。报告亮点包括:采用联合文本-视觉训练,预训练使用了15T视觉-文本token;提出Agent Swarm架构与PARL方法,可实现动态编排并行子智能体,延迟降低高达4.5倍,在BrowseComp基准上达到78.4%的准确率;推出统一的图像-视频编码器MoonViT-3D,支持4倍时间压缩,能在相同上下文长度下处理4倍长的视频;以及采用Toggle方法进行令牌高效的强化学习,可减少25-30%的令牌使用且不损失精度。技术报告链接:https://t.co/N5pwm0M4jm[1]