本期速报聚焦Kimi K2.5技术报告发布,其Agent Swarm架构与MoonViT-3D统一编码器成为亮点。同时,国产AI视频模型Vidu Q3在长视频生成上取得突破,阿里开源两步生成方案大幅提升图像生成速度。

模型动态

Kimi发布K2.5技术报告,详解多模态与智能体架构

Kimi正式发布K2.5技术报告,详细介绍了其多项核心技术。报告亮点包括:采用联合文本-视觉训练,预训练使用了15T视觉-文本token;提出Agent Swarm架构与PARL方法,可实现动态编排并行子智能体,延迟降低高达4.5倍,在BrowseComp基准上达到78.4%的准确率;推出统一的图像-视频编码器MoonViT-3D,支持4倍时间压缩,能在相同上下文长度下处理4倍长的视频;以及采用Toggle方法进行令牌高效的强化学习,可减少25-30%的令牌使用且不损失精度。技术报告链接:https://t.co/N5pwm0M4jm[1]

国产AI视频模型Vidu Q3生成16秒真人版《火影忍者》

中国AI视频模型Vidu Q3展示了其在长视频生成方面的突破性进展,能够一次性生成长达16秒的真人版《火影忍者》音视频内容。这标志着国产视频生成模型在【长视频生成】能力上取得了重要进步。报道链接:https://www.qbitai.com/2026/01/374563.html[2]

阿里开源两步生成方案,5秒可出4张2K大图

阿里巴巴提出一种两步生成方案,通过模型蒸馏等技术,能够在大幅提升AI图像生成速度,实现5秒生成4张2K分辨率大图。该技术已【开源】,对图像生成领域具有重要价值。报道链接:https://www.qbitai.com/2026/01/374606.html[3]

硬件动态

国产芯片方案挑战NVIDIA CUDA生态

有报道指出,新的国产芯片方案正致力于挑战NVIDIA的【CUDA生态】,旨在实现国产芯片的【无痛适配】。这反映了AI硬件生态的多元化趋势和国产替代的努力。报道链接:https://www.qbitai.com/2026/01/374666.html[4]

行业资讯

RoboChallenge发布首份VLA模型年度评测报告

RoboChallenge发布了其首份年度报告,该报告基于数万次真机评测,旨在揭示当前【视觉语言动作(VLA)模型】的实际性能现状,为机器人AI的发展提供了重要的参考基准。报道链接:https://www.qbitai.com/2026/01/374597.html[5]