Kimi发布重磅开源模型K2.5及配套编码工具Kimi Code,在智能体、视觉和编程能力上全面对标顶级闭源模型,是开源生态的重要进展。DeepSeek的OCR-V2通过架构创新解决了文档理解的顺序难题。通义实验室的预告预示着阿里系可能很快会有新动作。

模型动态

Kimi K2.5 开源视觉智能体模型正式发布。

核心特性:原生多模态,在多项Agent、视觉、代码基准测试中达到开源SOTA。 创新功能:推出“Agent Swarm”并行智能体模式,速度提升4.5倍;支持视觉引导编程。 开放状态:模型、代码、API、技术博客均已开源,并已在官网和OpenRouter等平台上线。[1][2][3]

Kimi Code 开源编码智能体发布。

产品形态:基于Python的开源编码Agent,采用Apache 2.0许可证。 核心价值:透明、可扩展,可无缝集成VS Code、Cursor等主流IDE,并原生支持多模态输入。[1][2][3]

DeepSeek 发布 OCR-V2 模型,用LLM架构替换CLIP。

核心创新:引入“视觉因果流”机制,使用Qwen2-0.5B小型LLM作为视觉编码器,以模拟人类阅读顺序。 性能提升:在OmniDocBench等测试中,阅读顺序准确性和整体性能均有显著提升。[4][5]

通义实验室发布神秘预告,暗示即将有新产品或更新。