社区为Kimi-Linear-48B模型实现MLA KV cache支持,大幅降低长上下文显存需求。
技术突破:通过llama.cpp实现MLA KV cache,使1M上下文的F16 KV cache显存占用从140GB降至约15GB。 实际意义:消费级显卡(甚至4GB显存)即可运行百万token级别的超长上下文模型。 模型背景:KimiLinear曾是contextarena召回测试中表现最好的开源模型之一。
本周动态集中于AI产品化与生态整合。Anthropic将代码能力平民化,Vercel强化了AI的自动化执行能力,开源社区则通过技术创新大幅降低了长上下文的使用门槛。同时,苹果与谷歌的联盟标志着AI基础设施竞争进入新阶段,闭源模型通过合作扩大生态影响力。