Google发布TurboQuant技术,可将KV Cache压缩至3-bit
Google新论文提出TurboQuant技术,通过PolarQuant+QJL算法将KV Cache无损压缩至3-bit,相比常见的16-bit大幅减少数据读写量,从而显著提升大模型推理速度。该技术若与线性注意力等结合,有望实现速度翻倍。[1]
本期重点关注Google发布的TurboQuant技术,可将KV Cache压缩至3-bit以大幅提升推理速度;同时,Lyria 3 Pro音乐模型正式推出,并有多款【开源工具】发布,助力AI应用开发。