小红书开源高效长上下文 LLM 服务框架
通过注意力头分类和分段式KV缓存,将长上下文推理预填充FLOPs降低约50%-70%,同时保持接近无损精度。项目地址:https://t.co/YZKonHRJvM[3]
本期收录了Claude Fable 5工作方式转变、【小红书开源长上下文框架】、向阳乔木前端设计Skill即将开源等实用内容,以及ICML论文关于LLM预测偏好研究、Agent行业【从框架转向harnesses】等趋势分析。