本期重点包括MiniMax M3实现95%缓存率突破,Cloudflare开源AI安全审计工具,Mac跑大模型成本分析显示租卡更划算,以及Ling&Ring 2.6新模型发布。

模型动态

MiniMax M3实现95%缓存率,长期编码场景表现突出

MiniMax官方披露M3模型在OpenCode上的使用情况,95%缓存率大大降低推理成本,特别适用于长期编码循环场景,是缓存技术的重要突破。[1]

Ling和Ring 2.6发布,万亿参数即时智能体模型开源

UCB团队发布Ling and Ring 2.6技术报告,提出万亿参数级别的高效即时智能体模型,包括基础版和flash版,关注即时推理效率。[4]

产品工具

llama.cpp新增Step3.5/3.7 MTP支持,推理效率提升

llama.cpp合并PR #24340,新增对Step3.5/3.7 flash的多层MTP支持,通过多层预测技术【提升推理速度】,本地部署用户可更新使用。[5]

Cloudflare开源AI安全审计技能,编码助手变身审计工具

Cloudflare开源基于AI的安全审计工具,分六个阶段:情报搜集、多路攻击、误报排除、报告生成等,可将编码助手改造成系统化安全审计工具。[7]

技巧教程

买Mac跑大模型成本分析:回本需200天不间断运行

用户测算MacStudio M3 Ultra运行Qwen3.6-27B 4bit仅65token/s,售价32999元可买1178M token API用量,需连续运行209天才能回本,建议租卡或买coding plan。[2]

腾讯发布Loop Engineering实践指南,构建自主循环系统

腾讯技术工程分享Loop Engineering概念在Code Buddy中的应用,指导开发者构建自主循环系统,提升AI Agent的持续推理能力。[3]

行业资讯

维护AI生成代码挑战多,开发者分享真实体验

开发者发文抱怨维护同事用AI生成的代码时遇到的插件版权代码修改问题,反映【AI代码在项目中的维护挑战】,引发社区共鸣。[6]