MiniMax MiniMax M3实现95%缓存率,长期编码场景表现突出 MiniMax官方披露M3模型在OpenCode上的使用情况,95%缓存率大大降低推理成本,特别适用于长期编码循环场景,是缓存技术的重要突破。[1]
Ling和Ring 2.6发布,万亿参数即时智能体模型开源 UCB团队发布Ling and Ring 2.6技术报告,提出万亿参数级别的高效即时智能体模型,包括基础版和flash版,关注即时推理效率。[4]
Meta llama.cpp新增Step3.5/3.7 MTP支持,推理效率提升 llama.cpp合并PR #24340,新增对Step3.5/3.7 flash的多层MTP支持,通过多层预测技术【提升推理速度】,本地部署用户可更新使用。[5]
Cloudflare开源AI安全审计技能,编码助手变身审计工具 Cloudflare开源基于AI的安全审计工具,分六个阶段:情报搜集、多路攻击、误报排除、报告生成等,可将编码助手改造成系统化安全审计工具。[7]
买Mac跑大模型成本分析:回本需200天不间断运行 用户测算MacStudio M3 Ultra运行Qwen3.6-27B 4bit仅65token/s,售价32999元可买1178M token API用量,需连续运行209天才能回本,建议租卡或买coding plan。[2]
腾讯发布Loop Engineering实践指南,构建自主循环系统 腾讯技术工程分享Loop Engineering概念在Code Buddy中的应用,指导开发者构建自主循环系统,提升AI Agent的持续推理能力。[3]