本周AI领域迎来一波新产品与【模型生态】更新:Halliday发布第二代AI眼镜G2,Nanbeige发布3B参数模型声称超越9B/12B,Laguna模型生态扩展(llama.cpp支持、Unsloth量化、用户实测),Kimi 2.7推VRAM磁盘缓存加速方案,另有LongCat-2.0评测节88%成本等实用内容。

模型动态

Nanbeige4.2-3B发布:3B参数挑战agent任务

Nanbeige实验室发布Nanbeige4.2-3B模型,采用Looped Transformer架构,声称在agent任务上超越9B/12B模型,为小参数高性能方向新探索。项目地址:https://www.reddit.com/r/LocalLLaMA/comments/1v336od/nanbeige423b_drops_3b_params_claiming_to_beat/[2]

Laguna模型生态更新:llama.cpp支持、Unsloth量化、用户实测

llama.cpp合并对Laguna XS.2 & M.1MoE模型支持,Unsloth发布Laguna S 2.1量化版,用户用3块V620(96GB)运行获得不错速度,【开源模型生态】持续扩展。项目:https://www.reddit.com/r/LocalLLaMA/comments/1v38n5b/ 量化:https://www.reddit.com/r/LocalLLaMA/comments/1v34ob0/ 实测:https://www.reddit.com/r/LocalLLaMA/comments/1v353sh/[3][4][5]

产品工具

Halliday发布第二代AI眼镜G2,支持会议实时参与

Halliday推出Halliday G2AI眼镜,新增Meeting Flow功能实现会议实时智能参与,强化商务沟通场景,面向AI可穿戴市场。详情:https://www.qbitai.com/2026/07/457049.html[1]

免费Mac应用:一天内从零构建GPT-2级别LLM

Anthropic工程师Felix Rieseberg发布免费Mac应用,帮助用户从零构建小型LLM,一天内可训练出GPT-2级别模型,降低入门门槛。地址:https://www.reddit.com/r/LocalLLaMA/comments/1v32ob7/[7]

零知识加密Pastebin工具:阅后即焚,服务器不可见

开源Pastebin工具使用AES-256-GCM加密,密文上传服务器,密钥仅在URL#片段,每条内容【只读一次】后自动销毁,支持CLI与一键部署。项目:https://t.co/uyrx1Yk3Nr[8]

CodePilot更新:免费使用Grok 4.5,新增Qwen支持

CodePilot重大更新,支持通过Twitter OAuth免费使用Grok 4.5,Premium用户额度更高;同时新增Qwen 3.8 Max Preview模型支持,提供灵活模型选择。路径:设置->服务商->添加服务->选择XAI Grok OAuth[10]

技巧教程

VRAM磁盘缓存加速Kimi 2.7推理:单机达340 pp/s

社区分享通过VRAM磁盘缓存策略加速MoE模型推理,在单台DGX Spark上运行Kimi 2.7实现340 tokens/s生成速度,高吞吐低延迟方案。详情:https://www.reddit.com/r/LocalLLaMA/comments/1v37lza/[6]

LongCat-2.0评测:缓存命中省88%Agent输入成本

社区实测LongCat-2.0模型,缓存命中后成本极低,适合日常Agent驱动(写周报、自动化测试等),通过请求分析工具可优化缓存率,大幅降低token消耗。详情:https://x.com/karminski3/status/2079786010955694133[9]

硬件动态

旧硬件方案:P40+MI50分布式加载550B大模型

用户尝试用P40和MI50显卡通过100GbE网络分布式加载550B参数模型(Q3_S量化),获得不错吞吐量,验证低成本旧硬件跑大模型可行性。详情:https://www.reddit.com/r/LocalLLaMA/comments/1v31cc0/[11]