本期焦点集中在本地智能体端侧模型生态:Meta发布Muse Glimmer,社区同步补齐量化和部署支持;同时,多款实用工具与评测资源值得关注。

模型动态

Meta发布面向本地智能体的Muse Glimmer 30B

Meta开源Muse Glimmer 30B多模态模型,采用Apache 2.0许可,支持本地Agent工作流。博客:https://huggingface.co/blog/muse-glimmer[1][2][3][4]

产品工具

Unsloth推出Muse Glimmer 30B的GGUF版本

Unsloth发布Muse Glimmer 30BGGUF量化版本及运行指南,降低本地推理部署门槛。详情:https://www.reddit.com/r/LocalLLaMA/comments/1vkhbuc/unslothmuseglimmer30bgguf_hugging_face/[5]

国内开发者搭建Skill资源网站

开发者建立【Skill网站】,收录常用及自制Skill,方便国内用户查找和安装使用。地址:https://t.co/5ZfA9pSrhn[7]

OpenCodex支持终端配置多种模型

OpenCodex输入ocx gui即可配置API或OAuth模型,并同步到正版Codex菜单,官方模型不受影响。[9]

Gemini CLI发布v0.56.0 nightly版本

Gemini CLI发布v0.56.0-nightly.20260810.gcf22ac7e8。变更日志:https://github.com/google-gemini/gemini-cli/compare/v0.56.0-nightly.20260809.gcf22ac7e8...v0.56.0-nightly.20260810.gcf22ac7e8[10]

技巧教程

用Codex拆解优秀网站来学习网页设计

分享一种Codex设计学习法:提供网站截图并标注细节,让模型分析版式、间距与视觉规律,适合设计入门实践。[8]

硬件动态

M4 Air运行Maple-Preview达到40 tokens/s

社区将Maple-Preview接入Mference,称其在M4 Air上仅占约500MB内存并达到40 tokens/s。详情:https://www.reddit.com/r/LocalLLaMA/comments/1vkglog/ive_added_maplepreview_to_mference_got_40_tps/[11]

行业资讯

Hugging Face介绍可规模化的低成本知识蒸馏方法

Hugging Face分享降低知识蒸馏成本的方法,目标是推动小模型压缩、训练与生产部署规模化。文章:https://huggingface.co/blog/MultiverseComputingCAI/efficient-knowledge-distillation[6]