Meta发布面向本地智能体的Muse Glimmer 30B Meta开源Muse Glimmer 30B多模态模型,采用Apache 2.0许可,支持本地Agent工作流。博客:https://huggingface.co/blog/muse-glimmer[1][2][3][4]
Unsloth推出Muse Glimmer 30B的GGUF版本 Unsloth发布Muse Glimmer 30BGGUF量化版本及运行指南,降低本地推理部署门槛。详情:https://www.reddit.com/r/LocalLLaMA/comments/1vkhbuc/unslothmuseglimmer30bgguf_hugging_face/[5]
Gemini Gemini CLI发布v0.56.0 nightly版本 Gemini CLI发布v0.56.0-nightly.20260810.gcf22ac7e8。变更日志:https://github.com/google-gemini/gemini-cli/compare/v0.56.0-nightly.20260809.gcf22ac7e8...v0.56.0-nightly.20260810.gcf22ac7e8[10]
M4 Air运行Maple-Preview达到40 tokens/s 社区将Maple-Preview接入Mference,称其在M4 Air上仅占约500MB内存并达到40 tokens/s。详情:https://www.reddit.com/r/LocalLLaMA/comments/1vkglog/ive_added_maplepreview_to_mference_got_40_tps/[11]
HuggingFace Hugging Face介绍可规模化的低成本知识蒸馏方法 Hugging Face分享降低知识蒸馏成本的方法,目标是推动小模型压缩、训练与生产部署规模化。文章:https://huggingface.co/blog/MultiverseComputingCAI/efficient-knowledge-distillation[6]