本期关注【本地模型使用率翻倍】与低比特量化进展;同时【GitHub Models退役】将直接影响相关开发工作流。

模型动态

KLQ免训练量化在W4A4KV4评测领先

KLQ无需训练,在W4A4KV4量化中超过SpinQuant,并接近需优化舍入的ReSpinQuant。详情:https://www.reddit.com/r/LocalLLaMA/comments/1vk2n2k/klq_trainingfree_measured_rotation_quantization/[3]

SupraLabs发布50万参数非Transformer实验模型

SupraElegans-500K采用【稀疏循环神经图】,不使用Transformer、注意力或KV缓存。详情:https://www.reddit.com/r/LocalLLaMA/comments/1vk3xpb/new_model_supraelegans500k/[5]

社区发布Qwen 3.5微调模型BigBang-v1

BigBang-v1基于Qwen 3.5微调,并提供GGUF格式,方便本地推理部署。详情:https://www.reddit.com/r/LocalLLaMA/comments/1vk1p9s/endlessfrontierbigbangv1_qwen_35_finetunes/[6]

产品工具

GitHub Models正式退役

GitHub Models【正式退役】,依赖该服务的Actions及研究工作流可能失败。详情:https://simonwillison.net/2026/Aug/9/github-models-is-now-retired/#atom-everything[1]

Cline本地模型使用率较去年12月翻倍

Cline称本地模型使用量翻倍,已有11.2%用户使用Ollama或LM Studio,并预测两年内成为多数选择。[2]

行业资讯

新研究用内部几何保持改善NVFP4蒸馏

论文提出在NVFP4蒸馏中保持内部几何结构,以改善低精度模型效果和推理部署。详情:https://www.reddit.com/r/LocalLLaMA/comments/1vk08zl/260605682_beyond_output_matching_preserving/[4]