Meta / MiniMax MiniMax 宣布开放权重,M3 模型已合并至 llama.cpp MiniMax 开放权重,其M3的MSA支持已合并至 llama.cpp,方便本地推理。详情:https://www.reddit.com/r/LocalLLaMA/comments/1v7bwg7/[1][2]
Kimi Kimi K3 发布倒计时启动 Kimi K3模型发布倒计时已开始,预示即将推出新版本,值得关注。来源:https://www.reddit.com/r/LocalLLaMA/comments/1v7e5ck/[3]
Meta BeeLlama.cpp v0.4.1 发布,新增 KV 缓存量化功能 BeeLlama.cpp 发布 v0.4.1,新增KVarN等 KV 缓存量化功能,减少VRAM使用,提升本地效率。来源:https://www.reddit.com/r/LocalLLaMA/comments/1v78me1/[5]
Claude Claude Code 与 OpenCode、Pi 代理任务性能对比 测试发现 Claude Code、OpenCode 和 Pi 使用DeepSeek V4 Flash时输出质量相似,但时间和 token 消耗差异巨大,有助工具选型。来源:https://www.reddit.com/r/LocalLLaMA/comments/1v7d8px/[6]
调查揭露 LLM token 转售市场存在安全与欺诈风险 调查显示 LLM token 转售市场通过汇集 API 密钥提供折扣,主要在中国,涉及安全与欺诈风险。详情:https://simonwillison.net/2026/Jul/26/relay-market/[4]