H3 Max Turbo以近似能力实现【2倍推理速度】与成本减半;Claude Code、OpenCode及llama.cpp集中更新,强化本地与企业级开发体验。

模型动态

MiniMax预览H3 Max Turbo并实现推理提速

H3 Max Turbo保持接近原版能力,推理速度约【提升2倍】、成本约【降低一半】。[1]

产品工具

Claude Code新增组织级托管MCP配置

Claude Code v2.1.259新增托管MCP及无提示权限模式。更新:https://github.com/anthropics/claude-code/releases/tag/v2.1.259[3]

OpenCode延长请求超时并优化Claude兼容性

OpenCode v1.18.27将请求与流超时设为5分钟,并修复思考块兼容。更新:https://github.com/anomalyco/opencode/releases/tag/v1.18.27[4]

llama.cpp新增Nemotron混合架构模型支持

llama.cpp支持Nemotron-3-Puzzle-75B-A9B本地运行,覆盖【Mamba、MoE与Attention】混合架构。[5]

Repodify提供完全本地的播客摘要工作流

Repodify整合本地转写与摘要,无GPU时可使用自带API密钥。社区同时讨论Mac Parakeet等本地STT方案。[6][7]

智谱在天猫旗舰店销售大模型订阅套餐

智谱上线天猫官方旗舰店,销售个人与团队版GLM Coding Plan,个人版月费最低118元[8]

技巧教程

Hugging Face演示训练编码模型绘制水彩画

TRLOpenEnv训练编码模型作画,展示强化学习能力迁移。教程:https://huggingface.co/blog/train-to-paint-with-code[2]

社区总结本地模型显存配置与选型经验

长上下文下KV Cache可能比参数更占显存。用户建议结合【任务难度、内存配置】选择模型及量化策略。[9][10][11]