本期重点集中在【开放模型竞争】与本地推理优化两条线:GLM-5.3在Terminal-Bench 4.0中击败GPT-5.6,社区则推进百万上下文与CPU/混合推理实践。

模型动态

GLM-5.3 Max在Terminal-Bench 4.0击败GPT-5.6

Cline称GLM-5.3 Max在新Terminal-Bench 4.0中超过GPT-5.6 Sol。可通过Cline试用:https://x.com/cline/status/2093774144412549378[1]

产品工具

fx.sh 0.0.7大幅强化MCP与CLI Agent能力

fx.sh 0.0.7改进MCP支持,并用Context7、Datadog等工具评测;同时减少工具数量、优化Shell执行。详情:https://x.com/rauchg/status/2093736865191076318[2]

Codex连续发布0.151.0与0.152.0-alpha.1

Codex新增MCP工具结果拦截、插件市场配置合并,并修复沙箱与模型切换问题。版本地址:https://github.com/openai/codex/releases/tag/rust-v0.151.0[3][4]

llama.cpp社区整理CPU与混合推理优化方向

社区汇总llama.cpp在CPU/RAM/磁盘及混合推理方面的开放PR,涵盖MoE专家缓存与显存缓存。参考:https://www.reddit.com/r/LocalLLaMA/comments/1w1u6d/llamacpp_open_prs_list_cpuramdiskhybrid_related/[6]

技巧教程

Qwen3.8-27B实测显示高强度思考成本显著上升

Apple M5 Max测试显示,开启【xhigh思考】后Token消耗约增至5.5倍,耗时约6倍,体现质量与延迟成本的权衡。详情:https://www.reddit.com/r/LocalLLaMA/comments/1w1vbal/qwen3827b_thinking_xhigh_vs_thinking_off_apple_m5/[8]

硬件动态

社区让Qwen3.8-27B在双RTX 5090上运行百万上下文

NInfer Fork结合双GPU张量并行与YaRN扩展,使Qwen3.8-27B NVFP4支持约100万Token上下文。项目讨论:https://www.reddit.com/r/LocalLLaMA/comments/1w1txyk/ninfer_fork_i_wanted_to_have_a_1m_context_qwen38/[5]

行业资讯

金融模型评测应关注配置而非单一排名

社区分析Ling-3.0-flash-Fin基准卡,指出【温度、采样参数、推理强度】及ReAct脚手架都会显著影响结果。详情:https://www.reddit.com/r/LocalLLaMA/comments/1w1tfkc/this_financemodel_benchmark_card_is_more_useful/[7]