本期重点包括GLM-5.3-Flash正式GA及Terminal Bench 4.0新评测,显示模型部署与基准表现仍需结合基础设施观察。社区还分享了【本地推理提速】、非Transformer架构和自学习模型治理等实践。

模型动态

GLM-5.3-Flash在Fireworks正式GA

Fireworks宣布GLM-5.3-Flash正式GA。官方强调相同权重在不同推理基础设施上的质量表现可能存在差异。详情:https://x.com/FireworksAI_HQ/status/2093592116555657277[1]

Terminal Bench 4.0显示GLM-5.3接近Fable 5

Terminal Bench 4.0更新排行榜,社区称GLM-5.3Fable 5表现处于误差范围内,评测继续跟进模型迭代。详情:https://www.reddit.com/r/LocalLLaMA/comments/1w1fpxi/terminal_bench_40_just_dropped_glm53_is_at_the/[2]

社区完成150M参数非Transformer模型WarpState训练

作者从零训练150M参数、使用3亿tokens的非Transformer模型WarpState,目前定位为架构概念验证。详情:https://www.reddit.com/r/LocalLLaMA/comments/1w149k6/i_trained_my_own_150m_nontransformer_language/[3]

产品工具

OpenClaw beta更新网关重启恢复与配置写入可靠性

OpenClaw发布v2026.9.1-beta.1,支持网关重启后保留进行中的turn,并增强【配置写入可靠性】。项目地址:https://github.com/openclaw/openclaw/releases/tag/v2026.9.1-beta.1[8]

技巧教程

Qwen3.8-Flash-Next在Strix Halo上的Vulkan部署实践

社区记录在AMDStrix Halo上通过llama.cpp Vulkan后端与MTP运行模型的配置和基准,适合优化统一内存推理。详情:https://www.reddit.com/r/LocalLLaMA/comments/1w1d3zl/qwen38flashnext_mtp_on_strix_halo_vulkan_runtime/[4]

硬件动态

Apple Silicon运行Qwen3.8模型获得约两倍提速

社区使用MTPLX优化Qwen3.8-27B及35B模型,在Apple Silicon部分场景实现【约2倍提速】,并测试262K上下文。详情:https://www.reddit.com/r/LocalLLaMA/comments/1w1ejqy/2x_speed_boost_for_qwen38_27b_on_apple_silicon/[5]

被动OCuLink多卡方案意外形成CUDA内核调度效果

作者分享OCuLink x4、PCIe Gen 3与多GPU推理配置,发现意外的CUDA内核调度效果,并公开无头部署经验。详情:https://www.reddit.com/r/LocalLLaMA/comments/1w166ig/optimized_a_passive_oculink_x4_setup_on_pcie_gen/[7]

行业资讯

自学习LLM治理被指缺少基础设施

文章认为自学习型LLM必须具备【治理、可观测性和审计】能力,并以Aimee审计存储评审为例。详情:https://www.reddit.com/r/LocalLLaMA/comments/1w1f69y/llm_selflearning_needs_governance_and_we_dont/[6]