本期重点集中在大模型能力验证本地推理优化;腾讯公布的WorldClaw及超低内存运行300B模型的实践也值得关注。

模型动态

GPT-5.6与Fable据称解决悬置25年的数学难题

GPT-5.6与Fable协作解决一道悬置25年的数学难题,结果仍待独立验证。若属实,将体现【AI辅助科学研究】潜力。https://www.qbitai.com/2026/08/468913.html[1]

DeepSeek V4 Flash 0731独立跑分达到Terminal-Bench 82.7%

公开Harness独立测试中,DeepSeek V4 Flash 0731在445次试验取得82.7%。官方Harness尚未公开,评测设置差异仍需核查。https://www.reddit.com/r/LocalLLaMA/comments/1vjklwo/deepseek_v4_flash_0731_hits_827_on_terminalbench/[2]

产品工具

腾讯公布WorldClaw项目,或聚焦Hunyuan 3D世界生成

腾讯展示WorldClaw及演示页面,疑似聚焦Hunyuan 3D的世界与场景生成。目前权重和技术细节尚未公开,后续发布值得关注。https://www.reddit.com/r/LocalLLaMA/comments/1vjnqmh/tencent_announce_worldclaw/[4]

技巧教程

优化llama.cpp的MTP缓冲区后,Qwen 27B上下文提升至149K

AMD GPU上减少【MTP缓冲区开销】,使Qwen 27B上下文由64K提升至149K。该方法适合显存受限的本地长上下文部署。https://www.reddit.com/r/LocalLLaMA/comments/1vjmay5/amd_llamacpp_reducing_mtp_buffer_overhead_gave_me/[3]

开发者用32GB内存运行约300B参数MoE模型

实践者在32GB笔记本上运行约300B MoE模型,并通过顺序读取、数据重打包和流水线优化降低内存压力。https://www.reddit.com/r/LocalLLaMA/comments/1vjm6dn/300b_on_32gb_moestreaming_findings_optimisations/[5]