本期重点关注【本地模型生态】与【推理基础设施】进展:社区集中整理多款GGUF模型,同时FlashAccel探索以高带宽闪存重构LLM内存层级。另有多条关于【Agent可靠性】、量化部署与长上下文管理的实测分享。

模型动态

社区集中发布多款模型及GGUF量化版本

社区整理LongCatQwen、代码与视觉模型,并提供llama.cpp适配分支。项目地址:https://www.reddit.com/r/LocalLLaMA/comments/1w2iqos/uncensored_multimodel_releases/[1]

用户称GLM-5.3-Flash智能体能力跃升但可靠性不足

实测反馈认为Agent能力出现明显提升,但长尾错误仍影响规模化使用,不同运行框架表现也有差异。详情:https://www.reddit.com/r/LocalLLaMA/comments/1w2germ/glm53flash_is_100_a_step_change_in_agential/[5]

产品工具

TensorSharp接入MiniMax H3本地视频生成

作者将MiniMax H3视频生成接入TensorSharp,使本地GGUF推理运行时扩展至【视频生成】。讨论地址:https://www.reddit.com/r/LocalLLaMA/comments/1w2ip5z/got_minimax_h3_video_generation_running_in/[3]

技巧教程

EXL3量化让12GB显存运行30B模型成为可能

实践显示EXL3量化可在12GB显存运行30B模型,并支持长上下文与约30 tokens/s速度。经验分享:https://www.reddit.com/r/LocalLLaMA/comments/1w2i963/dont_sleep_on_exl3_quants/[6]

长时间运行的编程Agent需要系统化上下文管理

文章总结长Agent线程中的上下文管理与任务持续性问题,并分享Qwen模型和自建工具链的实践观察。讨论地址:https://www.reddit.com/r/LocalLLaMA/comments/1w2kmrq/context_management_in_long_agent_threads/[7]

用户用Grok自动扩容PVE中OpenWrt根目录

面对OpenWrt Overlay仅1GB的问题,用户让Grok协助扩容至8GB,无需查阅教程即可完成。原文:https://x.com/geekbb/status/2094075012273901876[8]

硬件动态

FlashAccel提出用高带宽闪存提升LLM推理吞吐

论文提出高带宽闪存方案,宣称最高约3TB/s带宽,以较低成本扩展推理内存,仍待实测验证。论文讨论:https://www.reddit.com/r/LocalLLaMA/comments/1w2gmn5/intresting_paper_based_on_hbf260710186_flashaccel/[2]

双DGX Spark运行Qwen3.8-Flash-Next达到50 tokens/s

在双DGX SparkNVFP4与多步预测配置下,Qwen3.8-Flash-Next解码约50 tokens/s,预填充约2900 tokens/s。详情:https://www.reddit.com/r/LocalLLaMA/comments/1w2inlp/qwen38flashnext_nvfp4_2xdgx_spark_config_50ts/[4]