本期重点是Midjourney风格代码实用分享,以及社区对DGX SparkQwen3.8-Next本地推理性能的新实测;同时Gemini CLICodex发布了版本更新。

模型动态

Qwen3.8-Next在32GB M5 Air上实现150 tokens/s预填充

社区将流式推理方案适配Qwen3.8-Next,在32GB M5 Air上测得约150 tokens/s预填充、3.6 tokens/s解码。https://www.reddit.com/r/LocalLLaMA/comments/1w1inuk/qwen38next_streaming_150tps_prefill_36_tps_decode/[9]

产品工具

Gemini CLI nightly版强化工作区信任与MCP隔离

Gemini CLI发布v0.59.0-nightly,强制执行默认拒绝的工作区信任策略,并在受限模式过滤mcpServers。https://github.com/google-gemini/gemini-cli/releases/tag/v0.59.0-nightly.20260829.g0bd1d4397[11]

Codex发布rust-v0.151.0-alpha.12

Codex发布rust-v0.151.0-alpha.12版本,目前原始信息仅披露版本更新,具体改动可查看Release页面。https://github.com/openai/codex/releases/tag/rust-v0.151.0-alpha.12[12]

技巧教程

Midjourney风格代码实现明亮厚涂与图片排版

实测SREF风格代码可生成明亮、暖色、厚涂画面,并支持混合风格、按图选排版;还发现会加入大光圈虚化。https://t.co/BGwqAygZJD[1][2][3][4][5]

社区尝试制作古建筑与国风场景分享Skill

歸藏计划制作并迭代一个国风场景Skill,用于分享古建筑图片和场景;反馈显示使用门槛不高,但内容可控性仍需优化。https://t.co/W6K2UC4z7j[6][7]

低速生成时可直观看到推测解码的阶段性加速

一项个人实验显示,在较低生成速度下,speculative decoding会出现肉眼可见的阶段性提速,可帮助理解其工作效果,但并非系统评测。https://www.reddit.com/r/LocalLLaMA/comments/1w1je5d/if_your_ts_is_low_enough_you_can_see_speculative/[10]

硬件动态

四台DGX Spark互联实测DeepSeek与Qwen模型

社区使用四台DGX Spark和ConnectX-7测试多款DeepSeek、Qwen模型,分享了多机推理性能与运行配置,可参考用于本地部署选型。https://www.reddit.com/r/LocalLLaMA/comments/1w1jhh4/dgx_sparks_and_new_models_my_tests_and_results/[8]