本期重点是Qwen3.8-Flash-Next的新本地部署实测,以及SpeakoFlow Mini这类小模型专用微调项目。MiniMax H3 Max进一步披露fal后训练与【低价视频生成】信息。

模型动态

MiniMax H3 Max上线Design并以低价提供高速视频生成

H3 Max已上线MiniMax Design,由fal后训练并针对速度优化;480p低至每秒0.02美元,含限时免费额度。https://x.com/Hailuo_AI/status/2093977756648538465[1][2][3]

Qwen3.8-Flash-Next单张96GB显卡实现17万Token上下文

社区实测量化Qwen3.8-Flash-Next可在单张96GB显卡上运行约17万Token上下文,生成速度约110 tok/s。https://www.reddit.com/r/LocalLLaMA/comments/1w2b2j0/qwen38flashnext_at_170k_context_on_a_single_96_gb/[4]

产品工具

SpeakoFlow Mini用0.8B模型专门清理语音转写口误

社区基于Qwen3.5-0.8B微调SpeakoFlow Mini,专用于修正语音转写口误,称在该窄任务上达到前沿模型效果,采用Apache-2.0许可。https://www.reddit.com/r/LocalLLaMA/comments/1w2elkb/i_finetuned_a_08b_local_model_for_dictation/[5]

Koboldcpp v1.120发布本地大模型推理工具更新

本地推理工具Koboldcpp发布v1.120版本,但原帖暂未披露具体改动,适合本地模型用户关注后续更新说明。https://www.reddit.com/r/LocalLLaMA/comments/1w2c4el/koboldcpp_v1120_released/[6]

技巧教程

用户用Qwen3.8-27B自然语言迭代制作Minecraft风格游戏

作者使用量化Qwen3.8-27B通过自然语言完成Minecraft风格克隆,并继续要求模型添加训练数据中可能不存在的功能,展示代码生成与迭代能力。https://www.reddit.com/r/LocalLLaMA/comments/1w2cxcw/some_people_said_the_minecraft_clone_i_fully/[7]