本期社区涌现多个实用工具和优化技巧,包括Codex优化DeepSeek V4带来1.6x预填充加速、LivePortrait蒸馏模型在浏览器实现25fps肖像动画、Athanor Lite简化本地模型部署,以及Supra Reasoning Summarizer等小模型发布。

模型动态

GLM 5.2 FP8在Terminal-Bench上获79.8%通过率

在H200上测试GLM 5.2 FP8模型(含FP8 KV缓存)在Terminal-Bench 2.1获得79.8%通过率,为FP8部署提供性能参考。来源:Reddit[4]

发布Supra Reasoning Summarizer小模型总结代码智能体思考

发布800M参数GGUF模型Supra Reasoning Summarizer,用于总结代码智能体思考轨迹并输出JSON,针对特定场景的小型实用模型。来源:Reddit[6]

产品工具

Codex优化DeepSeek V4 Flash 8-bit MLX推理加速

通过Codex优化DeepSeek V4 Flash 8-bit MLX模型在oMLX上推理速度,Prefill加速约1.6倍,Decode加速约3倍,对Mac Studio等设备有实际价值。来源:Reddit[1]

LivePortrait蒸馏模型浏览器25fps肖像动画

通过蒸馏技术,LivePortrait在浏览器中以WebGPU实现25fps肖像动画生成,远快于原始ONNX版本,展示高效边缘端模型优化方法。来源:Reddit[2]

Athanor Lite免费桌面应用简化本地模型部署

开源桌面应用Athanor Lite自动扫描硬件配置,简化本地模型部署流程,对不熟悉技术配置的用户友好,降低使用门槛。项目地址:https://www.reddit.com/r/LocalLLaMA/comments/1uohd0v/[3]

开源项目构建本地模型信任管道系统

开发者构建本地模型信任管道系统,通过隐藏测试为模型分配工作权限并开源,展示了模型质量评估与任务分发的实用框架。项目地址:https://www.reddit.com/r/LocalLLaMA/comments/1uoem9g/[5]