本期重点集中在本地模型部署与【AI开发工具】进展:腾讯开源轻量语音模型,社区则带来硬件选型基准和Qwen推理加速实践。

模型动态

腾讯开源1.5B语音模型AuK-Flash

腾讯发布AuK-Flash基础语音模型,支持【四步生成与编辑】,并开源论文、代码和项目页面。项目地址:https://www.reddit.com/r/LocalLLaMA/comments/1wecf25/tencentaukflash_hugging_face/[1]

产品工具

smolbenchmark帮助用户按硬件选择本地模型

smolbenchmark面向8GB显存和移动设备,评估【解码速度、能耗与发热】,补充传统模型排行榜。项目地址:https://www.reddit.com/r/LocalLLaMA/comments/1weekio/releasing_smolbenchmark_helps_you_choose_the_best/[2]

bartowski更新Qwen3.8-27B GGUF量化文件

Qwen3.8-27B-GGUF新增按张量布局的量化文件与模型卡信息,方便开发者优化本地推理配置。详情:https://www.reddit.com/r/LocalLLaMA/comments/1webfsq/bartowskiqwen3827b_gguf_hugging_face_updated/[4]

Codex宠物支持弹窗内直接回复任务

Codex宠物新增弹窗快捷回复,无需打开客户端即可处理指定内容,并支持语音和文本输入。详情:https://x.com/xiaohu/status/2098743051170795859[5]

技巧教程

社区实测Qwen3.8-27B在16GB显卡上达到每秒60 Token

社区通过draft模型与投机解码,让Qwen3.8-27B在16GB显存上达到约60 Token/s。该结果仍属于单机实测经验:https://www.reddit.com/r/LocalLLaMA/comments/1weersc/this_draft_model_is_op_on_16_gb_cards_for_qwen_38/[3]

用户用AI五分钟完成家庭摄像头接入EasyNVR

用户分享将家庭摄像头接入EasyNVR的体验:AI处理登录信息、ONVIF和拉流配置,约五分钟完成。详情:https://x.com/geekbb/status/2098784534364119309[6]