本期重点:Qwen3.6-27B在RTX 5090上实现100+ tpsLlama.cpp在Linux下性能显著优于Windows,DeepSeek V4实验性GGUF支持推出并实现21 t/s。

模型动态

Qwen3.6-27B-INT4在RTX 5090上达到100+ tps,支持256k上下文

社区优化后,Qwen3.6-27B-INT4在单张RTX 5090上实现105-108 tps,并完整支持256k上下文窗口。使用Lorbus量化版本配合vllm的MTP和flashinfer后端达成。模型地址:https://huggingface.co/Lorbus/Qwen3.6-27B-int4-AutoRound[1]

DeepSeek V4实验性GGUF支持发布,MacBook M3 Max达21 t/s

开发者antirez发布DeepSeek V4 Flash实验性llama.cpp支持及2位GGUF量化模型。在MacBook M3 Max上实现21 token/s,仅需128GB RAM。项目地址:https://github.com/antirez/llama.cpp-deepseek-v4-flash[3]

Qwen3.6-35B uncensored模型Heretic获好评,KLD仅0.0015

社区用户推荐Qwen3.6-35B-A3B-Heretic无审查微调模型,声称KLD仅0.0015,在24GB显存下支持262k上下文且多轮工具调用稳定。模型地址:https://huggingface.co/llmfan46/Qwen3.6-35B-A3B-uncensored-heretic[5]

产品工具

Android离线LLM应用Pocket LLM v1.5.0发布,支持语音、图像输入和OCR

Pocket LLM v1.5.0推出,新增语音输入、图像输入(含OCR、Gemma vision、FastVLM)、相机捕捉等功能,并支持侧边栏历史对话、删除模型、自定义指令等。[6]

技巧教程

用PaddleOCR-VL-1.5和llama.cpp实现图书全自动数字化

开发者分享使用PaddleOCR-VL-1.5-GGUF配合llama-server进行图书OCR的完整流程:布局检测→区域识别→生成带HTML表格的Markdown。可单命令处理整文件夹。项目地址:https://github.com/akmalayari/ocr-book[4]

硬件动态

Llama.cpp性能对比:Lubuntu比Windows 11快4%-8%,混合推理提示处理快超100%

社区实测显示,在RTX 5080上,Llama.cpp在Lubuntu 26.04下的生成速度比Windows 11快4%-8%。CPU/GPU混合推理的提示处理速度提升超100%。[2]