Qwen3.6-27B-INT4在RTX 5090上达到100+ tps,支持256k上下文
社区优化后,Qwen3.6-27B-INT4在单张RTX 5090上实现105-108 tps,并完整支持256k上下文窗口。使用Lorbus量化版本配合vllm的MTP和flashinfer后端达成。模型地址:https://huggingface.co/Lorbus/Qwen3.6-27B-int4-AutoRound[1]
本期重点:Qwen3.6-27B在RTX 5090上实现100+ tps,Llama.cpp在Linux下性能显著优于Windows,DeepSeek V4实验性GGUF支持推出并实现21 t/s。