NInfer引擎在RTX 5090上实现Qwen 543 tok/s解码
开源推理引擎NInfer在单张RTX 5090上实现Qwen3.6-35B-A3B模型543 tok/s单请求解码速度,技术指标显著。链接:https://www.reddit.com/r/LocalLLaMA/comments/1v1no8e/[5]
本期热点包括:Qwen3.6-35B-A3B在RTX 5090上达到543 tok/s解码速度,Unsloth正式支持AMD GPU,腾讯实现94% AI代码生成率,Kimi K3修复15个安全漏洞,以及社区热议AI Slop与额度重置差异。