开发者成功在MacBook上运行397B大模型,推理速度达29 tokens/s
用户使用M5 Max 128GBMacBook成功运行Qwen3.5-397B的2位量化版本,平均生成速度达到29 tokens/s。这得益于Unsloth的【自适应层量化】技术,将807GB的原模型压缩至106GB,证明了在消费级硬件上运行超大规模模型的可行性。[1]
本期社区围绕本地大模型和【AI智能体开发】展开热烈讨论,Qwen3.5-397B在MacBook上实现惊人推理速度,同时开发者分享了大量Claude Code实用工具与开发心得。