新论文提出混合 CPU-GPU LLM 推理自动张量调度方法
论文提出混合CPU-GPULLM推理的自动张量调度,旨在提升消费设备上大模型性能,对本地部署有研究参考价值。地址:https://www.reddit.com/r/LocalLLaMA/comments/1v0vp9k/[3]
本周AI社区关注HuggingFace安全事件和【LlamaParse新增检索端点】,同时混合CPU-GPU推理论文和BeeLlama.cpp更新为本地部署带来新工具。