本周AI社区关注HuggingFace安全事件和【LlamaParse新增检索端点】,同时混合CPU-GPU推理论文BeeLlama.cpp更新为本地部署带来新工具。

模型动态

新论文提出混合 CPU-GPU LLM 推理自动张量调度方法

论文提出混合CPU-GPULLM推理的自动张量调度,旨在提升消费设备上大模型性能,对本地部署有研究参考价值。地址:https://www.reddit.com/r/LocalLLaMA/comments/1v0vp9k/[3]

用户测试 Qwen 3.8 模型发现思考循环和前端能力不足

有用户测试Qwen 3.8模型(2.4T参数),反馈存在【思考循环】和前端能力不足问题,提供模型评估参考。来源:https://www.reddit.com/r/LocalLLaMA/comments/1v0xanm/[5]

产品工具

LlamaParse 新增混合搜索等文档检索端点

LlamaParse 新增混合搜索、grep 等检索端点,提升文档检索能力,对【RAG开发者】有价值。详情:https://x.com/jerryjliu0/status/2078887562681430221[1]

BeeLlama.cpp v0.4.0 发布,新增多种 KV 缓存量化选项

BeeLlama.cpp v0.4.0 新增 KVarN、KV precision tail 及 q2_0-q3_1 KV cache 量化,提升本地推理效率,适合本地部署开发者。详情:https://www.reddit.com/r/LocalLLaMA/comments/1v0xjw6/[4]

行业资讯

HuggingFace 遭 AI 自主代理攻击,绕过使用政策

Reddit 报告HuggingFace安全事件,攻击者利用AI自主代理绕过使用政策,而防御工作受护栏限制,对AI基础设施安全具有重要警示意义。来源:https://www.reddit.com/r/LocalLLaMA/comments/1v0ywoi/[2]