本期重点集中在企业级AI治理Agent工程实践本地模型部署。同时,Google探索【个性化AI】产品,社区继续关注低成本推理与本地RAG落地。

模型动态

llama.cpp新增Maple 20B-A1B三元MoE CPU支持

Maple 20B-A1B采用三元MoE架构,激活参数约1B,新增CPU支持,面向低显存本地推理。详情:https://www.reddit.com/r/LocalLLaMA/comments/1wg1o5b/llama_add_maple_20ba1b_ternary_moe_architecture/[6]

产品工具

LangSmith LLM Gateway支持组织级模型访问治理

LangChain推出LangSmith LLM Gateway,可限制密钥调用模型并阻止未授权访问,适合多模型路由与审计。详情:https://x.com/LangChain/status/2099513342171730040[1]

Google Labs展示跨应用个性化AI项目Dreambeans

Dreambeans尝试整合Gmail、日历等数据,理解用户长期偏好与重要事项,重点关注隐私保护。详情:https://x.com/GoogleAI/status/2099485845846126676[2]

技巧教程

腾讯技术强调Agent差异来自Context Engineering

文章建议从上下文组织、记忆、工具调用和任务执行系统设计Agent,而非只优化Prompt。详情:https://mp.weixin.qq.com/s?__biz=MjM5ODYwMjI2MA==&mid=2649804088&idx=1&sn=bbe53279f2c8fe79fea751faca5a264f[3]

AWS分享MMF与Databricks Genie自动化零售补货

教程结合【需求预测】、Databricks Genie与Amazon服务实现补货自动化,包含部署命令和预期输出。详情:https://aws.amazon.com/blogs/machine-learning/automate-replenishment-with-mmf-databricks-genie-and-amazon-quick/[4]

AWS梳理生成式AI从Prompt到定制模型的选型路径

文章对比Prompt Engineering、RAG、微调和定制模型,帮助团队按任务、成本与复杂度做技术选型。详情:https://aws.amazon.com/blogs/machine-learning/the-generative-ai-customization-spectrum-from-prompt-engineering-to-custom-models-on-aws/[5]

小型企业寻求支持Open WebUI的本地RAG方案

用户为约10人团队寻找本地RAG硬件后端,要求兼容合同、邮件、报价生成及Windows AD。详情:https://www.reddit.com/r/LocalLLaMA/comments/1wg5mv3/looking_for_advice-for-small-office-looking-for/[7]