llama.cpp新增Maple 20B-A1B三元MoE CPU支持
Maple 20B-A1B采用三元MoE架构,激活参数约1B,新增CPU支持,面向低显存本地推理。详情:https://www.reddit.com/r/LocalLLaMA/comments/1wg1o5b/llama_add_maple_20ba1b_ternary_moe_architecture/[6]
本期重点集中在企业级AI治理、Agent工程实践与本地模型部署。同时,Google探索【个性化AI】产品,社区继续关注低成本推理与本地RAG落地。