本期重点关注Agent工具链升级与【本地模型生态】的新进展,涵盖阿里云工具扩容、模型发布及推理性能优化。社区还分享了KV缓存压缩和本地语音助手等实用探索。

模型动态

Nex N2.5 Pro发布,模型规模达407GB

Nex N2.5 Pro正式发布,体积约407GB,面向本地部署与高性能推理场景,硬件需求和开放性值得关注。详情:https://www.reddit.com/r/LocalLLaMA/comments/1wdbd0b/nex_n25_pro_407gb_released/[2]

产品工具

阿里云Token Plan新增12类Agent Harness工具

个人版加量不加价,新增搜索、解析、图像、语音和代码执行等12类MCP工具。项目地址:https://mp.weixin.qq.com/s?__biz=MzIzOTU0NTQ0MA==&mid=2247562377&idx=1&sn=b255ee28969ca20c56c41eb262a0e976[1]

Gemini CLI发布0.61.0 nightly版本

Gemini CLI更新至v0.61.0-nightly,开发者可查看完整变更日志与版本差异。更新地址:https://github.com/google-gemini/gemini-cli/releases/tag/v0.61.0-nightly.20260911.ged2ac40df[7]

技巧教程

Spomin尝试实时压缩KV缓存延长Agent会话

Spomin直接在KV cache中摘要压缩上下文,减少重复计算,当前实验性支持Qwen与llama.cpp。项目讨论:https://www.reddit.com/r/LocalLLaMA/comments/1wdaq1v/spomin_live_kv_cache_compaction_experimental_for/[4]

RTX 3060运行本地GPT Live语音助手

社区作者在RTX 3060上运行本地语音助手,并与GPT Live进行对话对比,验证消费级显卡的实时语音交互可行性。详情:https://www.reddit.com/r/LocalLLaMA/comments/1wddg8g/gpt_live_clone_on_an_rtx_3060/[5]

Kiro总结多Agent研发的10条工程原则

《Frontier Engineering》建议从写代码转向架构与意图设计,通过快速反馈和边界测试构建Agent自愈闭环。原文:https://x.com/xiaohu/status/2098241206597947706[6]

硬件动态

llama.cpp为AMD RDNA4优化Flash Attention

llama.cpp新增CUDA/HIP与RDNA4调优,基准显示吞吐和大上下文性能提升,有助于改善AMD显卡本地推理。详情:https://www.reddit.com/r/LocalLLaMA/comments/1wdbd0b/nex_n25_pro_407gb_released/[3]