本期亮点:MiniMax Hub正式发布本地AI工作站;FlashMemory论文将DeepSeekV4上下文显存压缩至1.3GB;Codex新增开发者模式与速率限制保存功能。

模型动态

社区发布Gemma 4 QAT量化系列模型

社区发布Gemma 4QAT量化版本,包括12B、26B-A4B和31B等模型,适合本地部署。来源:Reddit r/LocalLLaMA。[8]

产品工具

OpenAI为Codex新增速率限制保存与开发者模式

Codex支持按需保存速率限制重置,同时引入【开发者模式】通过Chrome DevTools Protocol调试浏览器问题。Plus/Pro用户还可邀请3位朋友体验。链接:https://t.co/gucyTi04wc[1][2][3]

MiniMax Hub正式发布,定位本地AI创意工作站

MiniMax Hub声称是本地AI Agent创意工作站,支持从研究到剪辑的全流程创作。发布会信息详见官方推文。[4]

Browser Use推出隐身云浏览器供AI Agent调用

Browser Use支持用户在云中快速启动隐身浏览器,配置后交给Agent自动工作,增强代理的【隐蔽性和可控性】。[5]

阿里云发布AgentForge,一句话生成生产级Agent

AgentForge可将一句话需求快速转化为生产可用的Agent,降低AI Agent开发门槛。详情:https://mp.weixin.qq.com/s/...[6]

MTPLX V1发布:Mac上原生运行MLX MTP模型

MTPLX V1是一款原生Mac应用,专为运行和创建MLX MTP模型设计,可大幅提升推理速度(Qwen 3.6 27B 2倍TPS)。[9]

技巧教程

@向阳乔木 发布AI专用PRD文档生成Prompt

针对AI Agent开发,分享专门服务AI的PRDPrompt,提升功能完整度与开发效率。Skill安装指令:npx skills add joeseesun/qiaomu-ai-prd。来源:@vista8。[10]

行业资讯

FlashMemory论文:将DeepSeekV4上下文显存压缩至1.3GB

FlashMemory通过神经内存索引器实现1M上下文显存占用降至1.3GB,且因注意力去噪,长文本准确率提升0.6%。论文:https://t.co/03nK4gogUn 项目:https://t.co/FjbAVEHQy6[7]