本期聚焦于【开源单GPU电影生成pipeline】、Claude Opus 4.7系统提示意外泄露、腾讯开源Agent记忆技术等动态,同时关注AI成本失控事件与硬件性能优化。

产品工具

开源项目实现单GPU端到端电影生成,8阶段pipeline开源

开发者发布StudioMI300,整合FLUX.2、Wan2.2等模型,输入一句话即可生成带角色、音乐、旁白的电影片段,45分钟出片。代码开源(Apache 2.0)。项目地址:https://github.com/bladedevoff/studiomi300[1]

Claude Opus 4.7 意外向用户泄露系统提示内容

用户发现Claude Opus 4.7在回复中泄露了系统提示(包括格式指南、推理示例)。模型承认这是“后台框架意外显示”,非主动分享。详情:https://pastebin.com/C0s47rjV[2]

技巧教程

本地LLM常将未来事件误判为“虚构”,问题剖析与临时解决

用户发现多款本地模型(如Gemma-4-26B)因过度RLHF训练,将超出知识截止日期的事件视为虚构或模拟,即使工具搜索结果正确也不采纳。临时方案:在系统提示中包含当前日期,但需模型厂商修复。[8]

硬件动态

RTX 5090本地LLM性能基准测试:功耗与Token速率关系实测

用户对RTX 5090进行系统测试,搭载Qwen3.6-27B Q6_K_P,对比400W-600W功耗下的Prompt解析与Token生成速度,发现PP对功耗更敏感,TG近乎线性,并公布详细曲线图。[6]

Turboquant+MTP在AMD ROCm上实现24GB GPU跑64K上下文

开发者为AMD RX 7900 XTX适配TBQ4 KV缓存+MTP推理,在llama.cpp分支上实现64K上下文仅占约20GB显存,生成速度38-54 tok/s。代码开源:https://github.com/DrBearJew/llama.cpp/tree/tbq4-rdna3-experiment[7]

行业资讯

腾讯开源Agent记忆技术方案,Token消耗最高降低61%

腾讯发布开源【Agent记忆技术】,通过结构化存储与检索优化,使任务成功率最高提升51%,Token消耗降低61%,为Agent长期记忆管理提供新方案。[3]

国产GPU开启生态开源局,SGLang等核心开发者参与

国产GPU厂商联合开源社区,共同推进GPU生态兼容与工具链优化,邀请SGLang等核心开发者参与,意图打破CUDA垄断,降低国产芯片使用门槛。[4]

AI成本失控风险加剧:AWS用户遭Claude跑单致3万美元账单

AWS Bedrock上Claude失控产生3万美元账单,成本检测工具失效。同期Notion、TikTok加速部署AI Agent,Apple思考App Store审核。分析认为云厂商将在60天内强制设置API支出上限。原文:https://www.theregister.com/saas/2026/05/14/bedrock-and-a-hard-place-claude-adventure-leaves-aws-user-staring-down-30k-invoice/[5]