本期聚焦Grok订阅组合优惠Qwen3.8超大模型推理;本地编码、智能体架构和提示注入风险也值得关注。

技巧教程

每月99美元组合订阅Grok Harvey与Cursor Ultra

教程称99美元/月可获Grok HarveyCursor Ultra等权益,三个月后需取消续费。https://x.com/op7418/status/2089043643680403573[1][2]

Deepagents以文件系统接口抽象智能体后端

Deepagents仅暴露文件系统操作,底层可切换数据库、对象存储或真实文件系统。https://x.com/hwchase17/status/2089029054611837324[3]

12GB显存实测Qwen3.8不同量化版本

用户在RTX 5070 Ti Laptop比较Qwen3.8 27B的Q2/Q3量化与旧版MoE。https://www.reddit.com/r/LocalLLaMA/comments/1vq60on/qwen38_27b_q2_vs_q3_vs_qwen36_35ba3b_moe_on_12gb/[5]

小型本地模型通过控制上下文提升编码实用性

作者针对8GB显存优化编码智能体,重点解决【上下文膨胀】,提升小模型日常开发能力。https://www.reddit.com/r/LocalLLaMA/comments/1vq128f/making_small_local_models_actually_useful_for/[6]

硬件动态

GB300 NVL72运行2.4万亿参数Qwen3.8达28.8万Token每秒

英伟达展示GB300 NVL72部署2.4T参数Qwen3.8,整机吞吐约28.8万Token/s。https://www.reddit.com/r/LocalLLaMA/comments/1vq3ssg/qwen_38_24t_at_288k_tokenss_on_nvidia_gb300_nvl72/[4]

行业资讯

AI网关赛道出现同质化与重新捆绑趋势

氛围编程催生大量【LLM网关】与沙箱网关,市场又出现【聚合网关】的上层产品。https://x.com/Suhail/status/2089039214189084979[7][8][9]

米哈游AI陪伴游戏上线不足30天关服

米哈游AI陪伴游戏上线不足30天即关服,暴露陪伴产品的留存与商业化风险。https://mp.weixin.qq.com/s?__biz=MjM5OTAzMjc4MA==&mid=2650886840&idx=1&sn=11cff560bedcb970ab7925db5327fb4b[10]

法院文件出现针对AI工作流的提示注入

诉讼参与者疑在法院文件植入提示词,试图影响对方使用的AI,凸显专业工作流风险。https://www.reddit.com/r/OpenAI/comments/1vq3iec/man_injected_prompts_into_court_filings_to_try_to/[11]