本期聚焦前沿模型训练安全生产级Agent评估:OpenAI暂停大型RL任务加固环境,NVIDIA与LangChain分别降低模型部署和智能体质检门槛。

模型动态

微软MAI-Image-2.6-Preview升至单图编辑榜第三

MAI-Image-2.61420分升至单图编辑第三。较上代提升19分,文本渲染提高43分[3][3]

产品工具

NVIDIA推出TensorRT Model Connect公测版

TensorRT Model Connect支持两条命令转换Hugging Face模型。无需ONNX,可生成C++ API推理包。[4]

Fireworks开放Muse Glimmer 30B模型定制

Muse Glimmer 30B接入Dedicated Training API。现支持LoRA全参数微调,面向Agent与工具调用。[6]

LangSmith上线面向生产Agent的调优评估器

Tuned Evaluators可自动分析生产轨迹并反馈异常行为。首个指标为Perceived Error,官方称成本更低。[8][9][10]

LlamaParse新增文档修订记录解析能力

LlamaParse可提取文档最终状态,并保留【编辑与删除记录】。适用于法律、合规及企业知识库解析。[11]

技巧教程

智能体冷缓存可能让一句问候产生一美元费用

长上下文Agent在缓存失效后,会为历史Token重新付费。可通过上下文压缩和控制会话间隔降低冷缓存成本[5]

行业资讯

OpenAI暂停前沿模型强化学习训练并升级安全措施

OpenAI曾暂停最新模型RL训练两周。最大任务仍搁置,并强化【网络隔离】【多阶段监控】。https://t.co/ecbMMmVoox[1][2][1][2]

Vercel悬赏100万美元公开测试Sandbox安全性

Vercel投入100万美元征集Sandbox逃逸测试。参与者可使用任意模型验证沙箱隔离能力。[7]