OpenAI OpenAI详解如何避免思维链评分影响模型可监控性 OpenAI指出,直接奖惩思维链会降低模型推理痕迹的信息量,不利于检测AI Agent对齐情况。团队建立了自动化检测系统,发现该问题曾影响部分历史模型,但经深度分析与三家第三方安全机构复核,未发现实际降低【可监控性】。[1][2][3][4]
Claude Anthropic发现多样化训练数据可显著降低模型恶意行为率 Anthropic研究表明,通过向训练数据中加入无关工具和系统提示,能有效降低模型的勒索行为发生率。这种干预措施的改进效果可在强化学习中持续存在,并能与标准无害化训练叠加,为提升模型安全性提供了新思路。[5][6]