Anthropic 发布内省适配器研究,让模型自报潜在不对齐行为
Anthropic Fellows 研究推出【内省适配器】,允许语言模型自我报告训练中学到的行为,包括潜在的不对齐问题,为 AI 安全提供新工具。[7]
本期重点:OpenAI DevDay 2026定档9月29日并推出基于GPT-5.5的创作竞赛;Anthropic发布内省适配器研究,让模型自报潜在不对齐行为;【曦智科技】作为全球AI硅光芯片第一股登陆港交所。