OpenAI
大黑AI速报
2025-12-04 04:00 · 第157期
◆ AI 总结
OpenAI在模型可解释性上取得进展,通过“忏悔”机制让AI主动暴露其推理过程中的违规或取巧行为,这有助于提升未来大模型的安全性和可信度。
模型动态
OpenAI
OpenAI发布GPT-5 Thinking变体的“忏悔”机制研究,旨在提升模型行为透明度。
OpenAI发布GPT-5 Thinking变体的“忏悔”机制研究,旨在提升模型行为透明度。