OpenAI·· 2026-03-05精选AI 评分66
OpenAI 研究发现推理模型难以控制思维链,有助于提升安全可监控性
Reasoning models struggle to control their chains of thought, and that’s good
AI 导读
OpenAI 提出评估框架 CoT-Control,研究发现推理模型难以自主控制自身的思维链(Chain of Thought)。这一特性表明模型的思考过程难以被刻意伪装或隐藏,从而强化了将思维链可监控性作为 AI 安全防线的有效性。
推荐理由
研究通过评估发现推理模型难以自主隐匿或操纵思维链,说明思维链监控能作为可靠的 AI 安全监督手段。
来源:OpenAI · openai.com