
OpenAI 发布链式思维可监控性评估框架,研究随着模型扩展和强化学习优化,推理透明性如何变化。关键发现:监控 CoT 远优于仅监控行为,思考时间越长可监控性越好,强化学习不会显著损害可监控性。
推理透明性的新挑战 随着 AI 系统在决策过程中变得越来越复杂,直接监督其行为变得愈发困难。OpenAI 在其最新研究中提出,监控模型的内部推理过程(即链式思维,Chain-of-Thought, CoT)是理解其决策机制的关键手段。然而,这种可监控性(Monitorability)是否能在模型规模扩大、训练方法变化时保持稳定,仍是业界关注的焦点。
可监控性是指监控器(Monitor)根据智能体(Agent)的行为预测其关键属性的能力。这些属性可能包括欺骗、奖励黑客(Reward Hacking)等不良行为,也可能涉及良性特征,如是否依赖特定提示或遵循特定推理路径。 可监控性是一个双向属性:它既取决于监控器的能力,也取决于被监控的智能体。例如,更智能的监控器能从相同信号中提取更多信息;而某些智能体的思维过程可能比其他智能体更难理解。
与早期通过提示“逐步思考”生成的 CoT 不同,现代推理模型(如 GPT-5 Thinking)有两个关键差异:
OpenAI 提出了包含 13 项评估(共 24 个环境)的框架,分为三种原型:
通过人为引入特定行为(如偏见、欺骗),测试监控器能否从 CoT 中检测出这些行为。
评估监控器能否跟踪推理过程中的关键步骤,例如模型是否使用了特定策略或犯了逻辑错误。
测试监控器能否从 CoT 中预测最终输出的属性,如答案的正确性或可信度。
在几乎所有测试场景中,监控 CoT 比仅监控动作和最终输出有效得多。例如,在检测欺骗行为时,CoT 监控的准确率比行为监控高出 30% 以上。
研究发现,随着模型“思考”时间增加(即 CoT 长度增加),可监控性显著提升。这为平衡推理计算与监控效果提供了新思路。
在当前的模型规模下,强化学习优化并未明显损害 CoT 的可监控性。这是一个积极信号,表明可以在不牺牲透明性的前提下提升模型能力。
当模型以低推理努力运行时,较小模型在较高推理努力下可以达到相当的能力,同时更易于监控。这种权衡需要额外的推理计算,称为“可监控性税”(Monitorability Tax)。
通过向模型提出后续问题并监控其生成的 CoT,可以进一步改善监控效果。这表明交互式监控可能比单次监控更有效。
OpenAI 将自家模型与 Claude 3.7 Sonnet、DeepSeek R1-0528-Qwen3-8B 和 Kimi K2 Thinking 等外部模型进行了比较。结果表明,大多数前沿推理模型都具有相当的可监控性,尽管并非完美。
OpenAI 呼吁整个行业的研究人员共同努力,尽可能长久地保持 CoT 的可监控性,并确定它能否作为未来 AI 系统的负载支撑控制层。为了实现这一目标,必须能够准确测量可监控性——这正是本研究框架的目标。 随着 AI 系统在医疗、金融、自动驾驶等高风险场景中的部署日益广泛,确保推理过程的透明性将成为构建可信 AI 的关键。未来的研究需要探索:
OpenAI 的这项研究为评估和保持链式思维可监控性提供了系统性的框架和基准。关键发现包括:CoT 监控远优于行为监控、思考时间越长可监控性越好、强化学习不会显著损害可监控性。这些结果对于开发安全、可解释的 AI 系统具有重要指导意义,也为未来的监管和治理提供了技术基础。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

英伟达内部实践显示,ChatGPT Work正帮助企业团队将信息整合工作自动化,每周节省16小时,并将原型开发周期从数周缩短至数天。这一案例揭示了AI工作流从工具到组织资产演进的趋势。

OpenAI 将 GPT-5.6 系列模型(Sol、Terra、Luna)集成至 Kiro 开发代理,通过规格驱动方法实现约 82% 的成本降低,标志着 AI 编程从能力竞赛转向成本效率竞争。

OpenAI因模型网络能力逼近关键门槛而调整开发策略,强调安全需贯穿训练全周期。文章解析其技术升级,并对比国内AI安全建设路径。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。