
OpenAI发布可信第三方评估新标准,强调测试框架选择对评估有效性的关键影响。文章详细介绍了三大评估目标、影响评估有效性的因素,以及如何根据不同评估目标选择合适的测试框架。
随着人工智能技术的飞速发展,前沿模型的评估方式也需要随之革新。OpenAI近日发布了一份关于可信第三方评估的指导性文件,分享了他们在评估前沿AI模型安全性和能力方面的经验与最佳实践。这份OpenAI News中提出的新标准,旨在帮助评估者和开发者更好地理解和实施有效的模型评估。
过去,许多评估将模型视为简单的聊天机器人:评估者像用户一样提问,模型回答,然后评估输出结果。然而,今天的前沿模型能力远超于此——它们可以使用工具、在多步骤中跟踪信息,并在更大的工作流程中执行操作。这意味着模型的性能不仅取决于模型本身,还取决于任务执行的环境以及促进其行动的设置。 OpenAI将这种环境设置称为“harness”(测试框架)。这个框架可以显著改变系统性能的关键方面,包括如何使用工具、如何跟踪信息以及如何从错误中恢复。这一转变从根本上改变了评估的进行方式,以及评估报告应该包含的内容。
根据OpenAI News的分享,评估测试的声明通常分为三类:
这类评估旨在回答:模型是否有可能展现出被评估的能力?例如,评估一个模型是否能够完成复杂的编程任务,或者是否具备多步推理能力。
这类评估关注:被测试的安全防护措施对特定行为或攻击的鲁棒性如何?例如,模型在面临越狱攻击时的表现,或者其内容过滤机制的有效性。
这类评估旨在回答:不同模型在同等条件下表现如何?这种评估对于行业基准测试和模型选型至关重要。
OpenAI强调,评估报告需要解释评估者如何检查可能影响结果有效性的因素。这些因素包括:
奖励破解:系统利用任务或评分器中的捷径,在不展示被评估行为的情况下获得高分。
拒绝回答:模型以模糊方式拒绝,掩盖了被测试的行为。
数据污染:由于评估任务、答案或类似变体出现在训练数据中,导致模型表现过高。
问题缺陷:由于任务无效(如评分不公或环境不可解)导致表现不佳。
故意低效:模型在被评估时故意表现不佳。
OpenAI指出,测试框架的选择对于评估结果至关重要,尤其是对于需要长时间序列操作的系统。当模型能够使用工具、保持状态并在多步骤中从错误中恢复时,测试框架可以改变观察到的性能水平,甚至决定被评估的能力是否出现。 例如,一个能够保持状态并重试失败操作的测试框架,可能让模型完成一个在简单框架中永远无法完成的多步骤任务。
| 评估声明类型 | 合适的测试框架 | 需要报告的证据 |
|------------|--------------|---------------| | 强激发下的能力 | 使用最强的可信激发设置,包括框架、工具、脚手架和预算 | 框架和工具设置、激发指导、预算/努力、令牌/成本/时间,以及为什么该设置是声称能力的可信代理 | | 受控比较 | 保持任务、评分和预算固定,使用共享框架或标准化框架 | 共享任务集、工具、评分方法、框架、预算、令牌效率/成本及已知局限性 | | 被激发攻击下的安全鲁棒性 | 使用安全测试设置,旨在在相关对手模型下激发最强的可信攻击 | 如何表征相关模型行为、安全配置、激发策略、用于执行的框架及允许的预算/努力 |
OpenAI News强调,能力声明的强度取决于其背后的激发努力。评估者需要选择最适合任务和评估目标的测试框架。标准化测试框架可能适合在相同条件下比较系统,但当它省略了帮助模型执行任务的特定框架功能时,可能会低估能力。 例如,GPT‑5.5在OpenAI的网络安全测试中的表现显示,测试框架的选择可以显著改变需要长时间、多步骤工具使用的任务的测量能力。当使用更优化的测试框架时,模型的表现明显更好。
独立、可信的第三方评估在加强AI安全生态系统中发挥着关键作用。这些评估在前沿模型上进行,为关于关键能力和安全缓解措施的声明提供额外证据。OpenAI分享的这些经验教训,有助于为评估设计提供指导,使其能够有效评估前沿模型,并帮助形成该领域的新兴标准。
基于OpenAI News的分享,评估者和开发者在进行模型评估时应考虑以下建议: 1. 明确评估目标:在开始评估前,清晰定义要测试的声明类型。
随着AI模型能力不断增强,评估方法也必须与时俱进。OpenAI发布的这份指导文件,为行业提供了一个共同的标准和最佳实践参考。通过更好的评估设计,我们可以更准确地了解模型的能力和局限性,从而更安全、更负责任地推进AI技术的发展。 这份OpenAI News不仅对评估者有重要参考价值,对模型开发者、政策制定者和AI安全研究者都具有深远意义。未来,随着评估标准的不断完善,我们有望看到一个更加透明和可信的AI生态系统。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

英伟达内部实践显示,ChatGPT Work正帮助企业团队将信息整合工作自动化,每周节省16小时,并将原型开发周期从数周缩短至数天。这一案例揭示了AI工作流从工具到组织资产演进的趋势。

OpenAI 将 GPT-5.6 系列模型(Sol、Terra、Luna)集成至 Kiro 开发代理,通过规格驱动方法实现约 82% 的成本降低,标志着 AI 编程从能力竞赛转向成本效率竞争。

OpenAI因模型网络能力逼近关键门槛而调整开发策略,强调安全需贯穿训练全周期。文章解析其技术升级,并对比国内AI安全建设路径。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。