
OpenAI 对 SWE-Bench Pro 的详细审计发现约 30% 的任务存在缺陷,主要源于过于严格的测试、提示不明确、低覆盖率测试和误导性提示。这强调了评估基准持续审计的重要性。
在人工智能模型开发中,准确衡量模型能力对于安全部署和决策至关重要。OpenAI 在其准备框架(Preparedness Framework)下,每次发布模型时都会报告多种外部和内部基准测试结果,以跟踪模型进展。然而,当评估本身存在缺陷时,结果可能误导对能力的理解,错误呈现安全案例,并影响研究优先级。 此前,OpenAI 发现广泛使用的代码基准 SWE-bench Verified 存在根本性设计和污染问题,该评估不再能提供有意义的软件开发能力信号。当时,OpenAI 鼓励社区转向 SWE-Bench Pro。
的设计初衷 SWE-Bench Pro 旨在改进 SWE-bench Verified,通过测试模型在更长周期和更真实编码任务上的表现,更好地追踪智能体编码能力。与 SWE-bench Verified 类似,任务从一组公共和私有仓库的功能变更历史中程序化生成。模型需要实现一个解决方案,通过新功能的测试,同时不破坏现有功能。在 731 个任务的公开分割中,前沿模型在八个月内通过率从 23.3% 提升至 80.3%。
OpenAI 对 SWE-Bench Pro 进行了类似审计,使用数据点分析管道审查数据集。该管道检查模型尝试、任务元数据和失败痕迹,以标记可能的评估缺陷。每个被标记的任务随后通过多个调查智能体通道评估,并由五位经验丰富的软件工程师独立审查,分歧升级以进一步调查。 审计发现,数据集中相当大比例的任务存在破坏性问题。数据点分析管道标记了 200 个(27.4%)有缺陷的任务,而人工标注活动识别出 249 个(34.1%)。问题主要分为四类: 1. 过于严格的测试:强制要求提示中未指定的实现细节,导致许多功能正确的提交被判定为失败。
OpenAI 的目标是确保任务失败反映模型真正局限,任务成功反映对提示要求的完整有效解决方案。为检查评估数据质量,创建了质量保证管道,评估每个数据点是否准确反映模型能力。 初始数据质量管道标记问题以供审查。通过更深入的智能体辅助审计和与经验丰富的工程师合作的人工标注活动进行验证。初始自动过滤器检查模型指令、模型尝试和用于评分的测试,标记可能有问题或错误的示例。该过滤器标记了 286 个潜在有缺陷的任务。然后通过两种方式对该子集进行深入审查:
人工监督的智能体审查:使用基于 Codex 的调查智能体进行审计,这些智能体可访问任务仓库和环境,帮助区分合理任务歧义与真正的不明确性。智能体可以运行测试、检查仓库文件,并调查模型尝试及其常见失败模式。经过多次独立重复审计后,研究人员审查摘要、做出最终判断并标记可能的问题。
人工标注活动:与经验丰富的软件工程师合作,对标记子集进行审查。每位工程师独立审查任务,从可见问题陈述、测试用例和真实参考解决方案开始,然后使用管道分析或转录作为支持上下文。工程师分配标签和严重性评级,并升级分歧或低信心案例。
人类审查员比调查智能体更可能将任务标记为有缺陷。两种审查路径在类别上存在一些分歧,但在任何标记任务中,“未缺陷”都不是最常见的人类标签。在智能体管道标记的类别中,审查员的判断在 74% 的案例中重叠。 与智能体管道相比,人类审查员更可能为任务选择多个标签,表明他们发现任务以多种方式存在缺陷或不能整齐地归入单一类别。这表明智能体加审查员管道导致保守标记:它捕获了人类识别的相同广泛失败模式,同时低估了审查员看到额外或重叠问题的案例。
OpenAI 的审计揭示了 SWE-Bench Pro 中约 30% 的任务存在缺陷,主要源于过于严格的测试、提示不明确、低覆盖率测试和误导性提示。这些发现强调了策划困难但公平的基准的难度,以及智能体用于可扩展数据质量检查的日益增长的效用。OpenAI 建议模型开发者仔细检查结果,并考虑使用类似管道进行质量保证。 对于 AI 社区而言,这提醒我们评估基准本身需要持续审计和更新。随着模型能力提升,旧基准可能失去区分度或引入噪声。OpenAI 将继续发布评估结果,并鼓励社区采用更严格的质量控制措施。 关键词:OpenAI News, SWE-Bench Pro, 代码评估, 基准测试, AI 模型能力
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

英伟达内部实践显示,ChatGPT Work正帮助企业团队将信息整合工作自动化,每周节省16小时,并将原型开发周期从数周缩短至数天。这一案例揭示了AI工作流从工具到组织资产演进的趋势。

OpenAI 将 GPT-5.6 系列模型(Sol、Terra、Luna)集成至 Kiro 开发代理,通过规格驱动方法实现约 82% 的成本降低,标志着 AI 编程从能力竞赛转向成本效率竞争。

OpenAI因模型网络能力逼近关键门槛而调整开发策略,强调安全需贯穿训练全周期。文章解析其技术升级,并对比国内AI安全建设路径。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。