Bingdada 技术博客Bingdada 技术博客
首页博客SEOGEOAEOAI工具关于
登录注册
Logo

Bingdada 技术博客

专注于SEO搜索引擎优化和GEO生成式引擎优化以及未来人工智能发展趋势的技术博客

快速链接

  • 首页
  • 博客文章
  • 关于我们

联系方式

  • 398848662@qq.com

订阅我们的 Newsletter,获取最新的 SEO 和 GEO 技术资讯。

© 2024 Bingdada 技术博客. All rights reserved.

首页博客AI人工智能为什么我们不再使用SWE-bench Verified评估模型?OpenAI最新分析揭示关键缺陷
为什么我们不再使用SWE-bench Verified评估模型?OpenAI最新分析揭示关键缺陷
AI人工智能

为什么我们不再使用SWE-bench Verified评估模型?OpenAI最新分析揭示关键缺陷

bingdadabingdada
八月 2, 202659 次阅读约 6 分钟阅读
快速回答

OpenAI发布研究宣布停止使用SWE-bench Verified评估模型编程能力,发现测试用例缺陷导致正确解决方案被拒绝,以及训练数据污染问题。该基准得分不再反映真实能力提升,OpenAI建议转向SWE-bench Pro。

核心要点
  • 为什么我们不再使用SWE-bench Verified评估模型?OpenAI最新分析揭示关键缺陷
目录

目录

  • 为什么我们不再使用SWE-bench Verified评估模型?OpenAI最新分析揭示关键缺陷
  • SWE-bench Verified的诞生与初衷
  • 进展放缓引发质疑
  • 两大核心缺陷
  • 对行业的影响与建议
  • 未来展望:更可靠的评估体系
  • 结论
  • 相关阅读
  • 关于 Bingdada

为什么我们不再使用SWE-bench Verified评估模型?OpenAI最新分析揭示关键缺陷

2026年2月23日,OpenAI发布了一项重要研究,宣布停止使用SWE-bench Verified作为前沿模型编程能力的评估基准。这一决定源于对基准测试本身存在严重缺陷的发现,这些缺陷使得测试结果无法真实反映模型的自主软件工程能力。本文将深入分析OpenAI的研究发现,探讨其对行业评估标准的影响,并展望未来的评估方向。

SWE-bench Verified的诞生与初衷

自2024年8月OpenAI首次发布SWE-bench Verified以来,它迅速成为业界衡量模型在自主软件工程任务上进展的标准指标。这一基准测试旨在解决原始SWE-bench评估中存在的问题,如某些任务因测试用例缺陷而无法完成等。原始SWE-bench评估于2023年发布,每个问题源自12个开源Python仓库中的已解决GitHub问题,并配以相应的拉取请求。模型需要根据问题描述生成代码更改,并通过两组测试:一组是失败测试(修复后应通过),另一组是回归测试(确保无关功能不受影响)。 然而,原始评估存在多个问题:某些单元测试过于具体或与任务不匹配,导致正确修复被拒绝;许多任务描述不明确,允许多种有效解释,但测试仅覆盖其中一种;环境配置差异(如Linux与Windows、Python版本不同)可能导致测试意外失败。为此,OpenAI与专家软件工程师合作,审查了1,699个SWE-bench问题,筛选出500个高质量问题,形成了SWE-bench Verified。

进展放缓引发质疑

在最初的飞跃之后,SWE-bench Verified上的最新技术进展明显放缓——在过去6个月内,得分仅从74.9%提升至80.9%。这一现象引发了一个关键问题:剩余的失败是反映了模型能力的局限,还是数据集本身的特性?OpenAI的分析给出了令人震惊的答案。

两大核心缺陷

OpenAI的研究发现了SWE-bench Verified的两个主要问题,表明该基准已不再适合衡量前沿模型的自主软件工程能力:

1. 测试用例拒绝正确解决方案

OpenAI审计了模型经常失败的数据集子集(占27.6%),发现其中至少59.4%的问题存在有缺陷的测试用例,这些测试用例错误地拒绝了功能正确的提交。尽管在创建SWE-bench Verified时已尽力改进,但问题依然存在。 具体表现为两种模式:

  • 过窄的测试用例:占审计问题的35.5%,这些测试用例强制执行特定的实现细节,导致许多功能正确的提交被无效化。例如,测试可能要求使用特定函数名或实现方式,而模型生成的等效解决方案却被拒绝。
  • 过宽的测试用例:占审计问题的18.8%,这些测试检查了问题描述中未指定的额外功能。模型可能正确解决了原始问题,但因未处理未要求的额外功能而失败。
  • 其他杂项问题:占5.1%,包括测试环境依赖、不明确的错误信息等。 一个典型例子是pylint-dev__pylint-4551问题,其中拉取请求引入了新函数get_annotation,但测试用例却要求模型必须使用特定命名,导致功能正确的解决方案被拒绝。

2. 训练数据污染

更严重的问题是,所有前沿模型在训练过程中都可能接触过SWE-bench问题及其解决方案。SWE-bench的问题来自开源仓库,许多模型提供商将这些仓库用于训练目的。OpenAI的分析发现,所有测试的前沿模型都能复现原始的人工编写的错误修复(即黄金补丁),或逐字复现某些任务的问题描述细节,这表明它们至少在训练中见过部分问题和解决方案。 研究发现,在训练中见过问题的模型更有可能成功,因为它们拥有通过测试所需的额外信息,而这些信息在问题描述中并未明确给出。这意味着SWE-bench Verified得分的提升不再反映模型真实软件开发能力的进步,而是越来越多地反映模型在训练时接触基准测试的程度。

对行业的影响与建议

基于这些发现,OpenAI已停止报告SWE-bench Verified得分,并建议其他模型开发者采取同样做法。这一决定对AI行业具有深远影响: 1. 评估标准需要更新:许多前沿模型发布时都引用SWE-bench Verified得分作为能力证明,但这些得分可能已被污染,不再具有参考价值。

  1. 推动新基准开发:OpenAI正在构建新的、未受污染的评估体系,以更好地跟踪编程能力。直到这些新基准就绪,OpenAI建议报告SWE-bench Pro的结果。
  2. 行业协作至关重要:整个研究社区需要聚焦于开发更可靠的评估方法,避免类似的数据污染问题。

未来展望:更可靠的评估体系

OpenAI的研究强调了评估基准设计的重要性。理想的基准应具备以下特征:

  • 测试用例与任务描述严格对齐:避免过窄或过宽的测试,确保功能正确的解决方案不被错误拒绝。
  • 防止数据污染:使用私有或动态生成的问题集,确保模型在训练中无法接触。
  • 环境无关性:测试结果不应依赖于特定的操作系统、库版本或配置。
  • 多维度评估:不仅关注代码正确性,还应考虑代码质量、效率、可维护性等。

结论

SWE-bench Verified的退场标志着AI评估领域的一个重要转折点。它提醒我们,基准测试本身需要不断演进和验证,才能继续作为能力进步的可靠指标。OpenAI的坦诚分析为行业树立了榜样,即当评估工具不再有效时,应主动承认并推动改进。对于开发者、研究人员和用户而言,这意味着在参考任何模型得分时,都需要保持批判性思维,理解其背后的局限性和潜在偏差。 随着新评估体系的建立,我们有望获得更准确、更可靠的模型能力衡量标准,从而推动AI编程技术的健康发展。


相关阅读

  • Braintrust 如何利用 Codex 在几分钟内将客户需求转化为代码

  • OpenAI 宣布退役 GPT-4o 等旧模型,聚焦 GPT-5.2 升级

  • OpenAI披露“科技与关税”行动:疑似中国背景账号滥用AI干预美国科技政策讨论

关于 Bingdada

Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。

目录

  • 为什么我们不再使用SWE-bench Verified评估模型?OpenAI最新分析揭示关键缺陷
  • SWE-bench Verified的诞生与初衷
  • 进展放缓引发质疑
  • 两大核心缺陷
  • 对行业的影响与建议
  • 未来展望:更可靠的评估体系
  • 结论
  • 相关阅读
  • 关于 Bingdada
黄金广告位 · 限时招商
广告位招商中

把品牌放进读者的阅读流

文章内广告位,高注意力场景,适合新品发布与活动招募。

商务合作

标签

#OpenAI News#SWE-bench Verified#AI评估基准#编程能力测试#数据污染
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

相关文章

从英伟达内部实践看ChatGPT Work如何重塑企业知识工作流
AI人工智能

从英伟达内部实践看ChatGPT Work如何重塑企业知识工作流

英伟达内部实践显示,ChatGPT Work正帮助企业团队将信息整合工作自动化,每周节省16小时,并将原型开发周期从数周缩短至数天。这一案例揭示了AI工作流从工具到组织资产演进的趋势。

8月 25约 9 分钟阅读
GPT-5.6 登陆 Kiro:AI 编程成本效率迎来新拐点
AI人工智能

GPT-5.6 登陆 Kiro:AI 编程成本效率迎来新拐点

OpenAI 将 GPT-5.6 系列模型(Sol、Terra、Luna)集成至 Kiro 开发代理,通过规格驱动方法实现约 82% 的成本降低,标志着 AI 编程从能力竞赛转向成本效率竞争。

8月 25约 6 分钟阅读
AI安全新纪元:OpenAI如何为关键网络能力时代重新校准模型开发节奏
AI人工智能

AI安全新纪元:OpenAI如何为关键网络能力时代重新校准模型开发节奏

OpenAI因模型网络能力逼近关键门槛而调整开发策略,强调安全需贯穿训练全周期。文章解析其技术升级,并对比国内AI安全建设路径。

8月 24约 10 分钟阅读

订阅我们的 Newsletter

获取最新的 SEO 与 GEO 技术资讯。

我们尊重您的隐私,随时可以取消订阅。

评论 ({count}) (0)

登录后即可参与讨论

登录注册
还没有评论,来抢沙发吧