
OpenAI在First Proof数学挑战中提交了10个证明尝试,其中至少5个被专家评估为高概率正确。这一成果展示了AI在科研级推理上的突破,包括长链推理、抽象选择和专家验证能力,为未来公开模型奠定了基础。
这一挑战由顶尖数学专家设计,旨在测试AI系统能否生成可验证的、针对特定领域问题的完整证明。与传统的选择题或竞赛数学不同,First Proof要求AI构建端到端的逻辑论证,且正确性需经专家严格审查。此次提交标志着AI在科研级推理能力上的重要进展,也是OpenAI News中备受关注的焦点事件。
OpenAI在2026年2月14日(太平洋时间)提交了所有10个First Proof问题的证明尝试。基于专家反馈,团队认为至少五个证明尝试(问题4、5、6、9、10)有很高概率正确,其余仍在审查中。值得注意的是,问题2的初步判断已被修正:根据官方评论和社区分析,该尝试被认定为不正确。OpenAI对社区的参与表示感谢,并期待持续审查。 所有证明尝试已公开,包含十个问题的完整论证以及新增的附录,其中总结了提示模式和交互示例,旨在模拟人工与模型协作的过程。
OpenAI认为,前沿研究是评估下一代AI能力的最重要方式。传统基准测试可能遗漏科研中最困难的部分:维持长链推理、选择正确的抽象、处理问题陈述中的歧义,以及生成经得起专家推敲的论证。First Proof这类挑战在正确性难以验证、失败模式具有信息价值的场景中,提供了压力测试。 OpenAI研究员James R. Lee(推理方向)表示:“我们正在训练一个新模型,其核心目标是提升推理的严谨性,使其能连续思考数小时并保持高置信度。First Proof发布时,我们觉得这是完美的测试平台。周末尝试后,模型已解决两个问题(#9和#10)。随着训练推进,它能力持续增强,最终至少解决了三个以上。看到模型一天天变得更聪明,令人难以置信。”
在提交过程中,OpenAI采用了有限的人工监督。在训练过程中,当提示模型时,团队有时会建议重试在早期尝试中证明有效的策略。对于某些问题,在收到专家反馈后,团队要求模型扩展或澄清证明的某些部分,以便更容易验证推理。此外,团队还促进了该模型与ChatGPT之间的交互,用于验证、格式化和风格调整。对于部分问题,团队通过人工判断选择了若干尝试中最佳的一个。 OpenAI承认,这是一次快速冲刺,过程并非如理想控制实验般完美。团队期待与First Proof组织者就未来迭代中更严格的实验和评估框架进行讨论。
这项工作建立在先前推理模型在数学和科学领域成果的基础上。2025年7月,OpenAI的通用推理模型在国际数学奥林匹克竞赛(IMO)中达到金牌水平(35/42分)。2025年11月,OpenAI发布了“早期加速科学实验:GPT-5”,展示了GPT-5在数学、物理、生物学等领域帮助研究者取得具体进展的案例,同时指出了观察到的局限性。最近,OpenAI报告了一项物理合作成果:GPT-5.2提出了一个胶子振幅公式的候选表达式,随后由内部模型正式证明并得到作者验证。
OpenAI期待与社区更深入合作,共同评估研究级推理能力,包括对这些尝试的专家反馈。同时,团队兴奋地宣布,这些新能力将在未来的公开模型中提供。
First Proof提交是AI推理能力的一次重要验证。它不仅展示了AI在科研级问题上的潜力,也暴露了当前方法的局限性。OpenAI将继续推动模型在严谨性、长链推理和专家级验证方面的进步,为未来的科学研究提供更强工具。
如何通过启用两个设置将ARC-AGI-3基准测试分数提升三倍(2026年7月29日)
利用ChatGPT加速学术研究者的科学发现(2026年7月29日)
智能体AI时代的科学计算(2026年7月28日)
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

英伟达内部实践显示,ChatGPT Work正帮助企业团队将信息整合工作自动化,每周节省16小时,并将原型开发周期从数周缩短至数天。这一案例揭示了AI工作流从工具到组织资产演进的趋势。

OpenAI 将 GPT-5.6 系列模型(Sol、Terra、Luna)集成至 Kiro 开发代理,通过规格驱动方法实现约 82% 的成本降低,标志着 AI 编程从能力竞赛转向成本效率竞争。

OpenAI因模型网络能力逼近关键门槛而调整开发策略,强调安全需贯穿训练全周期。文章解析其技术升级,并对比国内AI安全建设路径。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。