
OpenAI 发布 GPT-5.2,这是其在数学和科学领域最强大的模型。该模型在 GPQA Diamond 和 FrontierMath 等基准测试中取得突破性成绩,并成功解决了一个统计学习理论中的开放问题,展示了 AI 加速科学研究的巨大潜力。
我们希望 AI 能帮助研究人员探索更多想法,更快地测试它们,并将科学发现转化为实际影响力。在过去的一年里,我们与数学、物理学、生物学和计算机科学领域的科学家们紧密合作,旨在深入理解 AI 的助力点以及其仍然存在的局限性。上个月,我们发布了一篇论文,汇编了在数学、物理、生物、计算机科学、天文学和材料科学等多个学科中的早期案例研究。这些案例展示了 GPT-5 如何已经开始为真实的科研工作做出贡献。而随着 GPT-5.2 的发布,我们开始看到这些成果变得更加一致和可靠。
在关键科学领域展现卓越性能 GPT-5.2 Pro 和 GPT-5.2 Thinking 是我们迄今为止在科学和数学工作上最强大的模型。 扎实的数学推理能力是确保科学和技术工作可靠性的基石。这种能力使模型能够遵循多步逻辑,保持数量一致,并避免在真实分析(从模拟和统计到预测和建模)中可能累积的细微错误。在 FrontierMath 等基准测试上的改进,反映的不仅仅是狭窄的技能,而是更强的通用推理和抽象能力。这些能力可以直接转化为科学工作流程,例如编码、数据分析和实验设计。 这些能力也与通往通用人工智能(AGI)的进展密切相关。一个能够可靠地通过抽象进行推理、在长链思维中保持一致性、并跨领域泛化的系统,所展现的是 AGI 的基础特征——不是特定任务的技巧,而是广泛的、可迁移的推理技能,这些技能在科学、工程和现实世界的决策中都至关重要。 我们相信,GPT-5.2 Pro 和 GPT-5.2 Thinking 是目前世界上辅助和加速科学家工作的最佳模型。在 GPQA Diamond(一个研究生级别的、无法通过谷歌搜索作弊的问答基准测试)上,GPT-5.2 Pro 达到了 93.2% 的准确率,GPT-5.2 Thinking 紧随其后,达到了 92.4%。 > 在 GPQA Diamond 测试中,模型需要回答关于物理学、化学和生物学的多项选择题。测试期间未启用任何工具,推理努力设置为最大。 在 FrontierMath(第 1-3 级)这一专家级数学评估中,GPT-5.2 Thinking 设立了新的技术标杆,成功解决了 40.3% 的问题。 > 在 FrontierMath 测试中,模型需要解决专家级的数学问题。测试期间启用了 Python 工具,推理努力设置为最大。
解决统计学开放难题 GPT-5.2 不仅擅长解决研究生级别的科学问题。我们现在经常看到我们的前沿模型为数学和科学领域中以前未解决的、且日益微妙的问题提供解决方案。 在本案例研究中,我们将描述 GPT-5.2 Pro 如何帮助解决统计学习理论中的一个开放研究问题,相关成果已记录在一篇新论文中,题为“关于最大似然估计的学习曲线单调性”。 这个问题(“如果你收集更多数据,你的结果是否会可靠地变得更好?”)在你从数据中拟合模型时就会出现。你可以绘制一条学习曲线,追踪随着你添加更多样本,平均误差的变化。在最好的情况下,曲线是单调的。这意味着更多数据意味着更少的误差,每一步都是如此。这是人们希望看到并经常假设的行为。 但过去几年,研究人员发现这种直觉可能是错误的。一项由 Viering、Mey 和 Loog 在 2019 年学习理论会议上提出的开放问题引发的研究表明,答案通常是“不”。即使是非常简单、表现良好的实验设置,也可能产生非单调的学习曲线,即增加数据反而会增加预期误差。这个意外发现引发了一波后续论文。他们扩展了发生这种逆转情况的设置列表,并提出了越来越复杂的方法来恢复单调行为。 然而,一个最基本的情况仍未解决。在最理想的教科书场景中会发生什么?即统计模型实际上是正确的,数据遵循熟悉的钟形曲线模式,具有已知的均值但未知的标准差。研究人员已经知道,对这个设置进行微小改动就可能导致单调性失效。但在这个核心案例中,答案仍然未知。 我们的新论文证明,在这种纯净的设置中,直觉是成立的:更多的数据确实可以预测地改善学习效果,而不是表现出令人惊讶或不稳定的行为。这篇论文的不寻常之处在于获得证明的方式。作者们并没有先制定一个策略,然后要求模型填充步骤。他们也没有提供中间论证或证明大纲。相反,他们直接要求 GPT-5.2 Pro 解决这个开放问题,然后仔细验证了证明过程,包括由外部主题专家进行审查和验证。 随后,作者们提出了简单的后续问题,以探索这个思路能走多远。GPT-5.2 Pro 将结果从原始问题推广到了更高维度的设置和其他常见的统计模型。在整个过程中,人类的角色始终集中在验证和清晰写作上,而不是提供数学框架。
与科学家协作的新模式 这一结果暗示了 AI 系统支持科学研究的一个有用方向,特别是在具有公理理论基础(如数学和理论计算机科学)的领域。在这样的环境中,前沿模型可以帮助探索证明、测试假设,并识别出那些否则需要大量人力才能发现的联系。 同时,这些系统并非独立的研究人员。专家的判断、验证和领域知识仍然至关重要。即使是能力很强的模型也可能犯错或依赖未声明的假设。但是,它们也能产生详细的、结构化的论证,值得人类仔细研究。 总之,GPT-5.2 的发布标志着 AI 在科学和数学领域应用的一个重要里程碑。它不仅提升了性能,更重要的是,它展示了 AI 如何以一种全新、高效的方式与科学家协作,共同攻克难题,加速知识发现的进程。这为未来的科学研究开辟了激动人心的新篇章。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

英伟达内部实践显示,ChatGPT Work正帮助企业团队将信息整合工作自动化,每周节省16小时,并将原型开发周期从数周缩短至数天。这一案例揭示了AI工作流从工具到组织资产演进的趋势。

OpenAI 将 GPT-5.6 系列模型(Sol、Terra、Luna)集成至 Kiro 开发代理,通过规格驱动方法实现约 82% 的成本降低,标志着 AI 编程从能力竞赛转向成本效率竞争。

OpenAI因模型网络能力逼近关键门槛而调整开发策略,强调安全需贯穿训练全周期。文章解析其技术升级,并对比国内AI安全建设路径。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。