
OpenAI 发布 GPT-5.4,这是其用于专业工作最强大、最高效的前沿模型,在推理、编码和智能体工作流方面取得重大突破,支持原生计算机操作,上下文窗口达100万令牌。
2026年3月5日,OpenAI 正式发布 GPT-5.4,这是其迄今为止用于专业工作最强大、最高效的前沿模型。该模型已在 ChatGPT(作为 GPT-5.4 Thinking)、API 和 Codex 中上线。同时,OpenAI 还推出了 GPT-5.4 Pro 版本,面向需要在复杂任务中获得极致性能的用户。
GPT-5.4 将 OpenAI 近期在推理、编码和智能体工作流方面的最新进展整合到一个统一的前沿模型中。它融合了 GPT-5.3-Codex 行业领先的编码能力,同时显著改进了模型在跨工具、跨软件环境以及涉及电子表格、演示文稿和文档的专业任务中的表现。
推理能力:GPT-5.4 在通用推理方面取得重大进展,在 GDPval 基准测试中,83.0% 的对比中达到或超过了行业专业人士的水平,而 GPT-5.2 仅为 70.9%。
编码能力:继承并优化了 GPT-5.3-Codex 的编码优势,在 SWE-Bench Pro 测试中达到 57.7% 的胜率。
计算机使用:首次在通用模型中原生支持最先进的计算机操作能力,使智能体能够跨应用程序操作计算机并执行复杂工作流。
工具集成:通过工具搜索功能,帮助智能体更高效地发现和使用合适的工具,同时不牺牲智能水平。
令牌效率:相比 GPT-5.2,GPT-5.4 使用显著更少的令牌解决问题,带来更快的速度和更低的成本。
在 ChatGPT 中,GPT-5.4 Thinking 现在能够提供其思考过程的前期计划,让用户可以在模型工作过程中调整方向,从而无需额外轮次就能获得更符合需求的最终输出。此外,GPT-5.4 Thinking 还改进了深度网络研究能力,特别擅长处理高度具体的查询,同时更好地维护需要更长思考时间的问题上下文。
Codex 中的强大功能 对于开发者而言,GPT-5.4 在 API 和 Codex 中提供了多项关键改进:
原生计算机使用能力:支持智能体通过 Playwright 等库编写代码操作计算机,以及直接发出鼠标和键盘指令。
超长上下文支持:最多支持 100 万个令牌的上下文,使智能体能够规划、执行和验证跨长时间跨度的任务。
工具生态系统:改进了模型在大型工具和连接器生态系统中的工作方式,通过工具搜索帮助智能体更高效地找到和使用合适的工具。
GPT-5.4 在知识工作方面的提升尤为显著。在模拟初级投资银行分析师工作的电子表格建模任务内部基准测试中,GPT-5.4 的平均得分达到 87.3%,而 GPT-5.2 仅为 68.4%。 在演示文稿评估方面,人类评审员在 68.0% 的情况下更偏好 GPT-5.4 生成的演示文稿,原因在于其更强的美学设计、更大的视觉多样性以及更有效地使用图像生成功能。
GPT-5.4 是 OpenAI 迄今为止最注重事实准确性的模型。在用户标记事实错误的去标识化提示集合中,与 GPT-5.2 相比: - 单个声明的错误可能性降低 33%
Mercor 首席执行官 Brendan Foody 表示:“GPT-5.4 是我们尝试过的最好的模型。它在我们的 APEX-Agents 基准测试中位居榜首,该基准测试衡量模型在专业服务工作中的表现。它擅长创建长期交付物,如幻灯片、财务模型和法律分析,在提供顶级性能的同时,运行速度更快,成本低于竞争性前沿模型。” Harvey 应用研究主管 Niko Grupen 补充道:“GPT-5.4 为文档密集型法律工作设立了新标准。在我们的 BigLaw Bench 评估中,它获得了 91% 的分数。与其他模型相比,GPT-5.4 目前更擅长构建复杂的交易分析,在长合同上保持准确性,并提供法律从业者所需的高水平细节。”
| 基准测试 | GPT-5.4 | GPT-5.3-Codex | GPT-5.2 |
|---------|---------|--------------|---------| | GDPval (胜率或平局) | 83.0% | 70.9% | 70.9% | | SWE-Bench Pro (公开) | 57.7% | 56.8% | 55.6% | | OSWorld-Verified | 75.0% | 74.0%* | 47.3% | | Toolathlon | 54.6% | 51.9% | 46.3% | | BrowseComp | 82.7% | 77.3% | 65.8%* | *注:GPT-5.3-Codex 使用新引入的 API 参数保持原始图像分辨率后达到 74.0%。GPT-5.2 的 BrowseComp 分数此前报告为 64.7%。
GPT-5.4 现已通过以下渠道提供:
ChatGPT:作为 GPT-5.4 Thinking 和 GPT-5.4 Pro 使用
API:面向开发者的完整模型访问
Codex:集成开发环境中的原生支持
Excel 插件:新发布的 ChatGPT for Excel 插件,特别推荐给企业客户 OpenAI 还更新了 Codex 和 API 中的电子表格和演示文稿技能,以充分利用 GPT-5.4 的能力。
GPT-5.4 的发布标志着 AI 在专业工作领域的一个重要里程碑。通过将推理、编码、计算机使用和工具集成统一到一个模型中,OpenAI 为更可靠的智能体、更快的开发者工作流以及更高质量的跨平台输出奠定了基础。随着企业用户开始探索 GPT-5.4 的能力,我们可以期待看到 AI 在专业工作流程中的更深入整合,以及更多创新应用的出现。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

英伟达内部实践显示,ChatGPT Work正帮助企业团队将信息整合工作自动化,每周节省16小时,并将原型开发周期从数周缩短至数天。这一案例揭示了AI工作流从工具到组织资产演进的趋势。

OpenAI 将 GPT-5.6 系列模型(Sol、Terra、Luna)集成至 Kiro 开发代理,通过规格驱动方法实现约 82% 的成本降低,标志着 AI 编程从能力竞赛转向成本效率竞争。

OpenAI因模型网络能力逼近关键门槛而调整开发策略,强调安全需贯穿训练全周期。文章解析其技术升级,并对比国内AI安全建设路径。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。