
OpenAI联合AMD、博通、英特尔、微软和英伟达发布MRC协议,这是一种新型网络协议,通过多平面网络、自适应数据包喷洒和静态源路由,显著提升大型AI训练集群的GPU网络性能和弹性。MRC已部署在英伟达GB200超级计算机上,并通过开放计算项目向行业开放。
随着模型规模的指数级增长,训练这些前沿模型所需的计算资源也在急剧膨胀。在Stargate超级计算机项目启动之前,OpenAI已经与合作伙伴共同开发并维护了三代超级计算机。这些宝贵经验让团队深刻认识到:要高效利用Stargate级别的算力并成功实现使命,必须重新思考并大幅降低每一层技术栈的复杂性——网络设计首当其冲。 2026年5月5日,OpenAI正式宣布与AMD、博通(Broadcom)、英特尔(Intel)、微软(Microsoft)和英伟达(NVIDIA)联合开发了MRC(Multipath Reliable Connection,多路径可靠连接)协议。这是一个全新的网络协议,旨在提升GPU在大型训练集群中的网络性能和弹性。MRC规范已通过开放计算项目(OCP)发布,供整个行业使用和构建。
当训练大型AI模型时,单个训练步骤可能涉及数百万次数据传输。一次传输的延迟会像涟漪一样波及整个任务,导致GPU空闲等待。网络拥塞、链路和设备故障是造成传输延迟和抖动的最常见原因。 随着集群规模增大,这些问题变得更加频繁且难以解决。这使得网络技术成为Stargate设计的关键组成部分。为了达到Stargate超级计算机的当前规模,OpenAI面临两大网络挑战: 1. 最小化网络拥塞可能性:存在一些不可避免的瓶颈,例如两个GPU同时向同一目的地发送数据。但除此之外,应通过设计避免拥塞。
OpenAI的目标不仅是构建一个快速的网络,还要构建一个即使在故障情况下也能提供高度可预测性能的网络,以保持训练任务持续进行。为了实现这种可靠性,OpenAI的扩展团队与AMD、博通、英特尔、微软和英伟达在过去两年中合作开发了一种构建和运营网络的新方法。 这项努力的成果就是MRC(多路径可靠连接)技术。它是一种内置于最新800Gb/s网络接口中的新型网络协议,允许将单个传输分散到数百条路径上,在微秒级内绕过故障,并运行更简单的网络控制平面。 MRC扩展了融合以太网上的RDMA(RoCE)——这是InfiniBand贸易协会(IBTA)的标准,支持GPU和CPU之间的硬件加速远程直接内存访问。它借鉴了超以太网联盟(UEC)开发的技术,并使用基于SRv6的源路由进行扩展,以支持大规模AI网络架构。
构建高弹性网络需要从具有足够天然冗余的网络拓扑开始,这样即使网络中的链路或交换机发生故障,所有流量仍能获得良好性能。MRC没有将每个网络接口视为一个800Gb/s链路,而是将其拆分为多个较小的链路。例如,一个接口可以连接到八个不同的交换机。 然后可以构建八个独立的并行网络(或称为“平面”),每个以100Gb/s运行,而不是单个800Gb/s网络。这一改变对集群的形态产生了巨大影响。一个可以连接64个800Gb/s端口的交换机,现在可以连接512个100Gb/s端口。这使得只需两层交换机就能构建一个完全连接约131,000个GPU的网络。而传统的800Gb/s网络则需要更多层。
MRC的自适应数据包喷洒技术能够智能地将数据流分散到多个路径上,从而几乎消除了核心拥塞。传统的负载均衡方法往往无法适应动态变化的网络状况,而MRC可以实时调整数据包的传输路径,确保网络资源得到最有效的利用。
MRC的部署使用静态源路由来绕过故障,并消除整类路由故障。与传统的动态路由协议不同,静态源路由在数据包发送时就已经确定了完整路径。这种方法不仅简化了网络控制平面,还避免了因路由计算和收敛而引入的延迟和不确定性。
MRC已经部署在OpenAI所有最大的英伟达GB200超级计算机上,这些计算机用于训练前沿模型,包括位于德克萨斯州阿比林的Oracle云基础设施(OCI)站点以及微软的Fairwater超级计算机。MRC已被用于训练多个OpenAI模型,利用了英伟达和博通的硬件。 OpenAI还共同撰写了一篇详细描述经验的论文:“使用MRC和SRv6的弹性AI超级计算机网络”(Resilient AI Supercomputer Networking using MRC and SRv6)。
发布MRC规范是OpenAI整体计算战略的一部分:在关键基础设施层共享标准,有助于更高效、更可靠地扩展AI系统,并在更广泛的合作伙伴生态系统中推广。 通过将MRC贡献给开放计算项目(OCP),OpenAI使整个行业都能利用这项技术。这不仅加速了AI模型的训练过程,还降低了构建和维护大规模AI计算集群的门槛。对于任何正在构建或计划构建大型AI训练基础设施的组织来说,MRC提供了一种经过验证的方法来应对网络挑战。
随着AI模型不断向更大规模演进,网络技术的重要性日益凸显。MRC协议的出现标志着AI训练网络设计的一个重要里程碑。通过多平面网络、自适应数据包喷洒和静态源路由的有机结合,MRC为超大规模AI训练提供了前所未有的性能和可靠性。 OpenAI与AMD、博通、英特尔、微软和英伟达的合作表明,解决AI基础设施挑战需要整个生态系统的共同努力。随着MRC规范的开放和推广,我们可以期待看到更多创新应用和优化,最终推动AI技术向更高层次发展。 对于关注OpenAI新闻的读者来说,MRC的发布不仅是一项技术突破,更是AI基础设施演进方向的重要信号。在追求更强大AI模型的旅程中,网络创新将继续扮演关键角色。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

英伟达内部实践显示,ChatGPT Work正帮助企业团队将信息整合工作自动化,每周节省16小时,并将原型开发周期从数周缩短至数天。这一案例揭示了AI工作流从工具到组织资产演进的趋势。

OpenAI 将 GPT-5.6 系列模型(Sol、Terra、Luna)集成至 Kiro 开发代理,通过规格驱动方法实现约 82% 的成本降低,标志着 AI 编程从能力竞赛转向成本效率竞争。

OpenAI因模型网络能力逼近关键门槛而调整开发策略,强调安全需贯穿训练全周期。文章解析其技术升级,并对比国内AI安全建设路径。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。