
本文深入解析了OpenAI如何用六个月时间构建GPT-Live实时语音AI系统,从轮次制到全双工流式架构的转变,以及有状态推理、异步委派和协议优化的关键技术。
在语音AI领域,知道何时开口说话比听起来要困难得多。人类说话者能在瞬间无缝切换对话,但以往的语音AI系统却难以跟上这种节奏。它们的轮次制架构依赖于被称为“轮次检测器”的小型模型,这些模型面临着艰巨的任务:猜得太早,用户会被打断;猜得太晚,响应又会显得迟缓。只有检测器做出决定后,更大的LLM才能开始工作。 GPT-Live,我们的第三代语音系统,将轮次检测器从音频路径中移除了。它的语音模型是全双工的,这意味着它可以同时听和说。这消除了对独立检测器的需求,使对话感觉更加即时和自然。当需要更深入的推理或工具使用时,GPT-Live还可以咨询我们的前沿模型,如GPT-5.5,而不会打断对话的流畅性。这些能力共同赋予GPT-Live前所未有的对话响应性和智能组合。 为了大规模提供这种体验,我们需要一种为低延迟优化的新系统架构。与典型的请求-响应推理不同,我们的系统将传入的音频流式输入语音模型,并将传出的语音流式返回给用户,同时在单独的异步路径上处理委派任务。在过去的六个月里,我们重新设计了模型推理、上下文管理和媒体传输,以确保语音从端到端流畅运行。 该架构还在核心语音路径和应用程序逻辑之间建立了清晰的边界。这使得定制应用程序行为变得容易,而不会影响响应性。这一基础支撑了ChatGPT Voice中日益增长的功能,包括新推出的在ChatGPT桌面应用中控制计算机和协调代理的能力。 在这篇文章中,我们将解释为什么早期的轮次制系统无法满足我们的需求,以及我们如何在新系统的每一层工程化响应性。我们将涵盖有状态推理、动态上下文管理、异步委派和协议级优化,所有这些协同工作,使GPT-Live真正“活”起来。
早期的语音架构继承了文本LLM的轮次制特性,但每一轮表示为离散的音频块而不是文本。在级联系统中,语音转文本、LLM和文本转语音依次运行。这种顺序增加了延迟,并忽略了语调和节奏等线索。 语音到语音模型通过直接处理音频改进了这种方法。训练模型原生理解和生成语音,使其能够保留转录中丢失的细节并更快地响应。但系统仍然依赖轮次检测器来决定推理何时开始。模型处理了更多的交互,但交互仍然是轮次制的。 GPT-Live将语音模型置于对话的控制之中:音频流入和流出模型,而更深入的推理和工具使用则异步进行。系统的主要工作是维持一个不间断的媒体循环。其他工作,如调用前沿模型和持久化对话,在实时路径之外进行。
保持这个媒体循环不间断并不总是简单的。传输、处理或推理中的任何延迟都可能变成可听的停顿或伪影。以前的轮次制系统可以容忍音频块到达时间的一些变化。然而,实时媒体系统需要按时传递每个音频帧。 早期在ChatGPT Voice和Realtime API上的工作为我们提供了重要的基础。我们已经重建了语音基础设施,以更低和更可预测的延迟直接流式传输音频和视频进出我们的系统。GPT-Live进一步推动了这一设计,通过一个新的有状态推理系统,将媒体一直流式传输到模型中,专为连续对话而构建。 流式推理只是解决方案的一部分。为了在生产中良好运行,我们还必须确保从客户端到推理栈的可靠音频传输,并处理有状态性的挑战。
我们早期的一个决定是明确地将媒体流与应用程序和业务逻辑分开。音频在客户端和语音模型之间通过专用的快速路径移动。委派、工具使用和其他应用程序工作在异步RPC边界后面进行。缓慢的工具调用或后端服务可能会延迟自己的结果,但不会阻碍媒体的流动。 这种分离还为系统提供了清晰的自定义边界。应用程序可以更改其工具、策略和后端行为,而不会影响负责保持音频移动的媒体前端。实时路径保持小巧、可预测,并专注于必须实时完成的工作。 我们用Go编写了媒体前端和推理逻辑,取代了之前的Python asyncio实现。这显著改善了帧传输的平滑性,新系统的p95与旧系统的p50相当。 WebRTC提供了传输基础。它专为低延迟媒体设计,可以在丢包、时钟漂移和客户端连接变化时继续运行。如果数据包延迟到达,WebRTC可以微妙地拉伸音频以防止间隙,然后短暂加速播放以赶上实时。 通过最小化整个系统中的缓冲和阻塞,我们可以提供人类在对话中期望的亚秒级响应性。
有状态推理有其自身的操作权衡。语音会话可能长时间保持活动,但其上下文不断增长,模型实例根据需求上下调整。我们设计了动态上下文管理,以高效地处理长期对话,同时不牺牲响应性。 我们的系统能够智能地压缩和修剪上下文,确保模型始终拥有最相关的信息,而不会陷入过时的数据。这种动态管理允许GPT-Live在长时间会话中保持连贯性和上下文意识,而不会增加延迟。 此外,我们实现了异步委派机制,使语音模型可以快速响应,同时将更复杂的推理任务(如调用GPT-5.5)委托给后台。这种分层方法确保了实时路径保持轻量,而深度智能仍然可用。
我们还在协议层面进行了优化,以减少开销并提高效率。通过精心设计WebRTC数据通道和媒体流,我们最小化了头部开销和信令延迟。我们还实现了自适应比特率控制,根据网络条件动态调整,确保音频质量在变化的环境中保持稳定。 这些优化共同作用,使GPT-Live能够在各种网络条件下提供流畅、自然的对话体验,从高速Wi-Fi到移动网络。
GPT-Live代表了语音AI的重大进步,通过全双工模型、流式推理和异步委派,实现了人类级别的对话响应性。我们的架构不仅提高了性能,还为未来的创新奠定了基础。随着我们继续优化和扩展,GPT-Live将解锁更多应用场景,从实时翻译到智能助手,彻底改变我们与AI交互的方式。 通过将实时路径与应用程序逻辑分离,我们创建了一个灵活、可扩展的系统,能够适应不断变化的需求。这不仅是技术上的胜利,更是用户体验的飞跃。我们期待看到开发者和用户如何利用GPT-Live的潜力,创造更自然、更智能的对话体验。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

英伟达内部实践显示,ChatGPT Work正帮助企业团队将信息整合工作自动化,每周节省16小时,并将原型开发周期从数周缩短至数天。这一案例揭示了AI工作流从工具到组织资产演进的趋势。

OpenAI 将 GPT-5.6 系列模型(Sol、Terra、Luna)集成至 Kiro 开发代理,通过规格驱动方法实现约 82% 的成本降低,标志着 AI 编程从能力竞赛转向成本效率竞争。

OpenAI因模型网络能力逼近关键门槛而调整开发策略,强调安全需贯穿训练全周期。文章解析其技术升级,并对比国内AI安全建设路径。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。