
OpenAI 发布 GPT-Live,一款基于全双工架构的新一代语音模型,支持同时听与说,实现更自然的人机对话。GPT-Live 可委派深度任务给 GPT-5.5 等后台模型,保持对话流畅。即日起向全球 ChatGPT 用户推出 GPT-Live-1 和 mini 版本,未来将开放 API。
推出 GPT-Live,重新定义 AI 语音对话 2026年7月8日,OpenAI 正式发布了新一代语音模型 GPT-Live,旨在让用户与 AI 的语音对话更加自然、流畅,就像与真人交谈一样。这一重大更新已集成到 ChatGPT 的语音功能中,标志着 OpenAI News 在人工智能交互领域迈出了关键一步。GPT-Live 不仅提升了语音交互的体验,还为未来更复杂的智能体任务奠定了基础。
GPT-Live 的核心创新在于其 全双工架构,这意味着它能够同时进行“听”和“说”。与传统的语音系统不同,GPT-Live 不再需要等待用户说完才能回应。在对话过程中,它可以通过“嗯”、“对”等语气词表示正在倾听,能够快速进行你来我往的对话,也可以在用户需要思考时保持安静。这种设计让语音交互变得前所未有的轻松自然。
除了交互方式上的革新,GPT-Live 还是 OpenAI 迄今为止 最智能的语音模型。当遇到需要网络搜索、深度推理或复杂任务的问题时,GPT-Live 会自动在后台调用最新的前沿模型(如 GPT-5.5)进行处理,并将结果无缝融入当前对话。在后台模型工作时,GPT-Live 仍能保持与用户的对话流畅进行。 目前,GPT-Live 默认使用 GPT-5.5 作为后台模型。随着 OpenAI 发布新的前沿模型,GPT-Live 将自动更新升级,确保用户始终获得最先进的 AI 能力。
ChatGPT 语音体验 基于 GPT-Live 的突破性技术,ChatGPT 的语音功能迎来了全面升级。新体验更加智能、自然,让用户与 AI 的协作变得像与真人合作一样顺畅。OpenAI 认为,这项研究最终将解锁语音在更复杂、更长期、更具自主性的任务中的潜力。
从今天开始,OpenAI 向全球 ChatGPT 用户逐步推出两个版本的 GPT-Live:GPT-Live-1 和 GPT-Live-1 mini。同时,OpenAI 计划很快将 GPT-Live 引入 API,开发者和企业可以通过表单注册,第一时间获取通知。
OpenAI 回顾了语音 AI 系统的演进历程,指出过去的方案虽然推动了进步,但都存在明显的权衡。
最初的 ChatGPT 语音功能采用 级联架构,由三个模型串联工作:语音转文本(STT)模型将用户语音转为文字,大语言模型(如 GPT-5.5)生成回复,再通过文本转语音(TTS)模型将文字转回语音。这种方法首次实现了与前沿 AI 模型的语音对话,但信息在模型间传递时可能丢失,且响应速度慢、语气生硬。
后来的 ChatGPT 高级语音模式(Advanced Voice Mode)采用 轮次模型,在单一模型内处理和生成音频,减少了延迟,对话更流畅。但这种方式仍基于离散的“轮次”运作:模型必须等待用户停止说话后才能回应,导致对话显得刻板。此外,由于轮次检测依赖静音,短暂的停顿或背景噪音都可能被误判为说话结束,导致模型在不合适的时机打断用户。
GPT-Live 通过两项关键架构改进解决了上述问题:
首先,GPT-Live 采用全双工架构实现 连续交互。它不再处理一系列独立的消息,而是持续处理输入并同时生成输出。模型可以每秒多次做出交互决策:是说话、继续倾听、暂停、打断,还是调用工具。这使得模型能够进行更自然的对话,更好地把握时间节奏,甚至实现实时翻译。
其次,GPT-Live 将 连续交互 与 深度任务 分离。当用户的问题需要搜索、推理或更强大的智能体能力时,GPT-Live 可以将任务委派给其他模型(如 GPT-5.5)。这样,即使后台在处理多个任务,GPT-Live 也能保持对话继续进行。 这种架构变化还使 GPT-Live 能够持续使用最新的模型和智能体,将前沿智能与自然交互相结合。
全面领先 OpenAI 建立了全新的人工评估体系,用于衡量对话的愉悦度和流畅度。在头对头比较中,GPT-Live-1 和 GPT-Live-1 mini 在多个维度上 显著优于 高级语音模式:
GPQA:GPT-Live-1 在专家级科学推理测试(涵盖生物、化学、物理)中大幅领先高级语音模式。
BrowseComp:GPT-Live-1 在智能体网络搜索测试中表现强劲,能够高效定位难以查找的信息。
τ³-Voice Telecom:GPT-Live-1 在真实多轮电信支持任务中超越高级语音模式。 注:GPT-Live-1(即时版)和 GPT-Live-1 mini 使用 GPT-5.5 Instant 模型;GPT-Live-1 Medium 和 High 版本则使用 GPT-5.5 Thinking 模型,分别采用中等和高推理强度。
目前,每周有超过 1.5亿人 使用 ChatGPT 的语音和听写功能。他们利用语音功能获取免提的日常帮助、练习外语、讲睡前故事,或在通勤时聊天。 从今天起,当用户点击语音按钮与 ChatGPT 对话时,将立即体验到由 GPT-Live 驱动的改进版本。OpenAI 的愿景是创造一个真正自然的人机交互世界:与 AI 协作就像与另一个人合作一样流畅、响应迅速,而推理和复杂任务执行则在后台无缝进行。
GPT-Live 的发布不仅是 OpenAI News 中的一项产品更新,更标志着人机语音交互进入了一个全新纪元。通过全双工架构和深度任务委派,GPT-Live 打破了传统语音系统的局限,让 AI 对话更加自然、智能、高效。随着 GPT-Live 逐步向 API 和开发者开放,我们可以预见,语音交互将在更多场景中发挥关键作用,推动 AI 从工具向真正的协作伙伴演进。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

英伟达内部实践显示,ChatGPT Work正帮助企业团队将信息整合工作自动化,每周节省16小时,并将原型开发周期从数周缩短至数天。这一案例揭示了AI工作流从工具到组织资产演进的趋势。

OpenAI 将 GPT-5.6 系列模型(Sol、Terra、Luna)集成至 Kiro 开发代理,通过规格驱动方法实现约 82% 的成本降低,标志着 AI 编程从能力竞赛转向成本效率竞争。

OpenAI因模型网络能力逼近关键门槛而调整开发策略,强调安全需贯穿训练全周期。文章解析其技术升级,并对比国内AI安全建设路径。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。