
OpenAI 通过强化学习驱动的自动化红队测试,持续强化 ChatGPT Atlas 对抗提示注入攻击的安全防线。本文深入解析了提示注入的风险、自动化攻击发现方法以及最新安全更新,展示了 OpenAI 在 AI 代理安全领域的持续投入。
2025年12月22日,OpenAI 发布了一项关于 ChatGPT Atlas 安全性的重要更新。通过强化学习驱动的自动化红队测试,OpenAI 能够主动发现并修复针对浏览器代理的现实世界漏洞,防止其被恶意利用。这一更新源于内部发现的新型提示注入攻击,并已通过对抗性训练模型和强化安全机制得到缓解。
ChatGPT Atlas 中的代理模式是 OpenAI 迄今为止发布的最通用的代理功能之一。在该模式下,浏览器代理能够像用户一样查看网页、执行操作、点击和输入键盘指令。这使得 ChatGPT 能够直接在用户的日常工作中发挥作用,利用相同的空间、上下文和数据。 然而,随着浏览器代理帮助用户完成更多任务,它也成为对抗性攻击的高价值目标。这使得 AI 安全变得尤为重要。在 ChatGPT Atlas 发布前,OpenAI 已持续构建并强化防御机制,以应对针对“浏览器中的代理”这一新范式的威胁。提示注入(Prompt Injection)是 OpenAI 积极防御的重大风险之一,旨在确保 ChatGPT Atlas 能够安全地代表用户操作。
提示注入攻击通过将恶意指令嵌入到 AI 代理处理的内容中,从而覆盖或重定向代理的行为,使其遵循攻击者的意图而非用户的指令。对于 ChatGPT Atlas 中的浏览器代理,提示注入增加了传统网络安全风险(如用户错误或软件漏洞)之外的新威胁向量。攻击者不再针对人类进行钓鱼或利用浏览器系统漏洞,而是直接攻击运行在浏览器中的代理。 举例来说,攻击者可能发送一封恶意邮件,试图诱使代理忽略用户的请求,反而将敏感的税务文件转发到攻击者控制的邮箱。如果用户要求代理查看未读邮件并总结要点,代理在工作流程中可能会读取该恶意邮件。若它遵循了注入的指令,就可能偏离任务,错误地分享敏感信息。 这只是一个具体场景。浏览器代理的通用性也扩大了风险范围:代理可能会在电子邮件及附件、日历邀请、共享文档、论坛、社交媒体帖子和任意网页中遇到不可信的指令。由于代理可以执行用户在浏览器中能执行的许多操作,成功攻击的潜在影响同样广泛:转发敏感邮件、转账、编辑或删除云端文件等。 OpenAI 在之前的博文中提到,已通过多层安全机制在防御提示注入方面取得进展。然而,提示注入仍然是代理安全领域的开放挑战,并且 OpenAI 预计将持续多年致力于此。
为了加强防御,OpenAI 持续在生产环境中搜索针对代理系统的新型提示注入攻击。发现这些攻击是构建强大防御措施的必要前提:它有助于理解现实世界风险、暴露防御漏洞并推动具体补丁。 为了实现规模化,OpenAI 构建了一个基于 LLM 的自动化攻击者,并训练其寻找能够成功攻击浏览器代理的提示注入攻击。该攻击者通过端到端强化学习进行训练,从自身的成功和失败中学习以提升红队测试技能。此外,OpenAI 允许攻击者“在发布前尝试”,即在推理过程中,攻击者可以提出候选注入指令,并将其发送到外部模拟器。模拟器会运行一个反事实推演,模拟目标受害者代理(防御者)在遇到该注入时的行为,并返回受害者代理的完整推理和行动轨迹。攻击者利用该轨迹作为反馈,迭代攻击并重新运行模拟,在提交最终攻击前多次重复此循环。这为攻击者提供了比单一通过/失败信号更丰富的上下文反馈,并显著扩展了搜索范围。
通过上述自动化红队测试,OpenAI 发现了一类新的提示注入攻击,并迅速推动了安全更新。此次更新包括:
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

OpenAI因模型网络能力逼近关键门槛而调整开发策略,强调安全需贯穿训练全周期。文章解析其技术升级,并对比国内AI安全建设路径。

OpenAI与CodeAI宣布合作,通过ChatGPT for Teens及系列教育项目,弥合青少年AI使用与理解之间的鸿沟,培养具备批判性思维和负责任的AI原生一代。

本文探讨了 Anthropic 的 Claude Opus 4.6 等模型存在的越狱漏洞,该漏洞可被利用生成色情内容,并分析了其安全机制与政策声明之间的差距,以及可能引发的合规和未成年人保护问题。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。