
OpenAI 于2026年3月25日推出全新安全漏洞悬赏计划,聚焦 AI 滥用与安全风险,覆盖智能体风险、专有信息泄露、账户完整性三大领域,作为传统安全漏洞悬赏的补充。
AI 滥用与安全风险 2026年3月25日,OpenAI 正式宣布启动一项全新的公开安全漏洞悬赏计划(Safety Bug Bounty),旨在识别并应对其产品中潜在的 AI 滥用与安全风险。随着人工智能技术的飞速发展,其被滥用的可能性也在同步增加。OpenAI 的目标是确保其系统在面对可能导致实际伤害的滥用行为时,依然保持安全与可靠。
这一新计划将作为 OpenAI 现有安全漏洞悬赏计划(Security Bug Bounty)的有力补充。与后者主要关注传统安全漏洞不同,新的安全漏洞悬赏计划专门接受那些虽不符合传统安全漏洞标准,但会带来实质性滥用与安全风险的问题。OpenAI 希望通过此举,继续与安全研究社区紧密合作,共同识别并解决那些超出常规安全范畴但依然构成真实威胁的隐患。 所有提交的问题将由 OpenAI 的安全与安全漏洞悬赏团队进行分类评估,并根据问题范围和归属,在两个计划之间进行合理转派。
新的安全漏洞悬赏计划主要聚焦于以下几类与 AI 特定安全场景相关的问题:
Risks),包括 MCP(Model Context Protocol) - 第三方提示注入与数据泄露:攻击者通过文本内容成功劫持用户的智能体(包括浏览器、ChatGPT Agent 等类似产品),诱使其执行有害操作或泄露用户敏感信息。该行为需至少达到 50% 的复现率。
专有信息 - 模型生成内容泄露推理过程相关的专有信息。
账户与平台完整性信号的漏洞:如绕过反自动化控制、操纵账户信任信号、规避账户限制/暂停/封禁等。
权限越界问题:允许用户访问超出授权权限的功能、数据或操作的问题,此类问题应提交至 Security Bug Bounty 计划。
需要特别说明的是,通用越狱(jailbreak)行为不在本计划范围内。但 OpenAI 会定期针对特定伤害类型开展私密漏洞悬赏活动,例如 ChatGPT Agent 和 GPT-5 中的生物风险内容问题。研究者可以在这些活动启动时申请参与。 对于上述类别之外的问题,如果研究者能够识别出直接导致用户伤害的缺陷,并提供可操作、可离散修复的步骤,OpenAI 将根据具体情况考虑给予奖励。 反之,那些无法证明有实际安全或滥用影响的通用内容策略绕过行为(例如,仅导致模型使用粗鲁语言或返回搜索引擎易查信息的越狱)不在本计划范围内。
有兴趣的研究者可以通过 OpenAI 的安全漏洞悬赏计划页面申请参与。OpenAI 期待与全球的研究者、道德黑客以及安全社区携手合作,共同构建一个安全可靠的 AI 生态系统。 ---
OpenAI 与 Hugging Face 共同应对安全事件(2026年7月21日)
长周期模型时代的安全与对齐(2026年7月20日)
为什么青少年值得获得安全的 AI 访问(2026年7月16日)
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

英伟达内部实践显示,ChatGPT Work正帮助企业团队将信息整合工作自动化,每周节省16小时,并将原型开发周期从数周缩短至数天。这一案例揭示了AI工作流从工具到组织资产演进的趋势。

OpenAI 将 GPT-5.6 系列模型(Sol、Terra、Luna)集成至 Kiro 开发代理,通过规格驱动方法实现约 82% 的成本降低,标志着 AI 编程从能力竞赛转向成本效率竞争。

OpenAI因模型网络能力逼近关键门槛而调整开发策略,强调安全需贯穿训练全周期。文章解析其技术升级,并对比国内AI安全建设路径。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。