
OpenAI 在最新评估中发现其下一代模型 Astra 在自主编码和网络安全方面能力显著提升,可能达到其《预备框架》中定义的“关键”网络能力阈值。为此,OpenAI 已宣布加强安全控制、暂停部分高风险内部活动,并将与政府及安全机构合作,以确保模型的安全开发和负责任部署。
随着人工智能模型能力的飞速提升,网络安全领域正迎来前所未有的变革。AI 既能强化网络防御,也可能以惊人的速度和规模催生新的攻击手段。近日,OpenAI 发布了一项重要安全公告,透露其下一代模型 Astra 在自主编码和网络安全方面展现出显著进展,以至于根据其内部《预备框架》,无法排除该模型具备“关键网络能力”的可能性。本文将深入解读这一事件,分析 OpenAI 的应对措施及其对 AI 安全格局的深远影响。
Astra 模型可能具备“关键网络能力” 根据 OpenAI 官方公告,其最新的内部评估显示,即将推出的模型 Astra 在自主编码(Agentic Coding)和网络安全领域的能力有了显著提升。结合专家评估,OpenAI 于公告发布前夜得出结论:根据其《预备框架》(Preparedness Framework)的标准,无法排除 Astra 已达到“关键”(Critical)网络能力阈值的可能性。 这一结论意义重大。此前,包括 GPT-5.6-Sol 在内的模型,在前沿网络能力评估中均被定为“高”(High)风险级别,而非最高的“关键”级别。OpenAI 主动公开这一评估结果,旨在向公众和安全社区保持透明度,共同应对潜在的能力跃迁。
的《预备框架》与“关键”门槛 OpenAI 早在 2023 年 12 月就发布了《预备框架》,旨在为追踪 AI 能力进步并规划应对措施提供指导。该框架将 AI 能力可能带来的风险分为多个等级,其中“关键”(Critical)网络能力是最高风险等级之一。 根据该框架的定义,模型达到“关键”门槛需满足以下条件之一: 1. 自主发掘漏洞:能够在无人干预的情况下,识别并开发出针对多个加固型现实世界关键系统的、各种严重级别的功能性零日漏洞。
面对这一潜在的能力跃迁,OpenAI 表示已迅速采取行动,大幅加强安全测试和安全控制措施,以确保模型的进一步开发在安全可靠的环境中进行。具体措施包括:
强化安全控制:对高能力模型及相关活动实施更严格的安全控制,包括隔离测试环境、限制网络和工具访问、增强模型权重保护和加密、增加监控检测能力以及沙盒执行。
暂停高风险活动:暂停所有尚未满足强化安全控制要求的、涉及 Astra 的内部活动。
全面监控:对 Astra 的所有智能体应用(包括训练和评估)实施针对高风险行为和错误对齐的通用监控。监控器会评估模型的思维链,并在检测到高风险活动时触发安全响应进行审查和中断。
外部合作:将与相关政府机构和精选的 AI 安全组织合作,共同测试该模型的能力。同时,将向第三方测试合作伙伴提供推荐的安全控制措施,以保障高风险评估和工作负载的安全运行。
安全的持续博弈 OpenAI 在公告中回顾了《预备框架》在过往能力转变中发挥的指导作用。例如,在 2025 年 6 月,当模型接近生物学领域的“高”能力阈值时,OpenAI 就曾采取过类似的强化保障措施。此次对 Astra 的处理,正是同一原则的延续。 OpenAI 坚信,具备先进网络能力的 AI 模型最终应帮助防御者先于攻击者发现并修复漏洞。公司承诺将与政府、安全研究机构和民间社会携手,确保 Astra 及其后继模型的前沿能力得到负责任且广泛的部署,以造福全人类。
OpenAI 对 Astra 模型可能具备“关键网络能力”的坦诚披露,是 AI 安全治理领域的一个重要节点。它标志着 AI 在网络攻防领域的潜在能力已逼近一个关键的转折点。通过主动升级安全框架、强化内部管控并寻求外部合作,OpenAI 试图在推动技术前沿的同时,为 AI 的负责任发展设立新的标杆。未来,如何在释放 AI 潜能与防范其被滥用之间取得平衡,将是整个行业面临的长期挑战。
Astra 是 OpenAI 正在开发的一款即将推出的新模型。根据 OpenAI 的公告,该模型在自主编码和网络安全方面展现出显著的先进能力,目前正在进行严格的安全评估。
OpenAI 的《预备框架》? 《预备框架》是 OpenAI 于 2023 年 12 月发布的一套内部指导方针,旨在帮助公司识别、评估和应对 AI 模型在生物、化学、网络安全和 AI 自我改进等领域的潜在高风险能力。该框架为 OpenAI 规划如何安全地开发和部署前沿模型提供了行动指南。
根据 OpenAI 的定义,达到“关键”网络能力阈值意味着模型能够自主识别并开发针对多个加固型关键系统的功能性零日漏洞,或者仅凭高层目标就能策划并执行端到端的复杂网络攻击。这是 OpenAI 风险评估框架中的最高风险等级之一。
Astra 模型的安全? OpenAI 已宣布采取多项措施,包括:对 Astra 相关活动实施更严格的安全控制和隔离测试环境;暂停不符合新安全要求的高风险内部活动;对模型的所有智能体应用实施通用监控;以及与政府机构和 AI 安全组织合作进行能力测试。
AI 安全领域有何影响? 这一事件表明,AI 的网络攻防能力正在迅速接近一个关键的临界点。它凸显了 AI 安全治理的紧迫性,并可能推动整个行业建立更严格的安全评估标准、更透明的信息披露机制以及更广泛的国际合作,以应对 AI 带来的新型网络威胁。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

OpenAI因模型网络能力逼近关键门槛而调整开发策略,强调安全需贯穿训练全周期。文章解析其技术升级,并对比国内AI安全建设路径。

OpenAI与CodeAI宣布合作,通过ChatGPT for Teens及系列教育项目,弥合青少年AI使用与理解之间的鸿沟,培养具备批判性思维和负责任的AI原生一代。

本文探讨了 Anthropic 的 Claude Opus 4.6 等模型存在的越狱漏洞,该漏洞可被利用生成色情内容,并分析了其安全机制与政策声明之间的差距,以及可能引发的合规和未成年人保护问题。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。