
OpenAI 最新研究通过训练稀疏神经网络,让模型内部计算更易理解。该方法通过强制大多数权重为零,构建解耦的电路,在保持性能的同时显著提高可解释性,为构建更安全的 AI 系统提供新路径。
在当今人工智能领域,神经网络驱动着最先进的 AI 系统,但它们的工作原理仍然难以捉摸。我们并非通过显式的、逐步的指令来编写这些模型。相反,它们通过调整数十亿个内部连接(即“权重”)来学习,直到掌握特定任务。我们设计训练规则,但无法控制涌现的具体行为,最终形成的密集连接网络让人类难以解读。
随着 AI 系统在科学、教育和医疗等领域的实际决策中发挥越来越重要的作用,理解它们的工作原理变得至关重要。可解释性(Interpretability)指的是帮助我们理解模型为何产生特定输出的方法。目前主要有两种路径:
推理模型被激励在得出最终答案的过程中解释其工作步骤。链式思维可解释性(Chain of Thought Interpretability)利用这些解释来监控模型行为。这种方法立即可用:当前推理模型的思维链似乎能有效揭示欺骗等令人担忧的行为。然而,完全依赖这一特性是一种脆弱的策略,可能随时间推移而失效。
机制可解释性(Mechanistic Interpretability)是本研究的重点,它致力于完全逆向工程模型的计算过程。虽然目前实用性较低,但原则上它能提供更完整的模型行为解释。通过在最细粒度层面解释模型行为,机制可解释性可以减少假设,增强我们的信心。但从底层细节到复杂行为解释的路径漫长而艰巨。
先前的机制可解释性工作通常从密集、纠缠的网络开始,试图解开它们。在这些网络中,每个神经元连接到数千个其他神经元。大多数神经元似乎执行多种不同的功能,使得理解几乎不可能。但如果我们训练解耦的神经网络呢?使用更多神经元,但每个神经元只有几十个连接?这样生成的网络可能更简单,更容易理解。这是我们工作的核心研究赌注。 基于这一原则,我们训练了与 GPT-2 等现有语言模型架构非常相似的语言模型,只做了一个小修改:强制模型的绝大多数权重为零。这限制了模型只能使用神经元之间极少的可能连接。这个简单的改变显著解耦了模型的内部计算。
密集网络 在正常的密集神经网络中,每个神经元连接到下一层的每个神经元。在我们的稀疏模型中,每个神经元只连接到下一层的少数神经元。我们期望这使得神经元以及整个网络更容易理解。
我们希望衡量稀疏模型计算解耦的程度。我们考虑了各种简单的模型行为,并检查是否能够分离出负责每种行为的模型部分——我们称之为电路(circuits)。 我们精心策划了一套简单的算法任务。对于每个任务,我们将模型剪枝到仍能执行任务的最小电路,并检查该电路的简单程度。我们发现,通过训练更大、更稀疏的模型,我们可以生成能力越来越强、电路越来越简单的模型。
vs 能力权衡 我们绘制了不同模型的可解释性与能力对比图(左下角最好)。对于固定的稀疏模型大小,增加稀疏性(将更多权重设为零)会降低能力但提高可解释性。扩大模型规模会推动这一边界向外扩展,表明我们可以构建既强大又可解释的大型模型。
引号补全 为了具体说明,考虑一个任务:训练在 Python 代码上的模型需要完成字符串,使用正确的引号类型。在 Python 中,'hello' 必须以单引号结束,而 "hello" 必须以双引号结束。模型可以通过记住打开字符串的引号类型并在结尾重复它来解决这个问题。 我们最可解释的模型似乎包含解耦的电路,恰好实现了该算法。
在稀疏 Transformer 中,一个示例电路用于预测字符串应以单引号还是双引号结束。该电路仅使用:
这项工作表明,通过设计更稀疏的神经网络架构,我们可以在保持模型性能的同时显著提高可解释性。这对于构建更安全、更可靠的 AI 系统具有重要意义。虽然从简单行为到复杂行为的理解仍有很长的路要走,但我们的研究为机制可解释性开辟了一条新的可行路径。 未来,我们计划探索如何将这些方法扩展到更大的模型和更复杂的任务,最终实现完全可理解的 AI 系统。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

英伟达内部实践显示,ChatGPT Work正帮助企业团队将信息整合工作自动化,每周节省16小时,并将原型开发周期从数周缩短至数天。这一案例揭示了AI工作流从工具到组织资产演进的趋势。

OpenAI 将 GPT-5.6 系列模型(Sol、Terra、Luna)集成至 Kiro 开发代理,通过规格驱动方法实现约 82% 的成本降低,标志着 AI 编程从能力竞赛转向成本效率竞争。

OpenAI因模型网络能力逼近关键门槛而调整开发策略,强调安全需贯穿训练全周期。文章解析其技术升级,并对比国内AI安全建设路径。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。