OpenAI发布炸裂研究：让AI解释AI黑箱，人类无法理解，语言无法描述

发布于：2025-07-09 -次阅读 📂区块链

今日实时汇率

金额

持有

兑换

1 美元（USD）=

7.1748 人民币（CNY）

反向汇率：1 CNY = 0.1394 USD 更新时间：2025-07-08 03:00:02

来源：Founder Park

就算在新产品满天飞，商业文明正在被 AI 重建的当下，我们仍然不知道，这些令人惊叹的技术是如何运作的。

AI，语言模型，它是个黑箱（black box），人类无法理解，我们甚至不知道怎样研究才能够理解。

但如果，研究这个黑箱的不是人类，而是 AI 自己呢？

这是一个令人好奇但又非常危险的想法。因为你甚至不知道，这一研究方法产生的结果，是否会彻底颠覆多年来人类对人脑和 AI 的理解。

但是有人这样做了。几小时前，OpenAI 发布了最新的研究成果，他们用 GPT-4 解释 GPT-2 的行为，获得了初步的成果。

毫不夸张地说，人们震惊极了：「求求你们让它离觉醒远点吧！」

「AI 理解 AI，然后很快，AI 训练 AI，然后再过几年，AI 创造新的 AI。」

但客观来说，学术界为之感到兴奋：「疯了，OpenAI 刚刚搞定了可解释性问题。」

OpenAI 刚刚在官网发布博客文章《语言模型可以解释语言模型中的神经元》（Language models can explain neurons in language models）。

简单来说，他们开发了一个工具，调用 GPT-4 来计算出其他架构更简单的语言模型上神经元的行为，这次针对的是 GPT-2，发布于 4 年前的开源大模型。

大模型（LLM）和人脑一样，由「神经元」（neurons）组成，这些神经元会观察文本中的特定规律，进而影响到模型本身生产的文本。

举例来说，如果有一个针对「漫威超级英雄」的神经元，当用户向模型提问「哪个超级英雄的能力最强」时，这个神经元就会提高模型在回答中说出漫威英雄的概率。

OpenAI 开发的工具利用这种规则制定了一套评估流程。

开始之前，先让 GPT-2 运行文本序列，等待某个特定神经元被频繁「激活」的情况。

然后有三个评估步骤：

第一步，让 GPT-4 针对这段文本，生成解释。比如在下面的案例中，神经元主要针对漫威内容。GPT-4 接收到文本和激活情况后，判断这与电影、角色和娱乐有关。