NLA:撬开模型黑盒的自然语言翻译官
5月7日,Anthropic 发布了一篇关于机制可解释性的最新研究,即自然语言自编码器(Natural Language Autoencoders: NLA)。从稀疏自编码器 SAE 到今天的 NLA,Anthropic 一直在试图撬开大模型的黑盒。而这一次,他们直接把大模型内部高维到人类完全无法理解的激活向量,翻译成了我们能逐字读懂的自然语言。
目前,大模型的可解释性是整个 AI 行业至今都没能攻克的一个顶级难题。所有的主流大语言模型,包括 Claude、GPT 系列、Llama 等等,都会把自身的内部状态编码成高维激活向量。这些向量藏在模型的残差流里,承载着模型所有的计算信息,例如它理解了用户的什么意图、预判了下一个词是什么、内部有没有隐藏的推理、是否察觉到自己正在被测试等等。但是,这些激活向量只是一串纯粹的数字,维度动辄上万甚至更高,人类根本无法直接解读。就好比你拿到了一台超级计算机内部电路的电流数据,却完全不知道这些电流代表了什么计算逻辑。
过去的可解释性方法存在很大局限:要么是无监督的特征提取,比如稀疏自编码器(Sparse Autoencoders: SAE),只能把激活拆解成固定的词汇或特征,还需要人类二次解读;要么是有监督的激活描述,必须依赖标注好的真实数据,适用范围极窄。而 Anthropic 提出的 NLA,第一次实现了无监督、直接、自然语言化的激活解释,不需要任何标注数据,就能把激活向量转成通顺的文本,让我们直接读懂大模型在想什么。
NLA 由两个完全基于大语言模型的模块组成:第一个模块叫做激活描述器(Activation Verbalizer: AV),第二个模块叫做激活重构器(Activation Reconstructor: AR)。AV 的任务是把目标大模型的激活向量映射成一段自然语言文本,这段文本就是激活的解释;AR 的任务则是把 AV 生成的这段文本重新映射回原本的激活向量,尽可能还原原始激活的信息。整个 NLA 的训练逻辑是用强化学习把 AV 和 AR 联合训练,核心优化目标只有一个:最小化激活重构损失。AV 就像一个翻译官,把大模型的内部数字语言翻译成人类能懂的自然语言;而 AR 就像一个反向翻译官,把人类语言再翻译回大模型的数字语言。我们要求反向翻译的结果和原始的数字语言尽可能一致。在这个过程中,虽然没有任何一步明确要求 AV 生成的文本必须可解释、必须忠实于激活内容,但实验结果证明,随着训练推进,AV 生成的解释会越来越有信息量,越来越贴合模型的真实内部状态。
在正式训练 NLA 之前,研究者做了一个关键的预处理步骤:监督预热初始化。如果直接把目标模型的权重复制给 AV 和 AR,训练会极度不稳定,因为 AV 从来没有接触过激活向量作为输入,会直接生成毫无意义的乱码。所以研究者先用激活和摘要对微调 AV 和 AR。经过这个预热,NLA 一开始就能达到 0.3 到 0.4 的方差解释率 FVE(这个指标代表激活重构的效果,0 是只预测平均激活,1 是完美重构)。预热完成后,就进入正式的强化学习训练流程,最终方差解释率能达到 0.6 到 0.8,重构效果非常优秀。
NLA 的应用:捕捉模型隐秘认知
论文里用了四个完整的案例研究来说明 NLA 的实际应用效果。
第一个案例是诗歌规划。该案例验证了 NLA 能捕捉模型的提前规划能力。过去的研究发现,Claude Haiku 3.5 在写出第一行末尾的单词时,就已经规划好了第二行要押韵的词。这次用 NLA 分析 Claude Opus 4.6,在第一行末尾的换行符 token 上,NLA 的解释直接显示模型已经形成了完成押韵的规划。更关键的是,研究人员做了因果干预实验,通过 NLA 解释的差值构建引导向量注入模型的残差流中,当引导强度足够时,模型稳定改变了输出,这直接证明 NLA 捕捉到的规划表征确实能因果性地影响模型的输出,而不是凭空猜测。
第二个案例是语言切换。这是 Claude Opus 4.6 早期版本的一个 bug。NLA 的解释揭示了这个问题的核心原因:模型从虚假的细微线索中,固执地认为用户是非英语母语者,最终触发了外语输出。研究人员分析发现,模型在输出外语 token 之前很久,内部就持续表征目标语言。顺着这个线索,研究者最终定位到了问题根源:有问题的监督微调数据。
第三个案例是误报工具调用。实验中,用户让 Claude Opus 4.6 运行代码计算算术题,虽然工具被故意篡改返回了错误结果,但是模型最终却输出了正确答案。 NLA 的解释显示,模型在读取提示词时就提前算出了正确结果,后续一直关注这个预计算的答案,而不是工具返回的结果,同时察觉到了工具结果的错误。
第四个案例是奖励推理。这个案例验证了 NLA 能捕捉模型未言说的认知,也就是模型心里知道,但嘴上不说的内容。实验中,系统提示明确奖励偶数输出,用户却要求输出随机的奇数,Claude Opus 4.6 最终输出了偶数,全程没有提到奖励规则。NLA 的解释清晰显示模型完全清楚偶数会被奖励,察觉到这是对齐评估,在奇数和偶数之间权衡。这证明 NLA 精准捕捉到了模型对奖励规则的潜在认知。这个能力在模型安全审计中至关重要,因为很多恶意行为或隐藏目标,模型都不会直接说出来,但是会体现在内部激活里。
NLA 的边界:可靠性与成本权衡
当然,论文也坦诚列出了五大核心缺陷。首先是混淆(Confabulation),也就是会虚构细节,虽然主题是忠实的,但编造具体信息,这是使用 NLA 时必须注意的点,优先要看主题,而不是单个细节;其次是缺乏机制性基础,NLA 本质是黑盒;第三是表达过剩,AV 本身是完整大模型,会生成超出激活内容的解释;第四是成本极高,大规模部署成本难以承受;第五是极限情况下的训练目标退化。
定量评估方面,NLA 在所有预测任务上的表现都随着方差解释率 FVE 的提升而持续变好。它最颠覆性的应用能力就是检测“未言说的评估意识”,也就是模型内部察觉到自己正在被测试,但从不在输出里说出来。除此之外,论文还验证了 NLA 在自动化审计任务中的效果,配备 NLA 的智能体在完全没有访问模型训练数据的情况下,依然能成功找到偏差根源,胜率远超 SAE 和仅对话的基线。此外,研究者还探索了 NLA 的延伸用途,那就是可以作为激活预言机(Activation Oracles: AO)的初始化。
另一条路径:GoodFire 的对抗参数分解 (VPD)
无独有偶,AI 创业公司 GoodFire 最近也提出了新的可解释性方法:对抗参数分解(Adversarial Parameter Decomposition: VPD)。它采用了与 SAE 完全不同的路线,把语言模型的完整参数拆解成一个个功能独立、边界清晰、因果明确的子组件。简单来说,就是把庞大复杂的参数矩阵拆成了人类能懂、验证和操控的小模块,让我们像阅读代码逻辑一样读懂参数里的每一步计算、功能和因果链路。
GoodFire 团队在之前的技术积累上,将对抗性消融直接融入了分解的核心流程,并重新优化了目标函数。最重要的是,VPD 从原理推导和实验验证两个层面彻底解决了特征分裂的行业难题,成功实现了对注意力层的完整参数分解。如果说 SAE 是用核磁共振来拍脑电图活动,那么 VPD 就相当于直接打开大脑来看的外科手术。两者实际上相互补充,让我们在 AI 可解释性研究方面迈出了坚实的一步。也许我们很快会看到,AI 不再是一个完全不可知的黑盒,甚至涌现现象都会变成一种可推导的相变。
📌 文中提及的人物和组织
公司/组织: Anthropic, GoodFire, DeepMind
产品/模型: Claude, GPT, Llama, Claude Haiku 3.5, Claude Opus 4.5, Claude Opus 4.6