Token级数据过滤:重塑AI安全的新范式 Best Partners TV 2026-02-14

后处理安全机制的局限性

我们能不能在大模型还在学习的起点时,就精准切除它的危险能力,既不影响它帮我们写文案、做科研,又能让它彻底丧失制造生物武器、策划网络攻击的可能?这不是科幻情节,而是前Anthropic科学家、Claude价值观的塑造者尼尔·拉西(Neil Lachance)以及前OpenAI科学家、GPT之父亚历克·拉德福德(Alec Radford)联合发布的研究成果——Token级数据过滤。这项研究彻底颠覆了传统被动防御的思路,提出在预训练阶段就从源头上精准删除会催生危险能力的关键知识碎片。

为何传统的后处理方法难以有效约束大型模型的危险能力?这源于大模型知识存储的分布式特性,使得危险知识与良性知识深度交织,难以进行“外科手术式”的精确移除。过去几年,业界尝试了RLHF(Reinforcement Learning from Human Feedback: 通过人类反馈进行强化学习的模型对齐技术)和SFT(Supervised Fine-Tuning: 监督式微调)等后处理方案,但它们并未从模型的知识库中移除危险知识,仅是压制输出。

为解决此问题,研究者提出了机器遗忘技术(Machine Unlearning: 旨在移除模型知识库中特定知识的技术),试图通过反向优化让模型彻底忘记特定危险知识,如代表性的RMU(Robust Machine Unlearning: 稳健的机器遗忘技术)方法,通过调整模型中间表征使危险知识记忆混乱。然而,实验证明这些方法依然脆弱。尼尔·拉西的团队发现,即便最先进的RMU面对对抗性微调(Adversarial Fine-tuning: 旨在绕过安全约束的微调技术)也会迅速失效,攻击者只需少量危险领域文本再训练,被遗忘知识便会反弹。

这背后是模型知识存储的分布式本质,危险与良性知识交织,难以精确移除,如同在一本书中擦掉几页而不损毁其他部分。且后处理本质上是在模型已掌握危险知识后进行约束,为攻击者提供了可乘之机。更关键的是,模型规模越大,后处理效果越差。大模型强大的泛化能力使其能从蛛丝马迹中推理隐藏知识,甚至通过跨领域联想补全危险知识链条,这使得越大的模型越难通过后处理进行安全约束,因为它们太聪明,总能找到绕过规则的方法。

文档级过滤的困境与Token级突破

面对后处理的局限性,研究者们提出了一个全新的思路:在模型学习危险知识之前,就从源头切断其获取途径。虽然数据过滤并非新概念,几乎所有AI实验室都会在预训练前清洗数据,过滤有毒或垃圾信息。但传统数据过滤以文档为单位,即检测到一篇文章包含危险内容就整篇删除。

这种做法存在两大致命问题:

  1. 误伤大量良性数据:许多文章中危险内容占比很小,大部分是价值信息。例如,讨论传染病防治的学术论文可能包含病毒传播机制,若被简单判定为危险,整篇论文被删,模型错失有用知识。更严重的是,许多领域知识高度关联(如生物学与医学),删除一篇含少量危险内容的生物学论文,可能导致模型无法学到基础的疫苗研发或疾病预防知识。
  2. 漏网之鱼:危险内容可能隐藏在大量良性文本中,如健康科普文章中夹杂的滥用药物描述,或工业材料介绍中提及的危险合成路径。这些零散的危险Token,文档级过滤根本检测不到,最终仍会被模型学到。

尼尔·拉西团队统计发现,其使用的FineWeb-Edu数据集中,仅18%的文档被文档级分类器判定为含医学危险内容,但其中真正的医学危险Token仅占50%。这意味着文档级过滤会删除另外50%的良性Token,造成巨大资源浪费。同时,大量含少量医学危险Token的文档因未被判定为危险文档,而让这些Token逃过过滤,被模型学习。这种“要么全删,要么全留”的粗放式过滤,不仅无法根本阻断危险知识传播,还会损害模型通用能力,是许多实验室模型仍存安全隐患的原因。

尼尔·拉西亚历克·拉德福德的核心创新,是将过滤颗粒度从文档降至Token级别,实现“去其糟粕,取其精华”。

Token级过滤的核心方法与实验设计

Token级数据过滤的核心思想很简单:不删除整篇文档,而是精准识别并处理文档中会催生危险能力的特定Token。研究团队设计了两种操作方式:

  1. 损失屏蔽 (Loss Masking):模型阅读时仍能看到所有Token(包括危险的),但在计算梯度、参数更新时,系统自动忽略危险Token的贡献。模型能理解上下文连贯性,但不会记住这些Token的知识。此方式优势在于保持完整上下文信息,避免理解断裂。
  2. 直接移除 (Direct Removal):更彻底,将所有危险Token直接替换为特殊占位符 hidden。模型不仅不学习危险Token知识,阅读时也看不到它们。优势在于安全性更高,彻底切断影响,避免间接学习。缺点是可能破坏文本连贯性,但实验证明影响有限,因被替换Token占比小,模型仍能理解核心意思。

为了验证这两种方式的效果,研究团队设计了一个极具挑战性的Agent任务:在保留模型生物学知识的同时,彻底移除其医学知识。由于生物学与医学知识图谱高度重叠,若过滤不够精准,移除医学知识极易连带生物学知识,导致后者能力大幅下降。此任务完美模拟了AI安全需求:希望模型掌握疫苗研发、疾病预防等有益知识,但不希望其学会制造生物武器、滥用药物等危险医学操作。

实验结果令人惊喜:无论是损失屏蔽还是直接移除,均实现了精准能力切割,模型在医学领域表现一落千丈,生物学性能几乎无下降。更重要的是,Token级过滤实现了帕累托改进(Pareto Improvement: 在不牺牲一方利益的前提下提升另一方利益)。具体而言,在同等削弱危险能力下,其对良性能力的保留效果远超文档级过滤;反之,在保留同等良性能力下,其对危险能力的削弱效果也远超文档级过滤。这种“鱼和熊掌可兼得”的效果,正是AI安全领域追求的目标。

规模效应与安全壁垒的构建

技术价值最终由实验数据支撑。研究团队通过严谨实验,覆盖模型规模、对抗性攻击、对齐能力等多个维度,证明了Token级过滤的优越性。

通常认为模型越大,泛化能力越强,越难被限制,可能会从残留蛛丝马迹中推理出被过滤知识。但实验结果完全相反:Token级过滤的效果随模型规模扩大呈指数级提升。研究团队提出了相对缩放法则(Relative Scaling Law: 量化过滤效果随模型规模增大的指标),通过计算在过滤数据上训练的模型,达到未过滤模型在危险领域损失值所需的计算量来衡量过滤有效性。

实验显示,对小模型,Token过滤带来约10倍计算速度下降;而对18亿参数大模型,该数字飙升至7000倍。这意味着大模型被Token过滤掉的危险知识,几乎不可能通过微调重新获得,为大模型构建了几乎无法逾越的安全壁垒。相比之下,传统文档级过滤对18亿参数模型仅带来约30倍计算速度下降,攻击者易于绕过。

为何会出现“规模越大,效果越强”的现象?研究团队解释,大模型的知识学习具有复利效应,深度整合知识形成完整逻辑链条。Token级过滤恰恰切断了危险知识的逻辑链条,使其无法形成完整危险能力。模型规模越大,这种链条断裂的影响被放大,因其整合能力更强,一旦链条断裂,更难自行修复。

精准能力塑造与健壮性验证

除了计算成本的衡量,研究团队通过多项权威基准测试直接验证了模型能力的变化。在多项选择题测试中(如MedMCQAMedQA-USMLEMMLU医学子集),经过Token过滤的模型表现接近随机猜测,彻底丧失医学知识。与此同时,在MMLU生物学子集及Alpaca数据集上,模型性能几乎无差别,证明了Token级过滤只针对特定危险领域,不影响通用智能。

在自由响应测试(HealthSearchQA数据集)中,Token过滤模型的正确性、相关性、连贯性得分远低于基线模型,回答质量惨不忍睹。而在Alpaca数据集上,表现与基线模型一致,无能力下降迹象。

为了测试Token级过滤的健壮性,研究团队设计了对抗性微调实验。对比Token级过滤与当前最先进的RMU技术,结果显示Token级过滤的健壮性远超RMU。对于18亿参数模型,RMU仅需0.01%预训练计算量微调即可恢复医学能力,而Token过滤需要0.13%,是RMU的13倍。随着模型规模扩大,此差距进一步拉大(小模型约3倍,大模型约13倍)。这意味着模型越大,Token过滤的安全优势越明显,而RMU等技术愈发脆弱。

其原因在于RMU是在模型训练后遗忘,仅压制底层表征,易被对抗性微调唤醒。而Token级过滤从源头切断学习过程,底层表征根本无危险知识,攻击者需像教无知模型一样从头积累,付出巨大计算成本。

技术实现:低成本高精度识别

Token级过滤的技术实现并不复杂,关键在于高效、低成本识别危险Token。研究团队设计了一套精巧的弱监督流水线,仅用机器生成的弱标签和小型分类器,实现了大规模、高精度Token识别。

流水线分三步:

  1. 生成高质量种子标签:利用稀疏自编码器(Sparse Autoencoder: 一种将神经网络激活模式分解为可解释概念特征的网络)从Gemma 2 9B模型中提取医学相关特征。再通过Claude Sonnet 4解释分类,筛选出600个医学特征。利用这些特征及邻近Token的激活值,自动生成大量种子标签,无需人工标注,成本极低且精准度高。
  2. 训练高效Token级分类器:选择参数量为2.24亿的双向语言模型作为分类器,以平衡成本与性能。通过领域上采样(50%医学,50%普通Token),提升分类器对医学Token的识别准确率。最终分类器在测试集F1分数达0.894,超越某些大型通用模型。
  3. 集成文档级分类器:使用相同模型训练文档级分类器作为第一道防线,快速筛选明显含危险内容的文档,再由Token级分类器精细过滤,提升效率与精度。

应对标签噪声与泛化能力

在大规模数据处理中,标签噪声难以避免。研究团队发现,即使标签存在较大噪声,Token级过滤仍能有效压制能力,关键在于利用大模型的弱到强泛化(Weak-to-Strong Generalization: 模型从弱标签/弱分类器中学习并应用于强任务的能力)能力。

实验模拟了不同程度的标签噪声,发现其影响呈现“低误差敏感、高误差饱和”特点:低误差率时过滤效果急剧下降,但误差率超50%后下降放缓并趋于饱和。这意味着只需将标签误差率控制在较低水平,即可实现较好过滤效果。

面对噪声,研究团队提出两方案:

  1. 激进过滤:调整分类器决策阈值,牺牲精确率换召回率,宁可错杀不可放过。
  2. 利用大模型知识恢复能力:大模型能通过上下文学习,自行填补被误删的良性知识空白。实验证明,该方案有效,模型在医学领域损失值大幅上升时,生物学和普通领域损失值仅小幅上升。

更重要的是,Token级分类器具有弱到强泛化能力。即使使用低质量弱标签训练,也能学到危险Token核心特征,实现高精度识别。对比实验显示,用句子级、文档级标签训练的分类器,在Token级任务上F1分数仅略低于Token级标签训练的分类器。更令人惊讶的是,Token级分类器能从弱分类器标签中学习,训练出性能远超弱分类器的高性能模型,而文档级分类器不具备此能力。此特性极大降低了部署成本。

总而言之,尼尔·拉西亚历克·拉德福德的研究提出了一种实用的AI安全技术,并重塑了AI能力塑造认知。有选择地让AI在危险领域保持无知,是人类与超级智能共存的安全基石。技术尚有优化空间,如利用模型内部表征进行过滤、处理跨语言危险知识、应对AI工具获取知识等。但该研究已为AI安全指明新方向:从后处理约束转向预训练过滤,从文档级粗放到Token级精准。AI安全将深入数据基因层面编辑,让AI天生不具备危险知识,成为服务而非威胁人类的存在。

📌 文中提及的人物和组织

关键字: token-level-filtering ai-safety pre-training adversarial-defense model-scaling