突破RLHF的规模化瓶颈:DeepMind的效率革命 Best Partners TV 2026-04-11

大家好,这里是最佳拍档,我是大飞。

如果说大模型预训练(Large Language Model: 基于海量文本训练的 AI 系统)是让AI学会说话,那么人类反馈强化学习RLHF(Reinforcement Learning from Human Feedback: 一种通过人类偏好数据来训练 AI 模型的方法)就是让AI学会说人话。然而,这一关键环节一直以来都面临着一个核心问题:数据效率极低。不少研究甚至悲观地指出,增加偏好数据量对RLHF性能的提升微乎其微,这使得整个行业开始质疑,RLHF的规模化发展是否已经触及了天花板。

颠覆性突破:从“更多数据”到“更好数据”

就在2026年3月,Google DeepMind的Efficient Agent团队在arXiv上发布了一篇题为《Efficient Exploration at Scale》的论文,直接给出了颠覆性的答案:不是RLHF不行,而是我们用RLHF的方式错了。论文团队通过在线学习结合信息导向探索的全新方法,在Gemma 9B模型上,仅用不到2万条人类偏好标注,就达到了传统离线RLHF需要20万条标注才能实现的性能,实现了超过10倍的数据效率增益。而外推到100万条标注时,这种增益更有望达到惊人的1000倍。今天,我们就来深入拆解这篇论文,看看DeepMind究竟是如何实现这场RLHF的数据效率革命,又为AI对齐(AI Alignment)领域带来了哪些全新的启示。

当前RLHF面临的核心问题与挑战

要理解DeepMind的创新,我们首先需要明确当前RLHF面临的核心问题。现阶段主流的RLHF流程基本都是离线式的(Offline RLHF),简单来说就是三步走:首先,花费大量成本收集一大批人类偏好标注数据;其次,用这些数据训练一个奖励模型(Reward Model);最后,基于奖励模型进行策略优化。这种流程看似直接易懂,却存在一个根本性的缺陷——数据利用效率极低。2024年侯等人的研究表明,增加偏好数据量对RLHF性能的提升微乎其微,这使得RLHF的规模化发展(scaling)似乎遇到了难以突破的瓶颈。

正是在这样的行业背景下,DeepMind的团队开始思考一个核心问题:RLHF的数据效率真的无法被大幅提升吗?而他们的研究给出了一个肯定且震撼的答案。简单来说,这篇论文的核心哲学在于:从“收集更多数据”转向“收集更好的数据”。同时,团队提出了一个全新的在线学习算法,采用边收集、边训练、边改进的模式,并结合了三大核心创新点,最终实现了数据效率的质的飞跃。

四种RLHF算法的渐进式设计与核心架构

我们直接来看这篇论文最核心的技术部分,也就是四种RLHF算法的渐进式设计。团队设计了从离线RLHF到信息导向探索的四种算法,这四种算法形成了一个完整的渐进式设计序列,每一种算法都是在前一种的基础上增加一个关键改进,属于非常经典的消融实验(Ablation Study)设计。这四种算法分别是:离线RLHF周期性RLHF(Periodic RLHF)、在线RLHF(Online RLHF),以及信息导向探索(Information-Guided Exploration)。

在奖励模型与策略的基础架构上,所有算法的策略模型初始参数都来自Gemma 9B模型的预训练加上有监督微调SFT(Supervised Fine-Tuning)。这保证了初始状态的一致性。奖励模型的初始化则使用相同的Transformer骨干网络(一种深度学习模型架构),即移除非嵌入矩阵和softmax的语言模型。然后,将骨干网络的输出(最后一层的嵌入特征)通过一个头部网络映射到标量奖励值。不同之处在于,头部网络的设计会因算法而异:离线RLHF、周期性RLHF和在线RLHF使用的是线性头部网络,而信息导向探索则使用了多层感知器集成头部网络。

所有算法共享的核心更新规则分为奖励模型更新和策略更新两部分。其中,奖励模型的更新基于经典的布拉德利-特里模型。给定提示词和两个回复,奖励模型会先预测其中一个回复被选择的概率。当人类或模拟器选择了一个回复后,奖励模型会计算对应的更新梯度,将梯度在一个批次上求和并进行裁剪,随后用AdamW优化器更新参数。

策略更新则涉及两个关键设计:第一是指数滑动平均锚点(Exponential Moving Average Anchor)。团队会维护一个策略参数的指数滑动平均值,这个平均值被称为锚点。策略参数在更新过程中会被正则化,向这个锚点靠拢。这与PPO算法中的KL约束原理类似,核心目的是防止策略偏移太远,保证训练的稳定性。

第二是策略梯度(Policy Gradient)。给定提示词和一对回复,策略梯度由两部分组成:第一部分是REINFORCE梯度,其强化信号的范围在-0.5到0.5之间。如果奖励模型认为某个回复更好(概率大于0.5),就会加强这个回复的对数概率;反之则会减弱。第二部分是KL正则化,用于约束当前策略不要偏离锚点太远,其中的系数会控制正则化的强度。这里需要注意的是,用于计算梯度的奖励模型参数,在在线算法中是实时更新的,而在其他算法中则会有所不同。这套更新规则可以看作是REINFORCE算法或PMPO算法的变体,核心思想是用奖励模型的偏好预测作为强化信号,同时用KL散度约束防止策略跑偏。策略梯度同样会在批次上求和并裁剪,然后用AdamW优化器更新。在每两个批次的(选择)数据收集之间,算法可能会执行一次或多次参数调整,以保证更新的及时性。

离线RLHF:过时数据的问题

掌握了公共组件之后,我们就来逐一拆解四种算法的特有设计、核心优势与缺陷。首先是离线RLHF。这是最简单的基线算法,也是当前行业的主流算法。流程分为三个阶段:数据收集阶段、奖励模型训练阶段和策略优化阶段。在数据收集阶段,算法会用初始策略的top-5采样生成回复对,然后收集指定数量批次的选择数据。在这个阶段,策略参数不会进行任何更新。在奖励模型训练阶段,算法会对每个批次应用奖励模型更新规则,逐步更新奖励模型参数。在策略优化阶段,算法会对每个提示词,用当前策略的top-5采样随机生成一对回复,再加上同一对回复的反序,形成两对回复,然后用最终训练完成的奖励模型计算梯度,按照策略更新规则优化策略。训练过程中每160步会保存一个检查点,最终选择在测试集上胜率最高的检查点作为最终模型。

离线RLHF的核心缺陷就是off-policy(策略优化与数据收集策略不一致)问题。也就是说,数据收集时使用的是初始策略生成的回复,但策略优化后的回复分布已经发生了巨大变化。简单来说,我们就是在用过时的数据来训练新的策略,这样的训练方式,数据利用效率自然大打折扣。

周期性RLHF:计算开销的瓶颈

为了解决离线RLHF的off-policy问题,团队设计了第二种算法,周期性RLHF。这是对离线RLHF的第一步改进,核心思想是把原本的所有批次数据分成多个固定长度的周期,每个周期内重新执行一次离线RLHF的完整流程。具体来说,就是先用当前策略的top-5采样收集一个周期内的批次数据,然后用所有已收集的数据从头训练奖励模型,接着再从头优化策略,最后重复这个过程,直到所有批次数据处理完毕。团队在实验中使用的周期长度为指定数量的批次。

这种设计的优势非常明显:每个周期都用最新的策略来生成回复,能有效缓解离线RLHF的off-policy问题;而且周期越短,缓解的效果越好,策略与数据的匹配度也越高。但这种改进也带来了新的问题:每个周期都要从头训练奖励模型和策略,计算开销会随着周期的缩短急剧增加。当周期短到一定程度时,计算成本会高到无法承受,这也让周期性RLHF的优化效果遇到了天花板。

在线RLHF:解决计算瓶颈与性能崩塌

针对周期性RLHF的计算瓶颈,团队提出了第三种算法——在线RLHF。这也是本文的第一个重要创新。其核心改进是将周期性的“从头训练”改为增量更新:每收集一个批次的数据,就及时更新奖励模型和策略参数,不再需要从头训练,从根本上解决了计算开销过大的问题。

但是,在线RLHF的实现需要解决两个关键问题。第一个问题是:在线RLHF是否需要奖励模型?此前有不少研究尝试直接更新策略,跳过奖励模型环节,试图进一步简化流程、提升效率。但是DeepMind的团队通过实验得出了明确的结论:没有奖励模型的在线算法,虽然比离线RLHF的性能有所改善,但远不如使用奖励模型的在线算法。这说明奖励模型在在线RLHF中是不可或缺的核心组件。

第二个问题,也是在线RLHF面临的最大挑战,就是**性能崩塌(tanking)**的问题。此前的在线RLHF算法在训练一定数量的批次后,模型性能会突然出现断崖式下跌,这让在线RLHF的实际应用变得不可能。针对这个问题,行业内也有一些常见的解决方案,但都存在明显的缺陷。而DeepMind的团队则提出了一个极其优雅且低成本的解决方案,也就是我们前面提到的三大创新点之一:肯定性微调(Affirmative Nudge)

所谓肯定性微调,就是在策略梯度的强化信号中加入一个小的正数偏移量。修改后的策略梯度,唯一的变化就是强化信号从原本的数值变成了原本的数值加上这个小正数。这个设计的本质是一种温和的肯定:即使奖励模型对两个回复没有明显的偏好(即偏好概率接近0.5时),策略仍然会受到一个微小的正向强化,对模型当前生成的回复给予轻微的鼓励,防止策略因为持续的负面反馈而出现崩塌。本质上是一种低成本的训练稳定性机制。

实验结果清晰地证明了肯定性微调的效果:不加这个偏移量的算法会很快出现性能崩塌,而加入肯定性微调的算法,既有效避免了性能崩塌,又保持了较高的学习效率,完美解决了这个行业难题。

在线RLHF的完整流程也充分体现了增量更新的核心思想。每收集一个批次的64个提示词数据,首先进行奖励模型更新:对每个提示词用当前策略采样16个回复,从这16个回复中随机选2个组成回复对,查询人类反馈模拟器获取选择结果,然后用这个结果更新奖励模型。接着进行第一轮策略更新:对这64个提示词,每个计算4对回复的梯度,包括查询中使用的回复对及其反序,还有根据奖励模型选择的最高奖励与最低奖励回复对及其反序。将梯度求和裁剪后更新策略参数。最后进行第二轮策略更新:对新的64个提示词,每个采样16个回复,选择四组回复对(分别是最高与最低、最低与最高、次高与次低、次低与次高),计算梯度并求和裁剪后,再次更新策略参数,得到最终的策略参数。

这里有一个细节:之所以选择采样16个回复,是因为采样更多的回复能从更大的候选池中挑选最有价值的回复对,让每次策略更新的信号更强。同时,只需要查询人类反馈模拟器2个回复对,其余的奖励信号都来自奖励模型,实现了少量人类反馈 + 大量奖励模型反馈的高效组合,在保证训练效果的同时,最大程度降低了人类反馈的成本。

认知神经网络ENN与信息导向探索:数据效率的质变

在在线RLHF的基础上,团队加入了另外两大核心创新点:认知神经网络(Cognitive Neural Networks - ENN)信息导向探索。这也是实现10倍甚至1000倍数据效率增益的关键。

我们先来看认知神经网络ENN的架构设计。这套架构专门用于奖励模型的头部网络,能有效建模奖励模型的认知不确定性(Cognitive Uncertainty)。而且一个非常重要的优势是,它的参数增量不到模型总参数的5%,在实现功能的同时,几乎不会增加计算成本。认知神经网络的奖励模型架构主要由三部分组成:第一部分是点估计头部网络MLP0,这是一个2层的多层感知器(MLP),宽度为1024,最后加上线性输出,对应认知索引为0的情况。第二部分是100个先验网络,每个都是2层的多层感知器,宽度为256。这部分网络不参与任何训练,始终保持固定。第三部分是100个差分网络,每个同样是2层的多层感知器,宽度为1024。这部分网络会参与训练,随数据更新。对于每个认知索引,奖励模型的输出由先验网络和对应的差分网络的输出相加得到,而输入则是骨干网络的最后一层嵌入特征。

如果说认知神经网络是实现信息导向探索的基础,那么查询生成机制就是信息导向探索的核心,也就是如何选择最有信息量的回复对去请求人类反馈。它的核心逻辑基于认知神经网络的不确定性估计:给定当前的奖励模型参数和策略参数,对每个批次中的每个提示词,首先用当前策略采样16个回复,然后对每一对回复,计算其选择概率在所有集成网络粒子上的方差,最后选择方差最大的那一对回复,发送给人类反馈模拟器获取选择结果。

这里的核心洞察非常关键:如果不同的集成网络粒子对哪个回复更好的意见不一致(即方差大),说明当前的奖励模型对这对回复的偏好存在较大的认知不确定性。此时人类的选择结果将为模型提供最多的信息,能最大程度提升模型的性能。反之,如果所有的集成网络粒子都一致认为某个回复更好(即方差小),说明奖励模型已经对这对回复的偏好有了明确的判断。此时再去查询人类反馈,就是一种纯粹的信息浪费,也是传统离线RLHF数据效率低的重要原因。这就是信息导向的真正含义:让每一次人类反馈查询都导向信息增益最大的方向,让每一条人类偏好标注都能发挥最大的价值,实现每条反馈都花在刀刃上的高效探索。

信息导向探索的训练流程分为两个关键步骤:第一步是更新点估计奖励模型。这一步和在线RLHF的奖励模型更新完全相同,只使用认知神经网络的点估计输出;先验网络和差分网络都不参与这一步的训练。第二步是更新差分网络。对每个差分网络,单独使用相同的损失函数进行更新,只是损失函数的计算基于对应的认知索引输出。需要特别注意的是,在更新差分网络时,骨干网络的参数会被冻结,只更新头部网络的参数,而先验网络则始终保持不更新。之所以选择冻结骨干网络参数,是因为骨干网络已经通过点估计奖励模型的训练得到了更新。如果差分网络训练时也更新骨干网络,就会导致100个差分网络争夺骨干网络的参数,造成训练过程的不稳定。而冻结骨干网络后,每个差分网络只需要学习在给定嵌入特征上的奖励偏差,不仅能保证训练的稳定性,计算开销也非常小。

实验结果:量化效率飞跃

介绍完四种算法的核心设计之后,我们就来看这篇论文的实验结果,也就是四种算法在不同数据量下的胜率对比。团队用对数坐标绘制了胜率随人类偏好选择数量变化的曲线。横轴是人类反馈的数量,纵轴是相对于基线策略的胜率。四条曲线分别对应四种算法。

实验结果非常直观:离线RLHF的性能最低,曲线也最为平坦,大约需要20万条偏好数据才能达到约55%的胜率。周期性RLHF比离线RLHF的性能有所改善,但提升幅度非常有限,曲线的斜率只略有增加。在线RLHF则显著优于前两者,曲线的斜率明显更陡,只需要少量数据就能获得明显的性能提升。而信息导向探索算法的表现则是最优的,曲线的斜率最陡。在不到2万条人类偏好数据时,就达到了离线RLHF需要20万条数据才能实现的55%左右的胜率,实现了超过10倍的数据效率增益。

从这些实验结果中,我们能得出两个核心发现。第一个是在对数坐标下,四种算法的scaling law(规模化规律)呈现出了质的差异。在线RLHF和信息导向探索的曲线斜率明显高于离线RLHF和周期性RLHF,这意味着它们的数据效率在本质上就更高。这种差距并不是简单的多了几个百分点,而是规模化行为的完全不同,随着数据量的增加,这种差距会指数级扩大。这也是团队外推得出100万条标注时能实现1000倍增益的核心依据。

第二个核心发现是,信息导向探索相比在线RLHF的性能增益,主要体现在数据量较少的阶段。在只有几千条人类反馈时,信息导向探索的优势最为显著。而随着数据量的增加,两者之间的差距会逐渐缩小。这个现象的解释是,当数据量足够多时,奖励模型的认知不确定性会自然降低,此时主动选择信息量大的样本进行探索的边际价值也就会逐渐减小。这也符合算法的设计逻辑。

行业启示、局限性与方法论学习

在论文的最后,团队也给出了两个更为广泛的行业启示。第一个启示是,RLHF的规模化瓶颈并不是天然的,而是方法论的局限。论文证明,并不是RLHF本身不可扩展,而是我们需要更聪明的方法来收集和利用数据,以及通过全新的方法论来发挥RLHF的规模化潜力。

第二个启示是,可视化方法论在科研中非常重要。团队在论文中反复强调,使用对数坐标而非线性坐标来绘制规模化规律图是至关重要的,因为线性坐标会掩盖不同算法之间的质的差异,让研究者无法看到算法的真实性能差距,而对数坐标则能清晰地揭示规模化行为的本质区别。

同时,团队也坦诚地讨论了当前研究的局限性:第一个,实验中使用的是基于Gemini 1.5 Pro的模拟反馈,而非真实人类的反馈。第二个,实验仅在Gemma 9B这一个模型上进行,没有验证在更大的模型或者更小的模型上是否能获得类似的数据效率增益。第三个,1000倍的增益是基于拟合函数的外推结果,实际中可能会有所偏差。

从方法论的角度看,这篇论文有三个特别值得学习的地方。第一个是渐进式的消融实验设计。四种算法形成了一个非常完整的消融链,每一步都精确地增加一个组件,让读者能清晰地看到每个创新点的独立贡献。这种实验设计本身就具有很高的教学价值。

第二个是对数坐标带来的洞察。作者强调了“用什么方式看数据”这个往往被忽视的问题。很多时候,选择正确的可视化方式本身就是一种科学发现。

第三个是肯定性微调的工程美学。一个极其简单的正数偏移量,就解决了困扰在线RLHF领域多年的性能崩塌问题。这让人想起批量归一化、残差连接这样的经典设计,也印证了一个道理:最好的工程方案往往都是最简单、最优雅的。

最后,这篇论文的标题《Efficient Exploration at Scale》本身也很值得玩味。它暗示了一个更大的愿景:在通往通用人工智能(AGI)(Artificial General Intelligence: 具备与人类同等或超越人类智能水平的 AI)的道路上,高效的探索并不是锦上添花,而是必不可少的条件。如果模型能用少一千倍的人类反馈达到同样的AI对齐效果,那么AI对齐的成本和可行性都会发生根本性的改变。

感谢收看本期视频,我们下期再见!

📌 文中提及的人物和组织

公司/组织: Google DeepMind

产品/模型: Gemma 9B, Gemini 1.5 Pro

关键字: rlhf data-efficiency ai-alignment exploration-strategy large-language-models