解耦DiLoCo:谷歌DeepMind突破超大规模大模型训练瓶颈 Best Partners TV 2026-04-29

大家好,这里是最佳拍档,我是大飞。大概在一年前,我们频道介绍过谷歌 DiLoCo 框架的论文。最近,谷歌 DeepMind谷歌研究院 又联合发布了一篇关于 Decoupled DiLoCo 的论文。这项研究不仅由谷歌首席科学家杰夫·迪恩(Jeff Dean)亲自坐镇,更是直接戳穿了当下超大规模大语言模型(Large Language Model: 基于海量文本训练的 AI 系统)预训练的致命痛点。当集群扩展到数百万块芯片时,硬件故障不再是意外,而是日常。传统同步训练的算力浪费已经到了无法忽视的地步。论文数据显示,当集群规模达到240万块芯片时,传统弹性数据并行的有效计算时间只有40%,剩下60%的算力都在等待故障修复和集群重配置中白白消耗。而 Decoupled DiLoCo 能在同样的极端故障环境下,将有效吞吐率稳定在86%,系统几乎做到零停机。更夸张的是,它的通信带宽需求只有传统方案的60分之一,甚至能把全球各地的老旧芯片、零散算力整合到同一场训练中,还不影响最终模型质量。今天我们就来拆解一下这篇论文,不得不说,做分布式系统还得看 Jeff Dean。

大模型预训练的死循环困境

首先,我们必须先搞懂,为什么当下的大模型预训练会陷入规模越大却效率越低的死循环呢?这一切的根源都来自当前行业通用的单程序多数据并行范式(SPMD: Single Program Multiple Data)。不管是数据并行、张量并行还是序列并行,所有主流大模型训练框架都在严格遵循 SPMD 的核心规则,那就是所有加速器必须步调一致,每一步训练都要完成全局同步。任何一个设备出现卡顿、延迟、硬件故障,整个集群都会陷入停滞。这个逻辑就像一条高度协同的流水线,一个工位停摆,整条线都要等着。小规模集群下这个问题不明显,可当训练集群扩展到10万、100万甚至更多块芯片时,概率学就成了压垮训练效率的最后一根稻草。

论文里给出了一个精准的计算:假设单块芯片的平均故障间隔时间(MTBI: Mean Time Between Incidents)为1年,这个可靠性已经属于工业级的顶尖水平了。但是当集群里有240万块芯片时,整个集群的平均故障间隔时间(MTBF: Mean Time Between Failures)会被压缩到不足1分钟。换句话说,在这种规模下,硬件故障每分钟都会发生,传统训练根本无法持续推进。行业里不是没有解决方案,也就是所谓的弹性数据并行。当检测到故障后,自动缩小集群规模,用剩余的健康设备继续训练。但是这个方案的缺陷同样致命:故障检测、集群全局重配置以及参数重新分片,整个过程会产生大量的全局停机时间。即便开启弹性机制,240万芯片规模下的有效吞吐率也只有40%。

研究团队还用分布式系统中的 CAP 定理做了类比,把大模型训练的核心矛盾也定义为三个特性,分别是一致性(Consistency)、可用性(Availability)、分区容错性(Partition Tolerance)。传统 SPMD 范式把一致性放在第一位,要求所有设备时刻持有完全同步的模型参数,为此不惜牺牲可用性和分区容错性。而 Decoupled DiLoCo 的核心革命就是彻底颠倒这个优先级,把可用性分区容错性放在最前面,在不损失模型质量的前提下,容忍有限的参数不一致,从而让训练在故障、延迟、异构硬件的环境中永远不停机。

Decoupled DiLoCo的技术演进与架构

在正式讲解 Decoupled DiLoCo 之前,我们得先梳理一下它的技术溯源,因为它实际上已经是 DiLoCo 系列技术的第三次迭代。最早的分布式低通信训练(DiLoCo: Distributed Low-Communication Training)由亚瑟·杜伊拉德(Arthur Douillard)团队在2024年提出,核心思路是把全局每步同步改成每 H 步同步一次,通过内外层优化器分离,大幅降低了通信带宽。2025年推出的流式 DiLoCo(Streaming DiLoCo)进一步把模型参数切分成碎片,分步异步传输,解决了峰值带宽过高的问题。但是这两代方案都有一个致命短板,那就是它们依然是同步框架,所有学习器必须锁步执行,只要有一个学习器故障或掉队,整个系统依然会卡顿。而 Decoupled DiLoCo 正是在 Pathways 理念的支撑下,把间歇性同步彻底升级成了完全异步解耦,真正打破了锁步同步的枷锁。

接下来,我们正式进入到 Decoupled DiLoCo 的架构设计部分。简单来说,整个框架把传统一体化的 SPMD 集群拆分成了两大核心组件,分别是独立异步学习器(Learner)和中央同步器(Syncer)。两者分工明确,彻底解耦,故障半径被严格限制在了单个学习器的内部。

独立异步学习器:故障隔离与并行效率

先看学习器(Learner),这是 Decoupled DiLoCo 的基础执行单元。整个集群被划分为 M 个独立的学习器,每个学习器都持有一份完整的模型副本,分配独立的数据分片,运行独立的内层优化器(比如 AdamW)。最核心的设计是所有学习器完全独立运行,不需要等待任何其他学习器。每个学习器只做三件事:

  1. 在本地持续执行内层优化步骤,处理自己的数据分片,追踪本地训练步数、处理的 Token 数等进度信息。
  2. 在后台异步向同步器发送本地参数碎片和进度元数据,这个通信过程完全不影响本地训练。
  3. 监听同步器的更新指令,收到同步后的参数碎片后,直接覆盖本地对应参数,重置进度计数器,完成局部重同步。

这种设计带来的第一个革命性优势就是故障完全隔离。如果某个学习器因为硬件故障、网络延迟暂停训练,其他所有学习器完全感知不到,依然按照自己的节奏正常训练,不会出现任何停滞。就像把一个大型联合考场拆成了无数个独立小考场,一个考场出现问题疏散,其他考场的考生完全不受影响,继续答题。这就从根本上解决了 SPMD 范式一损俱损的致命问题。

中央同步器:高可用与高质量的平衡大脑

然后是中央同步器(Syncer),这是整个框架的大脑,运行在稳定的 CPU 资源上,负责全局参数的聚合与更新。它也是 Decoupled DiLoCo 和传统参数服务器架构的核心区别。同步器的核心设计彻底抛弃了要等待所有学习器同步的传统逻辑,转而采用三大关键机制,保证高可用与高质量的平衡:

  1. 最小法定数聚合(Minimum Quorum: 确保系统在部分组件失败时仍能运行的最小工作单位)。同步器不需要等全部 M 个学习器上报数据,只需要达到预设的最小数量 K(其中 K≤M),就可以启动参数聚合。故障或掉队的学习器直接被排除在本轮同步之外,等恢复后再重新加入。这样就保证了全局训练永远不会因为个别学习器的问题停滞。论文中实验常用 K=1,也就是只要有1个学习器上报,同步器就能工作,这样极端场景下依然能保证训练持续。
  2. 自适应宽限窗口(Adaptive Grace Window: 动态调整等待时间以最大化效率与数据新鲜度)。当同步器达到最小法定数后,不会立刻执行聚合,而是会利用通信与计算的重叠间隙,等待一段可控的时间,尽可能纳入更多学习器的更新。这个等待时间被严格限制在了系统空闲带宽内,不会降低整体吞吐率,却能大幅提升同步的样本效率,降低外层梯度的方差,完美平衡了速度与质量。
  3. 动态 Token 加权合并(Dynamic Token-weighted Merging: 根据学习器贡献的有效 Token 数量进行加权平均)。因为学习器是异步运行的,速度快的学习器在同步间隔内处理的 Token 更多,贡献的更新更有价值。同步器会根据每个学习器上报的 Token 数、步数计算动态权重,权重公式为“处理 Token 数乘以 Token 数除以步数”,简单来说就是处理的数据量乘以数据的处理效率,让更新合并更公平,避免快学习器主导全局参数,慢学习器拖慢整体进度。

除了这三大机制,同步器还采用了径向方向平均合并算法(RDA: Radial-Directional Averaging),这是论文的核心算法创新之一。传统的直接平均会导致外层梯度的范数随学习器的数量增加而衰减,需要反复调优外层优化器。而 RDA 分别合并了梯度的范数和方向,保证合并后的梯度范数不受学习器数量影响,大幅提升了超参数稳定性。尤其在学习器数量扩展到8个、16个时,模型性能不会出现衰减。

工程优化与混沌工程验证

工程层面,Decoupled DiLoCo 还有两个关键优化,直接解决了通信与部署的核心问题:

  1. 平衡张量分片(Balanced Tensor Fragmentation: 优化模型参数切分策略,实现通信与计算平衡)。这是比流式 DiLoCo 更优的一种参数分片策略。传统的按层分片会导致通信脉冲式爆发,张量分片会导致碎片大小不均。而平衡张量分片用贪心装箱算法(Greedy Bin Packing Algorithm: 一种启发式算法,用于将物品装入容量有限的箱子以最小化箱子数量)把模型的所有张量按大小均匀分配到24个碎片中,每一步只传输一个碎片,既保证每步都有通信,又让峰值带宽降到最低,是系统性能与模型质量的最优解。
  2. 外层梯度压缩:论文验证了把16位 bf16 梯度压缩到4位 int4,模型性能几乎没有损失,进一步把带宽需求降低75%,从而让跨地域、低带宽网络下的训练成为可能。

为了验证框架的容错能力,研究团队引入了混沌工程(Chaos Engineering: 在分布式系统中主动注入故障以验证其韧性)。这是大模型训练领域首次系统性使用混沌工程来验证可靠性。团队模拟了五种核心故障场景,分别是单芯片平均故障间隔、集群总芯片数、芯片速度差异、弹性扩缩容时间以及故障恢复时间。通过离散事件模拟器(Discrete Event Simulator: 模拟系统在离散时间点上状态变化的仿真工具)生成故障日志,严格复现百万级芯片集群的故障环境。

实验数据直接印证了 Decoupled DiLoCo 的碾压性优势:在固定单芯片故障间隔1年的前提下,随着集群芯片数从15万增加到240万,传统无弹性数据并行的有效吞吐率从72%暴跌到了18%,开启弹性后也只能从88%降到40%。而 Decoupled DiLoCo 随着学习器数量增加,有效吞吐率稳步提升,8个学习器时240万芯片规模下有效吞吐率可以达到80%,16个学习器时可以达到86%,系统正常运行时间更是接近100%,实现了严格意义上的零全局停机

模型性能、异构适配与算力捡拾

模型性能方面,研究团队在 2B、5B 和 9B 参数的稠密模型(Dense Model: 所有参数均参与计算的传统神经网络模型),以及 2.8B 和 3.8B 激活参数的混合专家模型(MoE Model: Mixture of Experts,一种稀疏激活模型,仅激活部分专家网络进行计算)上,分别做了文本、视觉多任务评测,训练数据量从260亿 Token(最小的文本处理单元)到1万亿 Token。结果显示,在极端故障环境下,Decoupled DiLoCo 的文本任务和视觉任务平均分与传统数据并行训练几乎完全一致,没有任何性能损耗。这意味着 Decoupled DiLoCo 在获得极致容错与效率的同时,完全没有牺牲模型的质量,这也是它能落地工业级场景的核心前提。

更令人惊喜的是它的异构硬件适配能力。研究团队用 TPUv5eTPUv5p 两种不同代际的芯片搭建集群,最慢的学习器比最快的慢18%,还额外人工注入了10%的速度差异。在这种极端异构环境下,通过最小法定数 + 自适应宽限窗口的组合,系统的计算利用率依然可以达到100%,模型下游性能与完全同步的同质集群完全一致。这意味着新老芯片、不同性能的硬件可以无缝混合训练,不需要为了同步强行统一硬件规格,从而大幅降低了集群部署成本。

而 Decoupled DiLoCo 最具想象力的能力还应当属 Compute Scavenging 这个功能,直接翻译过来就是算力捡拾或者是算力拾荒。怎么理解呢?传统数据的并行训练要动态加入新的算力,必须先把完整模型参数和优化器状态传输到新的设备,这个过程会阻塞全局训练,导致效率暴跌。而 Decoupled DiLoCo 的学习器恢复机制允许新学习器从邻近学习器异步拉取模型状态,同步过程在后台完成,全局训练完全不受影响。

论文实验显示,在固定 FLOPs(Floating Point Operations Per Second: 每秒浮点运算次数)的前提下,动态加入25%、50%、100%、300%的临时算力,训练时间分别缩短7%、9%、2%和20%,模型性能完全不受影响。而传统数据并行需要算力翻倍以上,才能看到微弱的加速效果。这意味着全球各地数据中心的闲置算力、不同时区的潮汐算力、甚至个人设备的零散算力,都能被整合到同一场大模型训练中,彻底盘活了全球的闲置 AI 算力。

可扩展性方面,论文验证了无论是稠密模型还是 MoE 模型,Decoupled DiLoCo 的性能都能对标甚至小幅超越传统的数据并行,而且随着模型规模和 Token 预算的增加,优势越来越明显。在1.3万亿 Token 的超大预算下,Decoupled DiLoCo 的文本和视觉任务平均分已经超过了传统数据并行,完美印证了“越大越好用”的特性,非常适合下一代万亿参数大模型的训练需求。

后训练兼容性与带宽革命

后训练兼容性也是如今工业落地的关键指标。研究团队把故障环境下训练的 5B 参数模型经过 Gemma 4 的轻量后训练 pipeline(指一系列按特定顺序执行的数据处理步骤),在 MMLU-Pro(大规模多任务语言理解专业版)、多语言理解、数学推理、代码生成任务上的表现,与理想环境下训练的模型几乎一致,甚至部分任务还略有提升。这说明 Decoupled DiLoCo 的异步解耦设计不会影响模型的微调、对齐等后续能力,完全兼容现有大模型的产业落地流程。

最后,我们必须重点强调 Decoupled DiLoCo 的带宽革命,这是它能实现跨地域训练的核心支撑。论文给出了一组精准的带宽对比数据:在 5B 参数模型、1秒计算步长、2个数据中心的场景下,要达到90%的计算利用率,传统数据并行需要每秒104 GB的带宽,而 Decoupled DiLoCo 只需要每秒1.7 GB,压缩到4位 int4 后仅需每秒0.43 GB,带宽需求几乎降低了两个数量级。而在8个数据中心的跨地域场景下,这个差距会进一步拉大。团队还做了真实跨地域实验,把8个学习器分布在美国中西部、南部、西部、大平原四个区域,非同城的 Decoupled DiLoCo 训练速度与同城集群几乎一致,而传统数据并行的非同城训练速度慢了10到20倍,完全无法落地。

颠覆性意义:大模型训练的未来

讲到这里,我们就能明白 Decoupled DiLoCo 的行业意义。它彻底颠覆了统治大模型训练十余年的 SPMD 范式,把“一致性优先”转向“可用性优先”,让超大规模大模型训练从一个脆弱的精密仪器变成了一个容错的弹性系统。杰夫·迪恩(Jeff Dean)也在分享中提到,14年前他在发表的《大规模分布式深度网络》论文中就提出了异步分布式训练的理念,但是受限于当时的工程条件,无法落地。而14年后的今天,Decoupled DiLoCo 把这个理念变成了切实可行的工业级方案,正好适配了当下百万级芯片、万亿参数模型的训练需求。

随着大模型预训练不断向跨地域集群、异构硬件、零散算力扩展,带宽和硬件可靠性的双重约束会越来越明显。Decoupled DiLoCo 所代表的可用性优先的训练范式必将从一个优势选项变成一个必选项。它不仅解决了当下大模型训练的效率与容错痛点,更打开了全新的训练格局。未来的大模型训练不再需要集中式的超级数据中心,而是可以整合全球的算力资源,用最低的成本、最高的效率,训练出最顶尖的大模型。

对于整个 AI 行业来说,这篇论文意味着大模型训练的规模化瓶颈被彻底打破,万亿参数模型的训练成本会大幅下降,更多机构、团队都能参与到超大规模大模型的研发中。而对于我们来说,Decoupled DiLoCo 也让我们看到,AI 的进步并不止是模型参数的堆砌,也包括底层训练架构的持续革新。感谢收看本期视频,我们下期再见。

📌 文中提及的人物和组织

公司/组织: Google, Google DeepMind, Google Research

产品/模型: Gemma 4, GPT-4o

关键字: large-language-model-training distributed-systems fault-tolerance bandwidth-optimization asynchronous-training