技术前哨:四个月前的战略伏笔
在人工智能领域,开源大模型的竞争日趋白热化。前两天,月之暗面(Moonshot AI)正式开放了其最新大模型 Kimi K3 的权重,并发布了详尽的技术报告。这一消息在业界引发了广泛关注与热烈讨论。当我们惊叹于 Kimi K3 如今所展现出的强大性能和技术突破时,如果将时间拨回到今年 3 月 21 号的英伟达(NVIDIA)GTC 大会上,就会发现杨植麟当时发表的一场几乎全程聚焦于技术细节的精彩演讲,早已为今天 K3 的成功埋下了所有的伏笔。
那场演讲的主题是关于 Kimi K2.5 背后的扩展方法论。在当时的演讲中,杨植麟和他的团队详细拆解了他们在优化器设计、长上下文架构设计、智能体训练范式重构等关键领域的探索,甚至还预告了一个当时刚刚公布的全新架构。在彼时,很多行业观察者可能只是把这场演讲当作一场普通的技术交流与分享,但四个月后 Kimi K3 用一份硬核的成绩单向所有人证明,那场演讲里所提及的每一个技术选择、每一条工程路径,都不是只停留在实验室纸面论文上的空谈,而是实实在在通向更强通用人工智能的工程基石。
为了真正理解下一代大模型的竞争核心,我们需要深入回顾并重新审视月之暗面这套大模型扩展的底层逻辑。整场演讲的核心主线,是杨植麟和他的团队在三个维度上同时进行的系统性扩展。或许有人会认为,缩放定律(Scaling Law:通过按比例增加模型参数量、训练数据量和计算资源来持续降低模型预测误差的经验公式)早已是全行业的共识,无非就是不断堆砌参数、堆砌数据、堆砌算力。但对于月之暗面团队而言,他们的关注重点从一开始就超越了单纯的物理规模堆叠。
在这三个同时推进的扩展维度中:
- 第一个维度是最经典的缩放定律本身。在传统的缩放曲线中,横轴是训练所消耗的 Token 数量,纵轴则是模型的损失值。Token 数量越多,损失值就越低。而月之暗面团队真正在意的,是如何在相同的 Token 数量下,通过优化架构和优化器来提升 Token 的利用效率,从而换取更低的损失值。
- 第二个维度是扩展上下文长度。上下文长度的延伸,能直接提升模型在给定位置预测下一个 Token 的准确率,这也是模型能够攻克复杂长任务的基础。
- 第三个维度则是智能体数量的扩展。团队提出了一种名为智能体蜂群的全新训练范式,让模型不再依赖单个智能体单打独斗,而是编排一群智能体协同并行完成子任务。
当我们将这三个维度放到智能体的语境下时,它们便形成了直接的映射关系。Token 效率的提升对应着更强大的先验知识,这能让智能体在进行强化学习搜索时更加高效;长上下文则对应着能够持续运行更久的智能体,支持其连续运行几天、几周甚至数月来攻克长周期任务;而智能体蜂群则是叠加在其之上的协同维度。最终,月之暗面旨在打造一群拥有超长上下文、具备强先验知识的智能体,在统一的强化学习系统里协同搜索最优答案。这种多维度的协同扩展,正是拉开技术差距的关键所在。
突破数据墙:Muon 优化器的万亿级工程落地
在探究如何让每一个 Token 更加值钱的工程路径中,杨植麟在演讲中展示了一张机器学习史上的经典图表,该图表出自卡普兰(Kaplan)等人的缩放定律开创性论文。该研究指出,只要成比例地扩大训练 Token 数量、模型参数量和计算资源,模型的损失值就会呈现幂律下降。然而,在互联网高质量文本数据总量逐步逼近上限的今天,整个行业正在面临所谓的“数据墙”挑战。数据不再是无限可开采的资源,这使得提升 Token 的利用效率成为了突破智能天花板的关键。
假设整个行业目前可用的高质量 Token 总量是一个常数(如 50 万亿条),如果能通过引入全新的优化器将 Token 效率提升两倍,这在效果上就等同于凭空创造出了 100 万亿条 Token 的价值。这不仅是节省算力成本的问题,更是决定了模型智能上限的瓶颈所在。为了实现这一跨越,月之暗面团队重点投入了对 二阶优化器(Muon Optimizer:通过对梯度进行正交化转换,使每次参数更新在不同维度上彼此正交,从而显著提升数据利用效率的二阶优化算法)的研究与应用。
传统的 自适应矩估计优化器(Adam Optimizer:一种通过计算一阶和二阶矩估计来动态调整每个参数学习率的自适应优化算法)在更新参数时,无法完全消除梯度分量之间的冗余。而 Muon 优化器在每一次梯度更新时,都会对更新项进行转换,使其彼此之间保持正交。月之暗面是行业内首个证明 Muon 优化器可以成功扩展并应用于万亿参数规模大语言模型训练的团队。为了将其从理论推向实际生产,团队克服了诸多工程阻碍并提出了两项核心关键技术:
- 权重衰减机制的改良:这对于模型在高参数量下的稳定训练起到了决定性的作用。
- 更新幅度的对齐控制:通过引入一个精心设计的可调系数应用在每次更新上,确保 Muon 的参数更新幅度和 Adam 保持在可比的水平。
同时,为了在 GPU 集群上实现极高的内存与计算效率,团队开发了一套先进的分布式 Muon 优化器实现方案,将优化器的状态切分并部署到不同的数据并行组中。在相同参数量与训练 Token 数量的严格对照实验中,将 AdamW 替换为 Muon 优化器后,各项下游任务指标均实现了全面且明显的提升。
然而,当团队尝试将 Muon 优化器扩展到一万亿参数的极大规模时,训练不稳定的问题开始浮现。具体而言,模型内部注意力机制中的 最大注意力对数(Maximum Attention Logit:注意力机制中查询向量与键向量点积的最大未归一化值,其数值过大会引发训练发散与数值不稳定)会迅速膨胀并超过 1000,而正常训练时的数值通常应当控制在 50 到 100 之间。这种异常的数值爆炸会导致训练发散,损失值在下降一段后会突然飙升,模型无法收敛。
为了解决这一万亿参数训练中的致命问题,月之暗面团队设计了一种名为 QK Clip 的巧妙算法。其具体实操方法如下:
- 在前向传播过程中,针对网络中的每一个注意力头,实时计算当前查询向量与键向量投影的最大 Logit 值。
- 依据该最大值,动态算出一个自适应的缩放系数。
- 将该缩放系数应用到 Key 和 Query 的投影矩阵上,从而将它们的数值范围约束在安全的预设区间内,防止数值发生爆炸。
实验结果表明,应用 QK Clip 技术前后,模型的训练损失下降曲线几乎完全重合,这证明该方法完全不会拖累模型的收敛速度。而在中间指标上,最大 Logit 值在上升到 100 左右时会被强行卡住,随着训练步数的推进自然回落,网络自身找到了在不损害表达能力的前提下控制数值稳定的最佳平衡点。月之暗面将该技术应用于其 Kimi K2 模型的训练中,成功实现了机器学习史上首次将 Muon 优化器推广至万亿参数规模的工程壮举。
线性注意力与混合架构:长上下文的高效表达
在解决 Token 效率之后,第二个扩展维度在于上下文长度的突破。在演讲中,杨植麟对比了 Transformer 架构与 长短期记忆网络(LSTM:一种通过引入门控机制来解决传统循环神经网络梯度消失或梯度爆炸问题的循环架构)在长序列下的表现差异。虽然在相同参数量和 Token 数下 Transformer 的训练损失更低已是常识,但更有深意的是,随着上下文长度的持续增加,Transformer 的单 Token 损失值会平滑且持续地下降,而 LSTM 的损失值在达到某一特定长度后便会进入饱和期,不再继续下降。这表明 Transformer 具备更强的长上下文信息捕捉能力,这在智能体需要阅读整个代码仓库或运行超长轨迹等复杂任务时至关重要。
然而,传统的 多头注意力(Multi-Head Attention:Transformer 中通过多个独立投影空间并行计算注意力以捕捉不同语义维度的核心机制)在处理极长上下文时,其计算与内存开销会随着序列长度呈平方级($O(N^2)$)增长,导致计算资源迅速枯竭。为此,团队研发了 Kimi Linear 架构,其中包含了一种新型的 线性注意力(Linear Attention:通过改变注意力矩阵的计算顺序,将计算复杂度从序列长度的平方降低到线性级别的注意力机制)变体,命名为 Kimi Delta Attention。
为了兼顾长序列的计算效率与短序列的语义表达精度,团队并没有极端地采用纯线性注意力,而是将线性注意力层与全注意力层按照 1:3 的比例进行混合部署。之所以进行这一改良,是因为原始的线性注意力机制存在记忆衰减过于单一的致命缺陷。在原始设计中,模型仅依靠一个统一的标量衰减因子来管理历史记忆,这导致模型在面对长文本时,要么陷入完全遗忘,要么试图无差别地记住所有细节,无法在长上下文中进行有选择性的遗忘与聚焦。
为了解决这一痛点,Kimi Delta Attention 引入了细粒度的矩阵衰减因子,将原本的标量衰减系数替换为一个对角矩阵:
- 多通道衰减速率控制:对角矩阵中的每个元素分别控制不同通道的衰减速度。
- 长短期记忆分流:一部分通道的衰减速率设置得极慢,用于在超长序列跨度上保留关键的全局背景信息;而另一部分通道则快速衰减,用于敏锐捕获和接收局部的最新输入。
- 并行分块计算优化:由于衰减项由标量升级为矩阵,无法再使用传统的并行计算公式。团队对底层数学公式进行了精确重写,引入了矩阵求逆运算与累积衰减因子,在适配 GPU 并行分块计算的同时,确保了数学上的完全等价,实现了无损的效率提升。
在下游评估中,Kimi Linear 在偏短上下文的任务(如 MMLU 知识评估)上表现优于经典的 MLA 和 GDN 架构;在长上下文基准测试(如 RULER)上,它不仅取得了更优的准确率,且比 MLA 更加节省算力。当上下文长度进一步扩展到 100 万 Token 乃至更长时,Kimi Linear 的效率优势更加瞩目,成为了首个在短输入、长输入以及长输出任务上全面超越传统全注意力架构的混合设计方案。
智能体蜂群:多智能体协同与强化学习机制
除了单模型在 Token 效率与长上下文层面的演进,月之暗面所探索的第三个维度,同时也是最具颠覆性的方向,是构建多智能体的协同网络。团队设计了一种名为智能体蜂群的全新范式,其核心是引入一个负责整体任务编排与协调的主智能体(Orchestrator)。
这个主智能体就像是人类社会中的企业 CEO,负责将一个极其复杂的全局目标拆解成多个相互独立且逻辑关联的子任务。随后,主智能体动态创建一批具备不同专业技能的子智能体(如专门负责文献检索的智能体、负责代码编写的智能体、负责数据校验的智能体等)并分发任务。在子智能体并行执行完毕并返回结果后,主智能体负责收集、清洗和汇总这些信息,通过多轮迭代交互,最终产出单个模型根本无法独立完成的高难度任务成果。
与传统的单智能体处理方式相比,智能体蜂群在大规模并行化扩展上展现出了显著优势:
- 任务时间的大幅缩短:通过将任务拆解为子任务并进行多路并发,极大地减少了串行等待的时间,使得在限定时间内调度 100 个乃至 1000 个子智能体成为可能。
- 多维度的扩展能力:包括输入端的并行文档阅读与下载、输出端的长篇文献综述协同撰写,以及执行端的多任务并行数据分析。
为了训练并优化这样一个复杂的协同系统,传统的单智能体 强化学习(Reinforcement Learning:通过与环境交互并基于奖励信号进行迭代优化的机器学习训练范式)算法已无法直接适用。为此,月之暗面团队专门设计了一套包含三项奖励机制的复合奖励目标函数:
- 实例化奖励(Instantiation Reward):用于在训练早期鼓励主智能体主动创建并调度子智能体,避免系统退化为低效的单智能体串行工作模式。该奖励的权重在训练后期会逐步衰减。
- 完成奖励(Completion Reward):在实验中团队发现,模型有时会通过盲目创建大量无意义的子任务来骗取实例化奖励。因此引入该项奖励,考核子任务的实际完成比例,确保生成的子智能体都有明确的价值产出。其权重同样采用前期高、后期低的衰减策略。
- 最终结果奖励(Outcome Reward):从全局视角评估整个任务的最终交付质量,引导所有子智能体朝着最终的全局正确目标迈进。
这三项奖励有机结合,构成了智能体蜂群在强化学习阶段的整体优化目标。为了支撑这套算法稳定运行,团队在底层配套搭建了高并发的执行基础设施,支持多通道并行推理、灵活的奖励函数计算以及极高的输入输出(I/O)吞吐效率。这种算法设计与工程基建的无缝结合,才是智能体蜂群得以真正落地的幕后保障。
模态早期融合与注意力残差:下一代架构的设计范式
当 Token 效率、长上下文和智能体蜂群这三条技术支线相互交织时,便孕育出了 Kimi K2.5 以及如今的 Kimi K3。为了让这些能力完美融合,团队在多模态预训练阶段做出了极具前瞻性的抉择。
与业界普遍采用的后期融合策略(即先在数十万亿 Token 上训练纯文本基座,再通过少量多模态数据进行后训练对齐)不同,Kimi 团队坚定地采用了 早期融合(Early Fusion:在多模态大模型训练中,从预训练首日便将视觉和文本数据联合输入网络进行共享表征学习的对齐方法)的方案。这意味着从训练的第一天起,视觉 Token 和文本 Token 就被混合输入网络,在共享的表征空间中进行联合训练。
在英伟达 H800 GPU 集群(每个节点配备 2TB 内存,节点间通过 NVLink 高速互联)上,模型平稳且高质量地度过了超过 30 万亿 Token 的超长训练生命周期。在整个过程中,由于 Muon 优化器与 QK Clip 的协同作用,训练曲线展现出了极高的平滑度,未发生任何损失值飙升(Loss Spike)的数值异常。这种极度稳定的预训练过程,为多模态能力的融合奠定了扎实的基底。
团队从这种早期融合训练中获得了一些颠覆性的反常识发现:
- 模态间的协同促进:传统的后期融合往往会导致多模态训练拖累文本本身的性能,但早期融合实现了模态间的互相增强。
- 零视觉监督微调(Zero Vision SFT):团队尝试在强化学习阶段仅使用纯视觉任务进行优化,不引入任何数学或编程文本任务,结果发现模型的文本推理能力也随之提升。反过来,若文本基座足够扎实,在完全不使用专门视觉 监督微调(SFT - Supervised Fine-Tuning:使用高质量的人工标注数据对预训练模型进行有监督的参数微调)数据的前提下,仅依靠联合强化学习,模型在视觉任务上的表现即可逼近行业顶尖水平。这证明了高质量的共享语义空间能够让模态间的智能完美互通。
在演讲的尾声,杨植麟还隆重介绍了被引入 K3 模型中的下一代创新架构——注意力残差(Attention Residual)。这一思想的灵感来源于深度网络中的 残差连接(Residual Connection:在深度神经网络中通过跨层直连将输入与输出相加,从而有效解决梯度消失并使深层网络稳定收敛的技术)。伊利亚曾指出,残差连接本质上是 LSTM 架构在深度维度上旋转了 90 度的产物,将原本在时间维度上的循环累加转变为在空间网络深度上的信息传递。
沿着这一洞察,月之暗面团队提出:既然在深度维度上可以使用类似 LSTM 的加法累加,那么是否可以同样将性能更强大的注意力机制旋转 90 度,应用在网络深度维度上?这便诞生了注意力残差架构。在该设计中,每一层的输出不再仅仅依赖前一层的状态,而是通过注意力机制动态聚合之前所有层的隐藏状态。
为了降低直接引入该机制带来的高昂计算与内存通信开销,团队巧妙设计了分块注意力残差变体,将网络划分为若干个局部块(如每 16 层或 4 层为一个 Block),仅在块的边界处应用注意力残差,块内部则保留传统的残差连接。实验表明,这一新架构在 Scaling Law 层面将 Token 效率直接提升了 24%,在 GPQA、数学推理和 HumanEval 代码生成等极度依赖深度推理的基准测试中,均展现出了显著的性能跃升。
回望四个月前 GTC 大会上的前沿分享,月之暗面的工程师们正是在这些正确且难走的工程方向上,用一种近乎“做笨功夫”的态度,将优化器稳定性、长上下文表达力、多智能体协同以及多模态早期融合的每一个工程细节都死磕到底。正是这些在实验室中看似细微的突破,在经过万亿参数和数十万亿 Token 规模的工业级洗礼后,最终汇聚成了今天 Kimi K3 领跑开源大模型的坚实力量。