乔木博客
全部
AI工具
AI教程
AI生成
AI资讯
健脑房
播客解读
论文学习
DeepSeek-V4论文解析:百万上下文、水平接近闭源模型是如何做到的?
论文学习
·
2026年4月24日
·
2999 次阅读
·
约 26 分钟
DeepSeek V4 论文技术报告下载:📎 DeepSeek_V4.pdf
写在前面
大语言模型的发展,遇到了一个绕不开的瓶颈。
传统注意力机制在处理超长上下文时的计算开销呈平方级增长,就像处理的文本越长,计算量就以更快的速度爆炸式增长。
这不仅限制了推理模型的测试时扩展能力,也让复杂的长时程任务难以落地。
DeepSeek-V4系列的发布,试图打破这个效率天花板。
这次发布包含两个模型,DeepSeek-V4-Pro(1.6T参数,49B激活)和DeepSeek-V4-Flash(284B参数,13B激活),都原生支持百万token上下文。
核心突破在于架构创新。
通过压缩稀疏注意力和重度压缩注意力的混合设计,在百万token场景下,DeepSeek-V4-Pro的单token推理计算量仅为DeepSeek-V3.2的27%。
KV缓存(可以理解为模型处理长文本时需要记住的"笔记本")降至10%。
DeepSeek-V4系列与DeepSeek-V3.2在推理计算量和KV缓存大小上的对比。在百万token场景下,V4-Pro的计算量降至V3.2的27%,缓存降至10%
架构升级,效率优先
混合注意力机制
DeepSeek-V4的核心设计是两种注意力机制的交替使用,就像在不同场景下切换不同的工作模式。
压缩稀疏注意力(CSA) 采用两步策略。
第一步是压缩,把每4个token的信息压缩成一个条目,就像把一段话的要点提炼出来。
第二步是稀疏选择,通过"Lightning Indexer"(可以理解为一个智能索引系统)快速找到最相关的信息,而不是傻傻地看完所有内容。
具体来说,压缩过程会计算两组信息及其重要性权重,然后加权合并。
Lightning Indexer用一种低成本的方式生成查询向量,计算每个压缩块的相关性分数,然后只选择最相关的top-k个。
这种设计在保持性能的同时,把序列长度压缩到原来的四分之一。
重度压缩注意力(HCA) 压缩更激进,每128个token压缩为一个条目,但保留密集注意力(也就是不做稀疏选择)。
这种设计在极长上下文场景下进一步降低计算成本。
两种注意力机制都引入了滑动窗口分支,保留最近128个未压缩的token,就像在看长文档时,总是对最近看到的内容保持清晰记忆。
此外,查询和KV条目都经过归一化处理,避免数值爆炸。
部分维度应用旋转位置编码(一种让模型理解token相对位置的技术),确保模型能准确把握文本中各部分的位置关系。
图2:DeepSeek-V4的整体架构。通过CSA和HCA的混合使用,配合mHC和DeepSeekMoE,实现高效的长文本处理
流形约束超连接(mHC)
传统残差连接(一种让信息在神经网络层之间传递的技术)的表达能力有限。
DeepSeek-V4引入mHC来增强信号传播的稳定性。
核心思想是给残差映射加上数学约束,确保信号在层与层之间传递时不会失控放大或缩小。
mHC的参数是动态生成的,分为两部分:一部分根据输入内容变化,另一部分保持固定。
输入映射和输出映射都被约束为非负有界,避免信号相互抵消。
这种设计在深层堆叠时保持数值稳定性,同时不牺牲模型表达能力。
Muon优化器
DeepSeek-V4采用Muon优化器(一种新型的参数更新算法)训练大部分参数。
Muon的关键在于通过迭代计算让参数保持正交性(可以理解为让不同参数各司其职,互不干扰)。
DeepSeek-V4设计了混合迭代策略,前8步快速收敛,后2步精确稳定。
由于注意力架构允许直接对查询和KV条目进行归一化,DeepSeek-V4不需要额外的技术来防止注意力数值爆炸。
这简化了优化器实现,同时保持训练稳定性。
基础设施优化
专家并行的细粒度重叠
MoE层(混合专家模型,可以理解为让不同的"专家"处理不同类型的输入)的专家并行面临通信瓶颈。
DeepSeek-V4设计了细粒度方案,把通信和计算融合到一起。
关键洞察是,在MoE层中,通信总时间小于计算总时间,因此通信延迟可以被计算隐藏。
具体实现上,专家被分割成多个波次,每个波次包含少量专家。
一旦某个波次的所有专家完成通信,计算立即开始,无需等待其他专家。
在稳态下,当前波次的计算、下一波次的数据传输、已完成专家的结果发送同时进行,形成流水线。
这种设计在通用推理负载下实现1.5到1.7倍加速,在强化学习推出等延迟敏感场景下达到近2倍。
TileLang内核开发
DeepSeek-V4采用TileLang这一领域特定语言开发融合内核,平衡开发效率和运行性能。
Host Codegen(主机代码生成)
将大部分主机端逻辑移入生成的代码,在编译阶段就把必要的元数据嵌入进去。
运行时,生成的代码直接执行验证和参数准备,把所有检查移出Python执行路径。
实测显示,CPU端验证开销从数十或数百微秒降至不到1微秒。
SMT求解器辅助的形式化整数分析
集成Z3求解器(一个强大的数学证明工具),为张量程序中的整数表达式提供形式化分析能力。
这让编译器能够进行更激进的优化,比如在变量张量形状上的向量化。
在合理的资源限制下,Z3将整体优化性能提升,同时将编译时间开销限制在几秒内。
数值精度和逐位可重现性
默认禁用可能影响精度的优化,影响精度的近似操作需要显式开启。
当需要严格的数值标准时,TileLang提供符合标准的函数,支持显式舍入模式,使开发者能够精确指定数值行为。
批次不变和确定性内核
为确保训练可重现性以及预训练、后训练和推理流水线的逐位对齐(也就是确保每次运行结果完全一致),DeepSeek-V4实现了端到端的批次不变和确定性内核。
注意力 为实现批次不变性(也就是同一个token无论在批次中的什么位置,输出都完全一样),不能使用传统的split-KV方法。
DeepSeek-V4采用双内核策略:
第一个内核在单个计算单元内处理整个序列,确保高吞吐量
第二个内核使用多个计算单元处理单个序列,最小化延迟。
为确保两个内核的输出完全一致,第二个内核的计算路径经过精心设计,确保累加顺序与第一个内核相同。
矩阵乘法
传统cuBLAS库无法实现批次不变性,DeepSeek-V4端到端替换为DeepGEMM。
对于极小批次大小,传统实现通常采用split-k技术(一种并行优化技术)提升性能,但split-k无法保证批次不变性。
DeepSeek-V4在大多数场景下放弃split-k,通过一系列优化使矩阵乘法实现在大多数主要场景下匹配甚至超越标准split-k的性能。
确定性训练
非确定性通常源于并行计算时的累加顺序不确定。
在注意力反向传播中,为每个计算单元分配单独的累加缓冲区,随后执行确定性求和。
在MoE反向传播中,设计了token顺序预处理机制,结合缓冲区隔离,确保累加顺序的确定性。
FP4量化感知训练
DeepSeek-V4在后训练阶段引入量化感知训练(让模型在训练时就适应低精度计算),使模型适应量化引入的精度下降。
对MoE专家权重和注意力索引器的部分路径应用FP4量化(一种极低精度的数值表示)。
此外,将索引分数从FP32量化到BF16,实现top-k选择器2倍加速,同时保持99.7%的召回率。
对于MoE专家权重,优化器维护的高精度权重首先量化到FP4,然后反量化回FP8进行计算。
由于FP8相比FP4有更大的动态范围,FP4到FP8的反量化是无损的。
这使得整个训练流程完全复用现有的FP8训练框架,无需任何修改。
在推理和强化学习的推出阶段,直接使用真实的FP4量化权重,确保采样期间的模型行为与在线部署完全一致,同时减少内存加载以实现实际加速并显著降低内存消耗。
预训练策略
数据构建
在DeepSeek-V3预训练数据基础上,DeepSeek-V4构建了更多样化、更高质量的训练语料,有效上下文更长。
对于网络来源数据,实施过滤策略移除批量自动生成和模板化内容,降低模型坍塌风险(也就是避免模型学到太多重复、低质量的内容)。
数学和编程语料仍是训练数据的核心组成部分,通过在中期训练阶段加入智能体数据进一步增强编码能力。
对于多语言数据,构建了更大的语料库,改善对不同文化长尾知识的捕获。
特别强调长文档数据整理,优先选择科学论文、技术报告等反映独特学术价值的材料。
预训练语料超过32万亿token,包含数学内容、代码、网页、长文档和其他高质量类别。
在DeepSeek-V3分词器基础上,为上下文构建引入少量特殊token,词汇表大小保持128K。
继承token分割和Fill-in-Middle策略(一种让模型学习填充中间内容的训练技巧),将不同来源的文档打包成适当的序列以最小化样本截断。
与DeepSeek-V3不同,预训练期间采用样本级注意力掩码(也就是更精细地控制模型能看到哪些内容)。
训练配置
DeepSeek-V4-Flash
设置43层Transformer,隐藏维度4096。
前两层使用纯滑动窗口注意力,后续层交替使用CSA和HCA。
CSA压缩率为4(也就是每4个token压缩成1个),索引器查询头数64,索引器头维度128,稀疏注意力选择的KV条目数为512。
HCA压缩率为128。CSA和HCA的查询头数均为64,头维度512,查询压缩维度1024。
输出投影组数为8,每个中间注意力输出维度1024。滑动窗口分支的窗口大小为128。
所有Transformer块采用MoE层,但前3个MoE层使用Hash路由策略(一种简单高效的路由方法)。
每个MoE层包含1个共享专家和256个路由专家,每个专家的中间隐藏维度2048,每个token激活6个路由专家。
多token预测深度为1。mHC扩展因子为4,迭代次数20。
该配置下,DeepSeek-V4-Flash总参数284B,每个token激活13B。
DeepSeek-V4-Pro
设置61层Transformer,隐藏维度7168。
前两层使用HCA,后续层交替使用CSA和HCA。
CSA压缩率为4,索引器查询头数64,索引器头维度128,稀疏注意力选择的KV条目数1024。
HCA压缩率为128。CSA和HCA的查询头数均为128,头维度512,查询压缩维度1536。
输出投影组数16,每个中间注意力输出维度1024。滑动窗口分支的窗口大小128。
所有Transformer块采用MoE层,但前3个MoE层使用Hash路由策略。
每个MoE层包含1个共享专家和384个路由专家,每个专家的中间隐藏维度3072,每个token激活6个路由专家。
多token预测深度为1。mHC扩展因子为4,迭代次数20。
该配置下,DeepSeek-V4-Pro总参数1.6T,每个token激活49B。
训练细节
大部分参数采用Muon优化器,嵌入层、预测头和所有归一化模块权重使用AdamW。
DeepSeek-V4-Flash在32万亿token上训练,DeepSeek-V4-Pro在33万亿token上训练。
采用批次大小调度策略,从小批次逐步增加到最大值。
学习率在前2000步线性预热,大部分训练期间保持峰值,训练接近结束时按余弦调度衰减到最终值。
训练从4K序列长度开始,逐步扩展到16K、64K和1M。
关于稀疏注意力设置,首先用密集注意力预热模型1万亿token,在64K序列长度时引入稀疏注意力并在剩余训练中保持。
引入注意力稀疏性时,先设置短阶段预热索引器,然后在大部分训练中使用稀疏注意力。
缓解训练不稳定性
训练万亿参数MoE模型面临显著的稳定性挑战。
经验表明,尖峰的发生始终与MoE层中的异常值有关,路由机制本身似乎加剧了这些异常值的出现。
因此,从两个维度解决这个问题。
预期路由
发现解耦主干网络和路由网络的同步更新显著提高训练稳定性。
简单来说,就是用稍微旧一点的参数来决定路由,而不是用最新的参数。
实践中,提前获取数据,预先计算并缓存路由索引。
在基础设施层面进行了大量优化,将额外的时间开销限制在约20%。
引入自动检测机制,仅在发生损失尖峰时触发短暂回滚并激活预期路由;
在此模式下运行一定时间后,系统恢复到标准训练。
SwiGLU钳位
在实际训练运行中,经验发现对SwiGLU(一种激活函数)进行钳位(也就是限制数值范围)有效消除异常值并显著有助于稳定训练过程,且不损害模型性能。
在DeepSeek-V4-Flash和DeepSeek-V4-Pro的整个训练过程中,将SwiGLU的线性分量钳位到[-10, 10]范围,同时将门控分量的上限限制在10。
后训练流程
专家训练
领域专家的开发采用DeepSeek-V3.2训练流程,每个模型通过初始微调阶段和后续强化学习顺序优化。
强化学习阶段实施GRPO算法(一种组相对策略优化算法)。
推理努力模式
模型在推理任务上的性能根本上由消耗的计算努力决定。
在不同的强化学习配置下训练不同的专家模型,以促进针对不同推理能力优化的模型开发。
DeepSeek-V4-Pro和DeepSeek-V4-Flash都支持三种特定的推理努力模式:非思考模式(快速直觉响应)、高努力模式(有意识的逻辑分析)、最大努力模式(推理能力的极限探索)。
每种模式在强化学习训练期间应用不同的长度惩罚和上下文窗口,导致推理的输出token长度不同。
生成式奖励模型
对于难以验证的任务,传统上依赖从人类反馈中强化学习,需要大量人工标注来训练奖励模型。
在DeepSeek-V4系列的后训练阶段,不使用这些传统的奖励模型。
相反,整理了指导性强化学习数据并采用生成式奖励模型评估策略轨迹。
关键是直接对生成式奖励模型本身应用强化学习优化。
在这种范式中,模型本身就是奖励模型,实现模型的评估能力与其标准生成能力的联合优化。
通过统一这些角色,模型的内部推理能力固有地融入其评估过程,产生高度稳健的评分。
此外,这种方法仅需最少的多样化人工标注集即可实现优越性能。
工具调用架构和特殊token 与之前版本一致,使用专用的
在DeepSeek-V4系列中,引入了新的工具调用架构,采用特殊的"|DSML|"token并使用基于XML的格式进行工具调用。
实验表明,XML格式有效缓解转义失败并减少工具调用错误,为模型-工具交互提供更稳健的接口。
交错思考
DeepSeek-V3.2引入了上下文管理策略,在工具结果轮次中保留推理轨迹,但在新用户消息到达时丢弃。
虽然有效,但在复杂的智能体工作流中仍会造成不必要的token浪费。
利用DeepSeek-V4系列扩展的百万token上下文窗口,进一步完善这一机制。
在工具调用场景中,所有推理内容在整个对话中完全保留,与DeepSeek-V3.2不同,DeepSeek-V4系列在所有轮次中保留完整的推理历史,包括跨用户消息边界。
在一般对话场景中,保留原始策略,当新用户消息到达时丢弃先前轮次的推理内容。
快速指令
在聊天机器人场景中,许多辅助任务(例如确定是否触发网络搜索、意图识别等)必须在生成响应之前执行。
传统上,这些任务由单独的小模型处理,需要冗余的预填充。
为克服这一限制,引入快速指令,直接将一组专用特殊token附加到输入序列,每个token对应特定的辅助任务。
通过直接重用已计算的KV缓存,这种机制完全避免冗余预填充,并允许某些任务并行执行。
因此,这种方法显著降低用户感知的首token时间,并消除维护和迭代额外小模型的工程开销。
在策略蒸馏
通过专门的微调和强化学习训练多个领域特定专家后,采用多教师在策略蒸馏作为将专家能力合并到最终模型的主要技术。
在策略蒸馏(OPD)已成为一种有效的后训练范式,用于高效地将领域专家的知识和能力转移到单一统一模型。
这是通过让学生模型在其自己生成的轨迹上学习教师模型的输出分布来实现的。
底层逻辑确保统一策略选择性地从与当前任务上下文相关的专门专家学习,对于数学推理任务向数学专家学习,对于编程任务向编码专家学习。
通过这种机制,来自物理上不同的专家权重的知识通过logits级对齐(也就是在输出概率分布层面对齐)整合到统一的参数空间中,实际上规避了传统权重合并或混合强化学习技术中经常遇到的性能下降。
在这个阶段,采用十多个涵盖各个领域的教师模型来蒸馏单个学生模型。
在处理在策略蒸馏目标时,先前的工作通常将完整词汇表KL损失(一种衡量两个概率分布差异的指标)简化为每个token位置的token级估计。
虽然这种方法资源高效,但会导致梯度估计中的高方差,并经常引起训练不稳定性。
因此,在在策略蒸馏中采用完整词汇表logit蒸馏。
在计算损失时保留完整的logit分布,产生更稳定的梯度估计并确保教师知识的忠实蒸馏。
评估表现
知识与推理
在通用世界知识评估中,DeepSeek-V4-Pro-Max在开源模型中建立了新的技术水平。
在SimpleQA-Verified上,DeepSeek-V4-Pro-Max显著优于所有现有开源基线20个绝对百分点。
尽管有这些进展,它目前仍落后于领先的专有模型Gemini-3.1-Pro。
在教育知识和推理领域,DeepSeek-V4-Pro-Max在MMLU-Pro、GPQA和HLE基准测试中略微优于Kimi和GLM,
尽管它落后于领先的专有模型。
DeepSeek-V4-Pro-Max在推理基准测试中优于所有先前的开源模型,并在许多指标上与最先进的闭源模型相匹配,而较小的DeepSeek-V4-Flash-Max在代码和数学推理任务上也超越了之前最好的开源模型K2.6-Thinking。
DeepSeek-V4-Pro和DeepSeek-V4-Flash在编程竞赛中表现出色,性能与GPT-5.4相当,这是开源模型首次在此任务上匹配闭源模型。
在Codeforces排行榜上,DeepSeek-V4-Pro-Max目前在人类候选者中排名第23位。
DeepSeek-V4在智能体和计算密集型设置下的形式化数学任务上也表现出强大的性能。
在智能体设置下,它实现了最先进的结果,优于Seed Prover等先前模型。
通过更计算密集的流程,性能进一步提升,超越包括Aristotle在内的系统,并在此设置下匹配已知的最佳结果。
智能体能力
DeepSeek-V4系列在评估中展示了强大的智能体性能。
对于代码智能体任务,DeepSeek-V4-Pro实现了与K2.6和GLM-5.1相当的结果,尽管所有这些开源模型仍落后于闭源对应模型。
DeepSeek-V4-Flash在编码任务上表现不如DeepSeek-V4-Pro,特别是在Terminal Bench 2.0上。
在其他智能体评估中也观察到类似趋势。
值得注意的是,DeepSeek-V4-Pro在MCPAtlas和Toolathlon上表现良好,这两个评估测试集包括广泛的工具和MCP服务,表明模型具有出色的泛化能力。
百万级上下文
DeepSeek-V4-Pro在MRCR任务上优于Gemini-3.1-Pro,该任务衡量上下文内检索,但仍落后于Claude Opus 4.6。
检索性能在128K上下文窗口内保持高度稳定。虽然在128K标记之后性能下降变得明显,但模型在百万token时的检索能力与专有和开源对应模型相比仍然非常强大。
与MRCR不同,CorpusQA类似于真实场景,评估结果也表明DeepSeek-V4-Pro优于Gemini-3.1-Pro。
真实世界任务
中文写作
在功能性写作和创意写作上进行了严格评估。
与Gemini-3.1-Pro的配对比较显示,DeepSeek-V4-Pro在功能性写作任务上以62.7%对34.1%的总体胜率优于基线,这主要是因为Gemini偶尔允许其固有的风格偏好覆盖用户在中文写作场景中的明确要求。
在创意写作比较中,沿两个轴评估:指令遵循和写作质量。
与Gemini-3.1-Pro相比,DeepSeek-V4-Pro在指令遵循方面实现60.0%的胜率,在写作质量方面实现77.5%,展示了指令遵循方面的边际改进和写作质量方面的显著提升。
尽管DeepSeek-V4-Pro在总体用户案例分析中产生优越结果,但仅限于最具挑战性的提示的评估显示,Claude Opus 4.5保持了对DeepSeek-V4-Pro的性能优势,实现52.0%对45.9%的胜率。
搜索
搜索增强问答是DeepSeek聊天机器人的核心能力。
在DeepSeek网页和应用上,非思考模式采用检索增强搜索,而思考模式利用智能体搜索。
进行了配对评估,比较DeepSeek-V4-Pro和DeepSeek-V3.2在客观和主观问答类别上的表现。
DeepSeek-V4-Pro以显著优势优于DeepSeek-V3.2,在两个类别中都展示了一致的优势。
最显著的提升出现在单值搜索和规划策略任务中,表明DeepSeek-V4-Pro擅长定位精确的事实答案并从检索的上下文中合成结构化计划。
与标准检索增强搜索不同,智能体搜索使模型能够在每个查询中迭代调用搜索和获取工具,显著增强整体搜索性能。
智能体搜索始终优于检索增强搜索,特别是在复杂任务上。
此外,其成本保持高效,智能体搜索仅比标准检索增强搜索略贵。
白领任务
构建了一套全面的30个高级中文专业任务套件,这些工作流故意包含高级认知需求,包括深入的信息分析、全面的文档生成和细致的文档编辑,跨越13个关键行业的多样化范围。
评估在配备基本工具的内部智能体框架内进行。
进行人工评估以比较DeepSeek-V4-Pro-Max与Opus-4.6-Max的性能。
标注者盲评模型输出,跨四个维度:任务完成、指令遵循、内容质量和格式美学。
DeepSeek-V4-Pro-Max在多样化的中文白领任务上优于Opus-4.6-Max,实现了令人印象深刻的63%非失败率,并在分析、生成和编辑任务中展示了一致的优势。
详细的维度分数突出了模型在任务完成和内容质量方面的主要优势。
代码智能体
从真实的内部研发工作负载中整理任务,从50多名内部工程师那里收集约200个具有挑战性的任务,涵盖功能开发、错误修复、重构和诊断,跨越包括PyTorch、CUDA、Rust和C++在内的多样化技术栈。
每个任务都附有其原始存储库、相应的执行环境和人工标注的评分标准;经过严格的质量过滤后,保留30个任务作为评估集。
DeepSeek-V4-Pro显著优于Claude Sonnet 4.5,并接近Claude Opus 4.5的水平。
在询问DeepSeek开发人员和研究人员(85人,所有人都有在日常工作中使用DeepSeek-V4-Pro进行智能体编码的经验)DeepSeek-V4-Pro是否准备好作为他们与其他前沿模型相比的默认和主要编码模型时,52%的人说是,39%倾向于是,不到9%的人说不是。
受访者发现DeepSeek-V4-Pro在大多数任务上提供令人满意的结果,但注意到微小错误、对模糊提示的误解以及偶尔的过度思考。
写在最后
DeepSeek-V4系列通过架构创新实现了百万级上下文的高效支持,这不仅是技术突破,更是对未来大语言模型发展方向的探索。
混合注意力机制、流形约束超连接、Muon优化器,以及大量基础设施优化,共同构成了这个高效架构的基础。
从评估结果看,DeepSeek-V4-Pro-Max在开源模型中建立了新的技术水平,在推理、代码、长上下文等多个维度上接近甚至匹配前沿闭源模型。
DeepSeek-V4-Flash则在保持高性价比的同时,实现了与领先闭源模型相当的推理性能。
当然,架构的复杂性、训练稳定性的理论理解、以及在某些任务上与顶级闭源模型的差距,都是未来需要持续改进的方向。
但这次发布已经清楚地表明,开源模型在效率和能力上都在快速追赶,百万级上下文的时代已经到来。
© 2026
·
向阳乔木
📌 文中提及的人物和组织
公司/组织: deepseek
产品/模型: DeepSeek-V4, DeepSeek-V4-Pro, DeepSeek-V4-Flash