DeepSeek-V4预览版技术深度解析:百万上下文、效率革新与Agent能力飞跃 Best Partners TV 2026-04-25

4月24日,DeepSeek终于发布并且开源了V4预览版。大家最想知道两件事:DeepSeek模型的性能是否还在第一梯队,以及它这次又拿出了什么新的东西。今天,我们将解读V4预览版的官方技术报告。

DeepSeek-V4:定位与核心模型

在报告的开篇,DeepSeek非常坦诚地写明,本次发布的是预览版本。模型的发展轨迹仍然滞后于GPT-5.4Gemini-3.1-Pro这类前沿闭源模型大约3到6个月。V4系列的核心使命不是为了当下就实现对闭源模型的全面反超,而是要彻底重构超长上下文场景的计算效率,为下一代大模型的测试时扩展(test-time scaling)、长程任务、甚至是在线学习等新范式打下坚实的基础设施底座。理解了这个定位,我们再看后面所有的技术设计就会非常清晰。

DeepSeek-V4系列包含两款核心模型,都采用了混合专家模型(MoE: Mixture-of-Experts)架构,这也是当前万亿参数大模型为了实现规模与效率平衡所采用的主流方案。

DeepSeek-V4-Pro定位旗舰性能,总参数规模达到1.6T,单token推理的激活参数为49B。 DeepSeek-V4-Flash定位极致高效,总参数284B,单token激活参数只有13B。 更重要的是,这两款模型都原生支持100万token上下文,这在开源大模型领域也是一个前所未有的突破。

极致效率飞跃:百万上下文与成本优化

上下文拉到了100万token,参数规模也上去了,推理成本会不会高到用不起呢?恰恰相反,在报告里,DeepSeek给出了明确的效率数据。

100万token上下文的设置下:

  • DeepSeek-V4-Pro的单token推理FLOPs(Floating Point Operations Per Second)只有上一代DeepSeek-V3.2的27%,KV Cache(Key-Value Cache)的占用更是只有10%。
  • DeepSeek-V4-Flash的优化更加极致,单token推理FLOPs压低到了V3.2的10%,KV Cache占用仅7%。

简单来说,上下文长度从V3.2的128K扩展到V4的1M,长度放大了接近8倍,但是单token的算力需求反而大幅下降。这意味着以前企业不敢尝试的大量超长上下文场景,现在不仅能够做到,而且成本低到了可以大规模商用。这才是V4系列最核心的价值。

能实现这样的效率飞跃,核心原因就是DeepSeek-V4Transformer架构的三大核心模块完成了前所未有的同步革新。在这之前,DeepSeekV2V3系列核心创新都集中在MoE专家路由的参数稀疏化上。而这一次,DeepSeek第一次把“稀疏化”的刀动到了Transformer最核心的注意力机制、残差连接以及优化器这三大模块上,实现了从参数稀疏到上下文稀疏的全维度效率优化。

架构革新一:混合注意力机制

最核心的混合注意力架构V4系列能实现百万上下文低成本推理的根本。Transformer架构的核心是自注意力机制,但它有一个天生的缺陷:自注意力的计算复杂度会随着上下文长度的增加呈平方级增加,这也是超长上下文一直无法落地的最大拦路虎。

DeepSeek-V4没有在传统注意力上做缝缝补补,而是直接设计了一套全新的混合注意力架构,用压缩稀疏注意力(CSA: Compressed Sparse Attention)和重压缩注意力(HCA: Highly Compressed Attention)两种机制交替叠用,再搭配滑动窗口分支,打出了一套“粗粒度+细粒度,稀疏+稠密”的组合拳,从根源上降低了长上下文的计算量。

压缩稀疏注意力(CSA)的核心逻辑可以概括成“先压缩,再挑着看”。传统注意力机制里每个token都要和前面所有的token计算相似度,而CSA首先会把每4个tokenKV缓存合并成一条摘要信息,先把需要处理的信息总量压缩到原来的四分之一。然后,它会设计一个闪电索引器,让每个查询(query)只在这些压缩后的摘要里挑选出最相关的top-k条,再进行注意力计算。这样既减少了需要处理的信息总量,又只聚焦和当前内容最相关的高价值信息,避免了无效的算力浪费。

重压缩注意力(HCA)的压缩策略更加激进,直接把每128个token合并成一条摘要,实现了更高倍率的信息压缩。和CSA不同的是,HCA在压缩完成后不会做稀疏挑选,而是对所有压缩后的摘要做稠密注意力计算,保证超长文本里的长程依赖不会丢失。

DeepSeek把这两种注意力机制交替叠加在Transformer层里,再额外增加一个滑动窗口注意力分支,专门处理近距离token之间的细节依赖,既保证了百万上下文的全局理解能力,又把计算量和显存占用压到了极致。

架构革新二:流形约束超连接(mHC)

DeepSeek-V4的第二大核心创新是用流形约束超连接(mHC: manifold-constrained HyperConnect)升级了Transformer里沿用了近十年的传统残差连接。传统残差连接的作用是解决深层网络训练时的梯度消失问题,但是随着模型层数越来越深、参数规模越来越大,传统残差连接很容易出现数值不稳定的问题,甚至会导致训练崩溃。

mHC的核心创新就是把残差映射矩阵约束到双随机矩阵的流形上,让映射矩阵的谱范数不超过1,保证了前向传播和反向传播过程中信号的传递始终是非扩张的,从数学根源上提升了深层网络的训练稳定性。同时,mHC还把残差流的宽度和模型的隐藏层维度解耦,用极小的计算开销提供了一个全新的模型扩展维度,在不增加核心计算量的前提下提升了模型的表达能力。

架构革新三:Muon优化器

第三大核心创新是DeepSeek-V4Muon优化器替代了当前大模型训练里主流的AdamW优化器Muon优化器是由杰弗里·乔丹(Jeffrey Jordan)等人在2024年提出的新型优化器,它的核心优势是在深层神经网络的训练中收敛速度更快,训练稳定性更强,尤其适合万亿参数大模型的大规模训练。

DeepSeek-V4的训练中,嵌入层、预测头、归一化层等模块仍然沿用了AdamW优化器,而其他核心模块全部采用了Muon优化器DeepSeek还对Muon优化器做了针对性优化,设计了混合牛顿-舒尔茨迭代算法,分两个阶段完成正交化:前8步快速收敛,后2步精准稳定,既保证了优化效率又提升了数值稳定性。这也是DeepSeek首次同时对Transformer的注意力、残差连接、优化器三大核心结构完成同步改造。

全栈工程优化:保障先进架构落地

先进的架构设计需要强大的工程基础设施才能真正落地。DeepSeek-V4的技术报告里详细介绍了支撑这套新架构的全栈工程优化

专家并行(EP: Expert Parallelism)的细粒度优化MoE模型的训练和推理核心瓶颈之一就是专家并行带来的跨节点通信延迟。传统方案里通信和计算是串行执行的,通信延迟会严重拖累整体效率。而DeepSeek设计了一套细粒度的专家并行方案,把专家拆分成多个波次,形成了计算、通信、内存访问完全重叠的流水线内核,把通信延迟完全隐藏在计算过程中。这套方案在英伟达GPU华为昇腾NPU两个平台上都完成了验证。相比传统非融合方案,通用推理场景能实现1.5到1.73倍的速度提升,延迟敏感的强化学习采样场景最高能达到1.96倍的加速。

基于TileLang的内核开发和批量不变的确定性内核库DeepSeek-V4的新架构会产生上百个细粒度的算子。如果用传统方式开发,不仅效率低,性能也很难优化到极致。因此,DeepSeek采用了TileLang这门领域专用语言(DSL: Domain Specific Language)快速开发融合内核,替代了绝大多数原生算子,在保证开发效率的同时实现了极致的运行时性能。为了保证预训练、后训练、推理三个环节的输出完全一致,DeepSeek还开发了端到端、按位一致的批量不变确定性内核库,解决了传统算子在不同批次、不同硬件环境下输出不一致的问题。这对于万亿参数模型的训练稳定性和可复现性至关重要。

FP4量化感知训练和配套的训练及推理框架优化:为了进一步降低显存占用和计算量,DeepSeek-V4MoE专家权重CSA索引器QK路径都采用了FP4(MXFP4)量化,并且设计了无损的FP4FP8反量化流程,完全复用现有的FP8混合精度训练框架,不需要对反向传播流程做任何修改。同时,DeepSeek还对训练框架做了针对性优化,适配了Muon优化器mHC结构混合注意力机制,设计了两阶段上下文并行策略,解决了超长上下文训练的并行难题。在推理框架层面,专门为混合注意力设计了异构KV缓存结构和磁盘KV缓存存储方案,完美解决了百万上下文场景下共享前缀的缓存复用问题,进一步降低了高频调用场景的推理成本。

训练范式革新:“分化再统一”的两步走策略

DeepSeek-V4在训练范式上也进行了革新。上一代的DeepSeek-V3.2后训练阶段采用的是混合强化学习(RL: Reinforcement Learning)方案,即用一个强化学习过程同时优化数学、代码、对话、指令跟随等多个目标。但这种方案的缺陷是不同能力之间会互相干扰,比如提升编程能力可能导致对话能力下降。

DeepSeek-V4彻底抛弃了这种传统方案,采用了一套“分化再统一”的两步走后训练范式,从根源上解决了这个问题。

第一步:领域专家的专项训练。针对数学、代码、Agent、指令跟随等不同的核心领域,DeepSeek分别训练了独立的专家模型。每个专家模型都会先用对应领域的高质量数据做监督微调,打下坚实的领域基础,再用GRPO算法做强化学习,针对领域专属的奖励模型做优化,确保每个专家模型都能在自己的细分赛道里跑到能力的最优水平。

同时,DeepSeek还针对不同的推理强度训练了不同配置的专家模型,最终形成了Non-thinkThink HighThink Max三档推理模式。用户可以根据任务的复杂度灵活选择对应的模式。其中Think Max模式会在系统提示词里注入强指令,把上下文长度和推理深度拉满,全力释放模型的能力上限。代价是输出的token数量会翻倍,更适合科研、复杂推理这类对精度要求极高的场景。

第二步:On-Policy蒸馏(OPD: On-Policy Distillation)。将十多个不同领域的专家模型融合成一个统一的模型。简单来说,就是让最终的统一模型作为学生,自主生成回答,然后针对每个回答去匹配最擅长这个问题的专家模型的输出分布,在logit层级完成对齐,把各个专家的核心能力全部吸收到统一模型里。

这套方案的工程难度极高,因为同时加载十多个万亿参数级的教师模型做在线推理是完全不现实的。DeepSeek的解决方案是把所有教师模型的权重全部卸载到分布式存储里,只缓存每个教师模型最后一层的隐藏状态。训练时按照教师索引对样本排序,保证任意时刻GPU显存里只驻留一个教师模型的预测头。这样既保留了各个领域专家的顶尖能力,又完全避免了传统混合强化学习的能力干扰问题,让模型的综合能力实现了均衡、全面的提升。

Agent能力专项优化与沙箱平台

在此过程中,DeepSeek还针对Agent的能力做了大量的专项优化,这也是V4系列面向企业落地的核心亮点。 首先,在后训练阶段,DeepSeekAgent作为和数学、代码并列的独立专家方向,单独完成了专项训练,而不是作为附加能力做优化。 其次,把工具调用的格式从传统的JSON结构换成了带特殊tokenXML格式,有效降低了转义错误,提升了工具调用的稳定性。 同时,优化了推理轨迹的管理机制。在工具调用场景下,跨轮次的推理轨迹会完整保留,不会像V3.2那样每一轮新的用户对话就清空之前的推理内容,让长程Agent任务不会出现“失忆”的问题。 最后,DeepSeek还自研了一套名为DSec的沙箱平台。整套平台用Rust语言开发,单集群可以并发管理数十万个沙箱实例,为Agent的强化学习训练和评测提供了安全、高效、隔离的运行环境。

DeepSeek-V4性能评测:全面领先

讲完了所有技术设计,我们来看性能评测结果。

世界知识与通用推理能力:在MMLU-ProGPQA DiamondSimpleQA Verified等权威知识测评中,DeepSeek-V4-Pro-Max大幅领先所有开源模型,仅略逊于Gemini-3.1-Pro,重新定义了开源模型的知识能力上限。V4-Pro-MaxApex Shortlist榜单上达到90.2%的通过率,直接登顶。在IMOAnswerBenchHMMT等数学竞赛榜单上也达到了比肩前沿闭源模型的水平。

代码与数学能力:这是DeepSeek系列一直以来的优势领域。在Codeforces编程竞赛测评中,V4-Pro-Max达到了3206的Elo评级,在所有参赛的人类选手中排名第23位,这也是开源模型第一次在这项硬核测评中达到和GPT-5.4相当的水平。在LiveCodeBench榜单上,V4-Pro-Max的通过率达到93.5%,超过了Gemini-3.1-Pro的91.7%。在正式数学推理任务中,V4-Pro在混合形式化-非形式化推理的设置下,实现了Putnam-2025竞赛题120分的满分证明,达到了当前已知的最优水平。

百万token长上下文能力:这是V4系列的核心亮点。在OpenAI发布的MRCR长上下文检索测评中,V4-Pro-Max100万token上下文设置下平均MMR达到83.5,超过了Gemini-3.1-Pro的76.3,仅次于Claude Opus 4.6的92.9。在更贴近真实场景的CorpusQA测评中,V4-Pro-Max的准确率达到62.0%,同样超过了Gemini-3.1-Pro的53.8%。测试结果显示,V4系列在128K上下文以内检索能力几乎没有衰减,哪怕到了100万token的极限长度,仍然保持了极强的上下文理解和检索能力,这在开源模型里是绝无仅有的。

Agent能力:在SWE Verified代码Agent测评中,V4-Pro-MaxClaudeGPTGemini等头部模型打成平手,均达到80.6%的解决率。在Terminal Bench 2.0终端操作测评中,V4-Pro-Max达到了67.9%的准确率,低于Gemini-3.1-Pro的68.5%和GPT-5.4的75.1%。在Toolathlon工具调用测评中,V4-Pro-Max达到了51.8%的通过率,超过了所有对比的开源和闭源模型。在内部的研发代码Agent测试中,V4-Pro-Max的任务通过率达到67%,优于Claude Sonnet 4.5的47%,非常接近Claude Opus 4.5的70%,但是落后于Opus 4.6思考模式的80%。

真实场景的人工评测:这是最能反映用户实际体验的部分。

  • 中文功能性写作测评中,V4-ProGemini-3.1-Pro的对比中整体胜率达到62.7%,在邮件、报告、技术文档等场景优势尤为明显。
  • 中文创意写作测评中,V4-Pro在指令遵循上的胜率为60.0%,在写作质量上的胜率高达77.5%,全面领先Gemini-3.1-Pro
  • 在面向企业场景的白领任务测评中,V4-Pro-MaxClaude Opus 4.6-Max的盲测对比中实现了63%的非损失率,在任务完成度、内容质量两个维度甚至超过了Opus 4.6-Max,仅在指令遵循和格式美观度上还有一定的差距。
  • 搜索增强问答场景中,V4-ProAgent搜索模式相比传统检索增强生成(RAG: Retrieval-Augmented Generation)模式整体胜率达到61.7%,而成本仅略有上升,实现了效果和成本的完美平衡。

局限性与未来展望

在报告的最后,DeepSeek也非常坦诚地公布了V4系列的局限性和未来的迭代方向。他们表示,为了实现极致的长上下文效率,V4系列采用了相对复杂的架构设计,未来会进一步精简架构,在不损失性能的前提下,让架构更加简洁优雅。同时,虽然采用预路由和SwiGLU Clamping技术解决了训练稳定性的问题,但是背后的底层理论原理还需要进一步的研究。

未来,DeepSeek还会在嵌入层稀疏化、低延迟架构、长程Agent任务、多模态能力等方向继续迭代优化,不断缩小和前沿闭源模型的差距。

回顾整个报告,最让人印象深刻的不是1.6万亿的参数规模,也不是百万token的上下文长度,而是DeepSeek的坦诚和务实。它没有用夸张的宣传话术去炒作如何超越GPT,反而明确承认了和前沿闭源模型的差距。它也没有去卷榜单分数,而是把所有的技术重心都放在了如何让超长上下文真正落地这个核心问题上,从底层架构、训练范式到工程设施,完成了全链路的革新。

对于开源大模型行业来说,DeepSeek-V4的意义绝不仅仅是又一个高分模型的发布。它用一套完整的技术方案证明了开源模型不仅能在能力上逼近闭源模型,更能在效率、成本、工程落地上走出一条属于自己的路。它不仅为百万上下文时代打下了坚实的基础设施底座,也让所有的开发者和企业都能以极低的成本用上百万上下文的大模型能力,这对于整个AI行业的普惠化有着不可忽视的意义。