DeepSeek V4与GPT-5.5:中国AI短暂黄金时代的终结? FearNation 世界苦茶 2026-04-28

DeepSeek V4发布:表现平平与榜单解析

DeepSeek V4 终于发布了。此前,其发布日期一再推迟。在4月22日正式发布后,其效果却非常一般。我们可以参考一份全面的 Coding Benchmark 榜单,该榜单由拉西辆公布,并于4月24日,即DeepSeek V4发布后不久进行了测试。此次测试涵盖了包括 DeepSeek V4ChatGPT 新发布的 GPT-5.5、以及中国月之暗面发布的 Kimi 2.6 在内的多个模型。

该Benchmark包含一系列测试指标,在综合跑分中,共有6个模型达到了A档。其中,Claude Opus 4.7 位列榜首,其次是 Claude 5.4GPT 5.4GPT-5.5 排名第三。紧随其后的是月之暗面的 Kimi 2.6(第四名)、Claude Opus 4.6(第五名)和 Gemini 3.1(第六名)。令人意外的是,DeepSeek V3 排名第七,与 Claude Sonnet 4.6 持平。而智谱的 GLM-4 Pro 甚至不如 GLM-4 Flash,仅排第十名,且只达到B等级,表现糟糕。在所有中国模型中,唯一进入A等级的是月之暗面的 Kimi 2.6

在此次发布中,DeepSeek V3 并未像2025年年初 R1 发布时那样令人惊艳。2025年初 R1 发布时,其卓越的 Reasoning Model 能力获得了广泛认可,被认为与 GPT 体验相近,生成的文本质量极高。然而,对于此次 DeepSeek V4,许多用户可能会感到平淡,甚至不知所云。

中国AI的时代终结:从GPT-5.5谈起

我将用一个非常负面的词汇来形容此次 DeepSeek V4 的发布:这标志着中国AI模型一个时代的结束。

几乎同时,ChatGPT 发布了 GPT-5.5。尽管名称上只比 GPT-5.4 前进了一点点,但 GPT-5.5 实际上是一个全新的模型,即 ChatGPT 所谓的 Spot,一个全新预训练的 大模型(Large Language Model: 基于海量文本训练的AI系统)。大模型的预训练通常意味着从零开始或进行大规模的持续增量训练。

回顾 ChatGPT 的发展历程:

  • GPT-3:最初令人印象深刻。
  • ChatGPT:以对话式AI形式呈现。
  • GPT-4:实现了巨大飞跃,带来了完全不同的用户体验。
  • GPT-4.5:一次失败的预训练尝试,效果不佳,其API也很快退役。该版本代号为 Orion,当时 OpenAI 虽宣称其为“最大模型”,但用户普遍感受不到显著差异。
  • GPT-5:并非基础模型的重新训练,而是在 Reasoning Model 上的巨大飞跃,尤其是在 Mixture of Experts(MoE: 混合专家模型)方面。

因此,GPT-5.5 才是真正意义上重新预训练的成功,是 Spot 模型的首次大规模新预训练,并且是一次成功的预训练。为什么说它成功?尽管在刚才的榜单中,GPT-5.5 排名第三(GPT-5.4 排名第二),但其亮点在于显著降低了 Reasoning 所需的资源,同时实现了与 GPT-5.4 相当甚至更好的结果。之前,使用 GPT Pro 运行 GPT-5.4 的任务平均需要30分钟,而 GPT-5.5 则可缩短至六七分钟。这意味着 GPT-5.5 不仅能提供高质量结果,成本也远低于 GPT-5.4GPT-5.5 之所以不叫 GPT-6,是因为其基本参数并未大幅飞跃,但已在现有参数基础上实现了更优效果,堪称一次极为成功的迭代。需要指出的是,GPT-4o(Omni: 多模态、全能)才是真正的多模态模型,而非 GPT-4

AI发展三阶段论:中国AI红利期的兴衰

为了理解 GPT-5.5DeepSeek 的冲击,我将AI发展历程分为三个阶段。

AI发展第一阶段:规模效应主导(2020年-2024年上半年)

这一阶段从2020年 GPT-3 发布开始,历经 ChatGPT,直至划时代的 GPT-4。它证明了 Scaling Law(规模效应: 增加训练时间、扩大参数量即可大幅提升模型效率和结果)的有效性。只要投入更多算力、更多数据,就能显著提升模型表现。GPT-4 便是这一理论的明证。在此阶段,中国AI参与较少,直到 DeepSeek V3 于2024年末、R1 于2025年1月发布,中国模型才真正加入战场。

AI发展第二阶段:推理与Agentic范式(2024年三季度-2025年全年)

2024年三季度至2025年全年是第二阶段,特点是预训练的 Scaling Crisis(规模化危机)。自2024年5月 GPT-4o 发布后,ChatGPT 在预训练方面似乎进入了一个问题时期,转向了 Agentic Reinforcement Learning(智能体强化学习)。例如,2024年9月推出的 ChatGPT o1 是第一个 Reasoning Model(推理模型),它在 GPT-4 的基础上实现了推理能力,其 Chain of Thought(思维链: 模型通过一系列中间步骤进行推理)能力令人惊艳。尽管其基础模型(Base Model)无大进展,但展现了卓越效果。

GPT-4.5(2025年2月发布)的 Base Model 失败,其API在五个月后退役。从2024年9月起,Reasoning Model 成为主导。DeepSeek R1(2025年1月发布),其名称中的“R”即代表 Reasoning,是中国模型在2025年大爆发的代表。许多耳熟能详的中国大模型如 通义千问Kimi智源 等,在2025年纷纷涌现并取得了优异成绩,它们大多是 Reasoning Model

Reasoning Model 成功的一个关键原因是其高度可 蒸馏(Distillation: 将大型复杂模型的知识转移到小型模型中)。这意味着即使基础模型(如 DeepSeek V3)表现较差且存在严重幻觉问题,通过结合优秀的思维链,也能产出好的结果。这种思维链是纯文本,可以通过大规模拷贝并作为奖励模型(Reward Model)进行训练,使其变得与源模型类似。例如,开源社区中,用 通义千问 蒸馏 Claude 的思维链已能取得良好效果。

因此,第二阶段对于中国模型而言是一个红利期:

  1. 技术路线红利:即便基础模型稍逊,结合优秀的 Reasoning 也能产出好结果。
  2. 实现红利:思维链可大规模拷贝进行蒸馏。

这使得中国模型在2025年百花齐放,取得显著成就。

从2025年下半年开始,Agentic(智能体: 能自主规划、执行复杂任务的AI系统)范式兴起,如 Claude Code 普及并成为强大的编程智能体。AgenticReasoning 的最大区别在于,Agentic 不仅依赖 prompt(提示: 引导模型行为的输入文本)和思维链,还依赖于一个 Harness(外部辅助系统: 围绕基础模型提供外部工具、文档、程序等支持)。AnthropicHarness 称为 Claude Code,而 OpenAI 的则为 Codex

Agentic Model 同样可以蒸馏,但比 Reasoning Model 难度更大,因为并非所有数据都可直接获取。然而,2026年 Claude Code 源代码的意外泄漏,为中国企业提供了学习和模仿的机会。即使在此之前,许多中国企业也已通过各种方式蒸馏 Agentic Model。目前,许多中国企业发布的是针对 Agentic Model 优化的模型,例如 Kimi 2.6智源 的模型。

AI发展第三阶段:预训练规模效应重获主导(2026年至今)

进入2026年,预训练的 Scaling Law 重新被证明有效。两个关键事件是 ChatGPT 5.5 的发布和 Anthropic Mysus(代号“水豚”)的出现。GPT-5.5 证明了 OpenAI 成功进行了新的预训练。Anthropic 则从 Claude 3(2024年3月)到 Claude 4(2025年5月),再到 Mysus(2026年4月),几乎每12个月推出一个新模型,其预训练过程非常顺利,甚至在某些方面超越了 OpenAIGPT-5.5Anthropic Mysus 的成功共同证明了 Scaling Law 仍然有效,且预训练是最根本的。

这对于中国AI而言是个不利消息。第二阶段的成功依赖于“稍弱的基础模型 + Reasoning”或“稍弱的基础模型 + Agentic”来取得良好效果。然而,第三阶段又回到了最开始,即一个强大的 Base Model 自身就具备强大的泛化和衍生能力,不再过度依赖 ReasoningAgentic 层。虽然 Agentic 部分已融入训练过程,但一个卓越的 Base Model 结合 ReasoningAgentic 将更强大。

这种趋势对中国企业不利,因为预训练需要极大的算力(Compute Power)和海量的模型参数(Parameters),而中国在这些方面并不处于领先地位。例如,中国尚未能大规模采购 H200 显卡。尽管中国公司可以通过各种途径获取先进的 Nvidia 显卡进行训练,但平滑、高效的算力堆叠仍不如 AnthropicChatGPT 顺畅。

从2026年开始,以 GPT-5.5Mistral 为代表,预训练的 Scaling Law 重新运作。这意味着中国不能再依靠较弱的 Base Model 取得好效果。例如,DeepSeek V2 仍然存在严重的幻觉问题,其表现甚至不如半年前的 ClaudeChatGPT 版本。2025年中国与国际模型的距离曾一度拉近,但随着对 Base Model 竞争的回归,这一差距可能会逐渐拉大。

ClaudeOpenAI 在2026年选择了相同的路径:削减不必要的消费级应用扩展,全力保障企业研究和 Base Model 的发展。他们认为,在当前阶段,过度投入消费级应用价值不大。虽然 OpenAI 发布了新的图片模型,但其原理与文本模型相似(图片生成下一个像素,文本生成下一个词元),都属于 Base Model 的范畴。相比之下,字节跳动的 Seaweed 等模型,若要从图像或文本转换为视频,则并非典型的 Transformer 模式,其中包含大量为消费级优化进行的 Fine-tune

目前,最新的战场是如何通过 Scaling Law 堆叠出强大的 Base Model。将大量资源投入消费级应用而导致 Base Model 落后,实属不智。中国企业如字节跳动的 豆包Seaweed 在消费级应用上表现出色,拥有庞大的用户基础。但如果 AI 的能力边界远未触达,过早专注于消费级应用可能会局限于市场需求,而无法成为推动 AI 发展最远的公司,也不是中国当前发展 AI 能力最需要的方向。

总结:Base Model差距与中国AI的抉择

AI 的三个阶段:

  1. 2020年-2024年上半年GPT-3GPT-4 阶段,由预训练的 Scaling Law 主导。
  2. 2024年三季度-2025年全年OpenAI 预训练遭遇挫折,Scaling Law 受质疑,Reasoning Model 兴起,是中国AI的红利期。
  3. 2026年至今:预训练的 Scaling Law 重新被关注并取得良好效果,同时 Agentic 范式并行发展。

尽管 Agentic Model 仍可蒸馏,但难度更高。未来最大的差距将在 Base Model 层面拉开。2025年,除 Claude 以外,Base Model 的差距并未显著扩大,但从现在起,这一差距可能将加速拉大。

中国公司目前有多条路径:

  • 通义千问 等已实现了不错的 多模态 Base Model
  • DeepSeek 拥有不错的 Base Model,但尚未实现多模态。
  • 一些公司专注于 Agentic Model,如 Kimi 2.6智谱GLM5

Agentic Model 确实具有商业化潜力,尤其在 Coding 等可程序化验证的任务中,易于通过后训练(Post Training)将一个普通 Base Model 优化为 Agentic Model。这是一种训练捷径,能帮助企业在特定应用上取得不错表现。但这条“狭窄路径”(Narrow Path)无法产生泛化的新能力,也无法实现迁移能力。

DeepSeek 此次发布仍强调其节省算力的优势,表明其在“便宜”市场定位。然而,AI的核心市场如信息安全、科学研究、企业大型项目编程等都是高利润领域,这些领域会选择最好的模型,而非仅仅最便宜的。这意味着小型模型或成本导向模型的边际效益将非常弱。

对于中国的开源模型而言,挑战巨大。 阿里 最新版 通义千问 3.6 已转为闭源,因为开源模式难以盈利。OpenAIAnthropic 每年收入数百亿美元,而中国企业仅数千万至数亿美元。若持续开源,缺乏收入将限制算力投入和新模型训练能力;若转为闭源,则失去开源优势,且与顶尖模型仍存在差距。这使得中国企业面临艰难的抉择。

总而言之,第三阶段对 Base Model 的重新投入,对算力和参数不具备优势的中国企业不利。我提出的“三阶段论”——第一阶段为 Pre-Train 验证期,第二阶段为 Reasoning 红利期,第三阶段为 Pre-TrainAgentic 期——说明了中国AI通过“较弱 Base Model + Reasoning + 蒸馏”快速追赶的黄金时代已结束。Base Model 差距的扩大以及 Agentic 蒸馏难度的增加将成为巨大障碍。随着算力等问题,中美AI差距可能进一步拉大。

关键字: scaling-law pretraining reasoning-model agentic-ai model-distillation