AI编码模型新格局:GPT-5.5、Opus 4.7与DeepSeek V4实测深度对比 Best Partners TV 2026-05-01

大家好,这里是最佳拍档,我是大飞。从今年2月5日 Claude Code 迎来拐点之后,整个 AI编码模型 市场就好像被按下了加速键一样,几乎每周都有大厂或顶尖实验室发布全新的编码专用模型。一连串的模型名字,如 Claude OpusMythosOpenAI CodexGoogle GeminiDeepSeekKimiQwenGLMMiniMaxComposerMuse Spark,让人眼花缭乱,很多人根本分不清这些模型到底谁强谁弱,官方发布的基准测试分数到底能不能信,自己的日常开发到底该选哪一款工具。

就在25日,SemiAnalysis 的几位资深分析师在过去几个月里亲手实测了所有主流头部模型,不仅拿到了 GPT-5.5 的阿尔法测试资格,还深度对比了 Opus 4.7DeepSeek V4 的真实表现,发表了一份长达万字的实测报告。同时,他们还将行业里基准测试的猫腻、模型的定价逻辑以及市场的竞争格局分析得一清二楚。今天,我们就来给大家分享一下,看看智能编码助手的未来方向在哪里。

智能编码市场核心结论

我们先来给出报告的核心结论:在 GPT-5.5 发布之后,OpenAI 终于重新回到了 AI编码领域 的前沿梯队;而 Anthropic 凭借 Claude Opus 系列,依然牢牢占据市场的主导地位。开源阵营的 DeepSeek V4 虽然技术亮眼,但是已经难以撼动闭源大厂的优势。更重要的是,所有厂商吹嘘的基准测试分数,正在彻底失去参考价值。按任务计费的成本效率(Cost Efficiency per Task: 完成特定任务所需的总投入),才是衡量编码模型的真正核心指标。

接下来,我们来逐个拆解一下三款最具代表性的模型。

OpenAI GPT-5.5:重回前沿的颠覆者

首先登场的,是本次测评中最具颠覆性的产品:OpenAIGPT-5.5。这款模型是 OpenAI 基于代号为 Spud 的全新预训练框架,推出的首个公开发布版本,也是 OpenAI 自失败的 GPT-4.5 之后,第一次真正意义上的预训练规模升级。

GPT-5.5 发布之前,从去年11月 Opus 4.5 推出后的半年时间里,OpenAI 的编码模型在绝大多数核心指标上都算不上全球顶尖。当时 SemiAnalysis 团队的日常开发工具清一色都是 Claude Opus。而现在,GPT-5.5 已经全面融入了他们的日常工作流,甚至在部分任务上的表现已经实质性超越了市面上所有其他模型。

分析师团队首先纠正了一个外界广泛传播的错误信息:英伟达OpenAI 都曾用精准的表述宣称 GPT-5.5 是在10万颗 GB200 NVL72 集群上完成训练的,但是这个所谓的“训练”仅仅是后训练阶段的强化学习(RL阶段),模型在预训练核心阶段从未达到过这个规模。这只是 OpenAI 在宣传上的文字游戏,大家要擦亮眼睛。

再看大家最关心的定价。OpenAI 的模型历来比 Anthropic 更加亲民,但 GPT-5.5 打破了这个惯例。它的 API 定价为每百万输入 token 5美元,每百万输出 token 30美元。这个价格是 GPT-5.4 的两倍,甚至比 AnthropicOpus 4.7 还要略高一点。

GPT-5.5 的服务模式与技术亮点

出于安全层面的考量,GPT-5.5 最初只开放了 ChatGPTCodex 的访问窗口,随后才正式上线 API 接口。SemiAnalysis 团队也是在阿尔法测试阶段,通过 Codex 和 API 完成了全方位的实测。除了标准版,OpenAI 还为 GPT-5.5 推出了专属的优先级服务,价格是标准版本的2.5倍。

这里要区分清楚 AI 厂商常用的两种加速服务:分别是快速模式(Fast Mode: 提供模糊的性能承诺,如高倍价格换取加速)和优先级服务(Priority Service: 提供保守且具体的服务等级协议,如99%时间内的最低输出速度)。目前 AnthropicOpenAI 都提供这两种服务,但是真正获得市场认可的,只有 Opus 4.6 的快速模式。

另外,OpenAI 还同步推出了 GPT-5.3-Codex-Spark 模型,这款模型是专门为 Cerebras 芯片设计的蒸馏版 GPT-5.3。还有面向科研场景的 GPT-5.5 Pro 版本,仅通过 ChatGPT 和 API 提供服务,主打科学研究和长程推理任务,而非日常的智能编码工作。这款模型在 BrowseCompFrontierMath 两大基准测试中拿下了当前最优成绩,定价和 GPT-5.4 Pro 保持一致,为每百万 token 30和180美元,未来大概率会在科学发现领域放出更多重磅成果。

GPT-5.5 的标准版和 Pro 版都提供了五档推理强度调节,从 xhigh、high、medium、low 到 non-reasoning,这是一种能力与成本的权衡。从 OpenAIo1 系列开始,高推理强度就意味着更好的输出效果,但是同时会消耗更多的 token、响应速度更慢,这也是所有 大模型(Large Language Model: 基于海量文本训练的 AI 系统)的通用规律。

GPT-5.5 最核心的技术亮点就是 token效率(Token Efficiency: 完成任务所需的token数量与效果的平衡)。OpenAI 在模型卡片中明确标注,它在基准测试分数高于 GPT-5.4 的同时,token 消耗量更低。这个点至关重要,也是 SemiAnalysis 团队反复强调的核心逻辑:衡量模型定价的核心指标已经不再是每 token 的价格了,而是完成单个任务的总成本。例如,Mythos 模型的单 token 价格是 Opus 的5倍,但是因为它完成任务需要的 token 更少,整体成本反而被抵消,甚至端到端响应速度更快。Token 效率 将成为2026年 AI模型 竞争的核心关键词。

Anthropic Claude Opus 4.7:小幅升级与成本隐忧

聊完了 OpenAIGPT-5.5,我们把目光转向它的头号对手 AnthropicClaude Opus 4.7Opus 系列一直是 SemiAnalysis 团队的主力开发工具。Opus 4.7 作为 Opus 4.6 的直接替代版本,整体属于小幅升级,在多项基准测试中分数有所提升,使用体验也保持了一贯的稳定,但是并没有带来颠覆性的技术突破。团队成员也是勉强接受了这款更新。

为什么说勉强呢?原因就是 Opus 4.7 至今没有推出快速模式。而工程师们已经愿意为了更快的速度牺牲一部分微不足道的质量。2.5倍速度、6倍价格的权衡能让开发者进入真正的心流状态,这是当前编码工具的核心需求之一。

Opus 4.6 升级到 4.7,用户能感知到的变化更多来自功能层面而非原始性能。现在的头部编码模型已经足够强大,日常开发任务都能完美完成。工程师们的吐槽点已经从功能测试是否通过,变成了代码风格、实现思路、架构设计和 token 效率,几乎不会再出现模型完全搞砸代码提交的情况。

Opus 4.7 的五大功能更新

具体来说,Opus 4.7 的核心功能更新有五个,每一个都直接影响使用体验和成本:

  • 新增了高分辨率图像支持:强化学习的训练目标也明显调整,模型可以直接通过截图完成前端样式的开发,不再需要通过无头浏览器或者 Playwright 等工具运行程序测试,前端开发的效率大幅提升。
  • 在推理强度层级中新增了 xhigh 的档位,介于 high 和 max 之间,让用户可以更精细地控制模型的推理耗时和能力输出。
  • 默认隐藏了思考过程 token:虽然用户依然需要为这部分 token 付费,但是必须主动开启才能查看。Anthropic 通过这种方式简化了输出界面,但是也增加了成本的不透明性。
  • 推出了测试阶段的任务预算功能(Task Budget: 用户为模型完成任务设定的效率阈值):仅支持 API 调用。用户可以给模型建议完成任务的效率阈值,如果预算限制过严,模型会选择简化步骤甚至拒绝执行。这和传统的最大输出 token 限制不同,后者是对输出长度的硬性约束,前者是对任务执行效率的柔性建议。
  • 最关键的变化是全新的分词器Anthropic 直接承认,新的分词器通过更细粒度的 token 计数提升了性能,但是也导致 token 使用量会最多增加35%。这相当于直接涨价35%,是所有用户都无法忽视的成本变化。

在模型行为上,Opus 4.7 默认减少了工具调用的次数,更依赖自身推理完成任务。SemiAnalysis 团队实测后并不认可这种调整,需要手动把推理强度从高调到 xhigh 或 max 才能让模型调用足够的工具,完成复杂任务的多步骤规划,这和官方宣传的 token 效率优化完全相悖。

这里还有个事件:在 Opus 4.7 发布前,大量用户指责 Anthropic 故意降低 Opus 4.6 的性能。Anthropic 对此坚决否认,但是 SemiAnalysis 的多位工程师都明确表示 4.6 的性能在那段时间出现了明显异常。直到4月23日,也就是 Opus 4.7 发布一周后,Anthropic 发布了事后分析报告,承认在3月到4月期间出现了三个影响所有 Claude Code 用户的 bug。这些 bug 潜伏了几周才被发现,这也印证了工程师们的直观感受。这三个 bug 的时间窗口分别是3月4日至4月7日、3月26日至4月10日、4月16日至4月20日。作为一款主打编码的 AI工具,如此长时间的 bug 未被修复,也侧面暴露了闭源模型的潜在风险。

开源阵营DeepSeek V4:技术亮眼,差距犹存

接下来我们再来聊聊开源阵营的扛把子 DeepSeek V4DeepSeek 在去年凭借 R1 版本惊艳全球,也引发了行业对开源模型是否会让人工智能商品化的激烈讨论,甚至引发了 GPU 短缺的连锁反应。而这次发布的 V4 版本,分为 ProFlash 两个型号,虽然没有再次颠覆市场,但是技术实力依然不容小觑。

先看参数架构:DeepSeek V4 Pro 总参数1.6万亿,激活参数490亿;V4 Flash 总参数2840亿,激活参数130亿。对比上一代 V3 的6710亿总参数、370亿激活参数,Pro 版本实现了升级,Flash 版本则是轻量化降级。但是客观来说,无论是总参数还是激活参数,DeepSeek V4OpenAIAnthropic 的闭源前沿模型相比,依然存在明显的差距。

V4 相比 V3 最核心的突破是把上下文窗口从128k直接提升到100万 token。所有技术创新都围绕长上下文性能(Long Context Performance: 模型在处理长文本输入时的理解和生成能力)展开,包括压缩稀疏注意力 CSA(Compressed Sparse Attention)、重压缩注意力 HCA(Heavily Compressed Attention)、流形约束超连接 mHC(Manifold Constrained Hyperconnection)三项核心技术。

官方数据显示,在100万 token 上下文场景下,V4 Pro 的单 token 推理浮点运算量仅为 V3.2 的27%,KV缓存 占用仅为10%,90%的 KV缓存 reduction,甚至比谷歌之前发布的 TurboQuant 论文效果还要惊艳。这对存储行业的影响值得关注。

在基准测试方面,DeepSeek 认为传统基准无法衡量真实任务能力,因此自研了智能编码、中文写作、检索增强搜索、长周期白领任务等专属基准。V4 Pro 虽然在这些任务中能和头部模型抗衡,但是在核心领域依然落后。例如,在高难度中文写作任务中,Claude Opus 4.7 的表现依然优于 DeepSeek V4 Pro。这是一个很有意思的现象:海外模型在中文任务上反而超越了本土开源模型。

DeepSeek V4 的技术开源与推理性能

技术层面,DeepSeek V4 开源了模型权重和详细技术报告,还更新了 DeepEPDeepGEMMFlashMLA 等被全球实验室广泛使用的库。甚至在 DeepGEMM 中开源了支持 英伟达 GPU华为昇腾 NPU 的超级内核。虽然目前只公开了 NVIDIA HopperBlackwell 架构的代码,但是未来大概率会让大量推理任务运行在昇腾芯片上。

推理性能方面,SemiAnalysisInferenceX 团队联合 vLLMInferactNVIDIA 的工程师,在 H200 集群上实现了 V4 的首日支持。FP8精度 下,单 GPU 吞吐量约为每秒150个 token,交互速度为每秒20个 token。而 V3 的吞吐量为每秒1300到2300 token。作为一款全新模型,V4 还有很大的优化空间。

总结来看,DeepSeek V4 是一次极其出色的工程化发布,紧跟前沿水平,是闭源模型之外成本最低的选择。但是核心能力依然没有达到全球顶尖,SemiAnalysis 自己的核心工作流也不会被 DeepSeek 替代。开源和闭源的差距,正在重新拉大。

实测对比:Codex与Claude Code的用户体验

拆解完三款核心模型的技术细节,接下来进入最精彩的实测对比环节:GPT-5.5 对应的 CodexOpus 4.7 对应的 Claude Code,到底谁更好用呢?

SemiAnalysis 团队向来更推崇 Claude。在 GPT-5.5 阿尔法测试期间,他们把两款模型放在同一场景下极限对比,得出的结论非常客观:GPT-5.5Codex 插件场景下实现了显著提升。此前团队工程师全部使用 ClaudeChatGPT 编码只限于 Cursor 等工具。而现在,大部分工程师会根据任务类型和 IDE 偏好,在 CodexClaude 之间切换。

有工程师表示,Codex 最让人满意的点是在修改代码前会拉取大量上下文信息。不是简单的结构调整,而是需要深度思考的复杂修改。而 Opus 4.7 往往只是快速浏览代码后就直接修改,缺乏对细节上下文的挖掘。还有工程师明确自己会用 Codex 做代码审查、bug 排查、代码解释、文档创建与修改,它对代码结构的理解和推理能力更出色。

但是 GPT-5.5 的缺点也很明显:它对用户真实意图的推断能力不如 Claude Code。人类在给编码智能体发指令时往往简洁且不严谨,Codex 会过于字面化地执行指令,而 Claude 能更好地理解背后的真实需求。同时,GPT-5.5 在代码修改时过于保守,虽然提升了 token 的效率,但是牺牲了准确性,输出中出现“narrow fix”时必须人工二次检查。

团队还做了一个极端测试:让 Opus 4.6GPT-5.5 分别基于现有 token 经济学仪表板创建新的加速器模型仪表板。结果 Opus 4.6 完美复刻了包含所有标签页链接的主页,而 Codex 则完全忽略了主页设计,除非在提示词中明确要求复制主页,否则无法自主推断这个需求。但是在仪表板的数据准确性上,Codex 远优于 ClaudeClaude 甚至出现了在 TPU 图表中加入 NVIDIA GPU 的幻觉问题。这说明 Codex 更擅长复杂数据结构的推理(Complex Data Structure Reasoning: 理解和处理复杂数据关系的能力)和窄范围高难度任务(Narrow-Scope High-Difficulty Tasks: 针对特定领域内复杂问题的解决)。Claude 更擅长开放式、从零到一的全新项目开发(Open-Ended, Green-Field Development: 从概念开始构建全新项目)。

基于这个结论,工程师们形成了全新的工作流:先用 Claude 完成新应用、新功能的初始规划和框架搭建,完成第一个版本的原型开发;再切换到 Codex 解决具体问题、修复 bug。而在 GPT-5.5 发布之前,团队全程都使用 Claude 完成这两个步骤。

除此之外,OpenAI 还有一个致命的短板,那就是插件和命令行工具的功能落后。工程师们普遍需要100万上下文的快速模式、远程控制、沙盒插件,实现电脑和手机的跨设备会话。这些功能 Claude Code 的命令行、VSCode 插件、网页端、移动端全部支持,而 Codex 的所有端侧工具都不具备这些能力。即便 GPT-5.5 模型本身足够优秀,OpenAI 也需要加快功能迭代才能追上 Anthropic 的生态优势。

戳破AI基准测试的泡沫:价值与陷阱

聊完模型的真实体验,我们再来戳破整个 AI 行业最大的泡沫——基准测试(Benchmark Test: 衡量模型性能的标准测试集)。几乎每一款新模型发布,厂商都会贴出一张满是高分的基准测试对比表,用看似客观的数字证明自己的模型全球第一。但是 SemiAnalysis 团队明确指出,基准测试已经无法代表模型的真实实用价值了。虽然所有厂商依然会乐此不疲地宣传,但我们要做的就是学会从数字中筛选有效信息,避开所有陷阱。

一个完整的基准测试由三个部分组成:

  • 任务:模型要完成的具体操作。
  • 评估方式:模型的打分标准。
  • 工具套件:模型完成任务的工具、指令、交互界面。

只有理解前两个要素,才能判断基准测试是否有价值。

我们先看最经典的通用基准测试:2020年发布的 MMLU(Massive Multitask Language Understanding: 大规模多任务语言理解测试),包含57个学科、15908道多选题,是早期 AI模型 的核心测试标准。其 harness(测试框架)极简,不支持网页搜索等工具,评分只需要看选项是否正确。2023年 GPT-4 就达到了86.4%的正确率,基本饱和,而且研究显示 MMLU 中有6.49%的题目本身存在错误。后续的 GSM8KHellaSwagMMMUGPQA 等基准也都面临同样的问题。厂商只能通过筛选难题、增加选项、提高难度,推出 MMLU-ProMMMU-Pro 等升级版维持测试价值。

2025年1月 Scale AI 发布的人类终极考试 HLE,邀请全球1000多位专家创建2500道题,80%是精准短答案,20%是多选题,支持网页搜索、代码执行工具。但是问题也很明显,那就是题目不代表真实使用场景。30%的化学生物题答案和同行评审文献冲突。可 谷歌 依然在2025年投入九位数预算,专门针对 HLESTEM 题目优化模型,只为拿到高分向投资人交差。

编码基准与智能体基准的局限性

再看编码领域最核心的基准测试 SWE-bench。2023年发布的初代 SWE-benchdjangoscikit-learn 等12个 Python 仓库自动抓取任务,没有任何人工验证。GitHub 需求描述模糊、测试用例不全面,导致很多正确答案被误判,错误答案被通过,甚至出现任务描述没提、测试却要求精准匹配19个单词错误信息的荒唐情况。

2024年8月 OpenAI 推出 SWE-bench verified,雇佣93名 Python 开发者人工审核,把2294个任务精简到500个,加入代码执行工具,用 Docker 容器提升稳定性。但是依然存在问题:不仅超过一半的难题依然存在评估不公,而且所有任务都来自开源仓库,模型存在训练数据污染(Training Data Contamination: 模型在训练过程中接触到测试数据,导致评估结果失真)的问题。

2026年2月,OpenAI 宣布不再上报 verified 成绩,转而推荐 SWE-bench pro。后者使用更严格授权的开源仓库和私有仓库避免污染,雇佣开发者编写任务和评估,但是依然没有彻底解决所有问题。除了 SWE-bench 系列,编码基准还有多语言版本、Terminal-benchNL2Repo 等等,各有局限,但依然是厂商宣传的核心依据。

最后是智能体基准测试(Agent Benchmark: 评估 AI 智能体在复杂、多步骤任务中表现的测试)。最具代表性的是 OpenAI 2025年9月发布的 GDPval,覆盖44种职业的真实经济价值任务。它雇佣各行业专家编写任务、示例方案和评分规则,支持办公软件、CAD 工具、网页搜索、代码执行,甚至模拟日历、邮件、云盘等真实环境,用人类专家评分,比传统基准更贴近真实工作。但是依然存在提示词过于明确、缺乏真实场景的模糊性以及单轮对话无反馈迭代等问题。

而厂商在基准测试上的猫腻远比我们想象的更多。例如,OpenAI 发布 GPT-5.4 时,几乎没有加入任何基准测试,也没有和 Anthropic 模型对比,因为当时 GPT-5.4 会被 Opus 4.6 全面碾压。而 GPT-5.5 发布时,重新加入了 ClaudeGemini 的对比,却刻意避开了 OpenAI 自己主推的 SWE-bench pro,改用自定义的 Expert-SWE 基准。原因很简单:GPT-5.5SWE-bench pro 上的成绩远不如 Opus 4.7,更比不上未公开的 Mythos 模型。

还有一个关键误区:很多人认为用统一的工具套件测试才是公平对比。但是 SemiAnalysis 通过实测发现,工具套件本身就是产品的一部分。用户关心的是 CodexClaude Code 的整体体验,而非单纯的 GPT-5.5Opus 4.7 模型本身。而且工具套件直接决定了任务成本:提示词缓存、输入输出比以及工具的调用模式都和 token 效率强相关。初步数据显示,Codex 的输入输出比为80:1,Claude 为100:1。更高的输入输出比看似单 token 更贵,但是整体 token 消耗更少,最终任务成本更低。

智能编码战争的未来格局

最后,我们来预判一下智能编码的战争,最终谁能赢呢?当前的格局显然是 OpenAIAnthropic 的双雄争霸,其他玩家暂时无法撼动。DeepSeek V4 的发布足够惊艳,但是开源和闭源的差距正在重新拉大。SpaceXAI 在收购 Cursor 后,有机会冲击第三名,但是需要奇迹才能超越前两位。谷歌 有足够的资源,只要强化学习团队发力,可能带来惊喜,但是目前依然落后。MetaMuse Spark 刚刚入局,还处于追赶状态。

市场份额层面,只有 AnthropicOpenAI 拥有实质性的市场占有率。WindsurfCognitionReplitVercel V0 等主打编码的创业公司,即便收入几个月增长3倍,也只是模型的封装工具,毛利率为负。所有公司的年度经常性收入加起来只有几十亿美元。而 Anthropic 的估值从90亿美元暴涨到400亿美元,核心驱动力就是 Claude Code 的智能编码业务。

今年年初,所有人都无法想象 Anthropic 会超越 OpenAI。但是现在,抛开云服务商收入分成的会计差异,Anthropic 的年度经常性收入已经在可比口径下超过了 OpenAI,成为智能编码领域的绝对领导者。而且 Anthropic 的收入质量更高,70%来自 API 调用,随着部署规模增长。而 OpenAI 依赖免费的消费端产品,用户基数大但是商业化的效率更低。

不过,OpenAI 的红色警报即将结束。GPT-5.5 让它重新回到前沿水平。而全球算力紧缺,成为 OpenAI 守住市场的关键。Anthropic 正在疯狂地抢购算力,导致 H100 租赁价格持续飙升。但是今年全球的算力增量有限,AnthropicAGI(Artificial General Intelligence: 人工通用智能,具备人类级别或超越人类级别智能的 AI 系统)研发路线让它不会把超过50%的算力用于用户服务。同时,Anthropic 还在通过涨价、降低峰值速率、移除订阅版 Claude Code、封禁第三方工具等方式,把算力转向高毛利业务,逐渐成为 AI领域 中类似依云一样的高端水品牌。这部分被高价劝退的用户,就是 OpenAI 的机会。

未来的竞争,不再是基准分数的内卷,而是算力储备(Compute Resource Reserves: 可用于训练和运行 AI 模型的大规模计算资源)、token效率生态工具(Ecosystem Tools: 围绕核心模型构建的插件、命令行、IDE 集成等周边工具)、定价策略(Pricing Strategy: 模型服务的费用结构和收费方式)的综合比拼。闭源模型会持续拉开和开源的差距,封装型创业公司的生存空间会越来越小,只有模型 + 工具套件的完整产品(Integrated Model and Tooling Product: 结合核心模型与配套工具链提供完整解决方案的产品)才能在市场上立足。

对于我们普通用户和开发者来说,需要注意的是不要再被厂商的基准测试分数忽悠,而是要关注真实的使用体验、完成任务的成本效率、生态工具的完整性。这些才是选择编码助手的核心标准。不论如何,智能编码的这场战争,才刚刚开始。感谢收看本期视频,我们下期再见。

📌 文中提及的人物和组织