大家好,这里是最佳拍档,我是大飞。从今年2月5日 Claude Code 迎来拐点之后,整个 AI编码模型 市场就好像被按下了加速键一样,几乎每周都有大厂或顶尖实验室发布全新的编码专用模型。一连串的模型名字,如 Claude Opus、Mythos、OpenAI Codex、Google Gemini、DeepSeek、Kimi、Qwen、GLM、MiniMax、Composer、Muse Spark,让人眼花缭乱,很多人根本分不清这些模型到底谁强谁弱,官方发布的基准测试分数到底能不能信,自己的日常开发到底该选哪一款工具。
就在25日,SemiAnalysis 的几位资深分析师在过去几个月里亲手实测了所有主流头部模型,不仅拿到了 GPT-5.5 的阿尔法测试资格,还深度对比了 Opus 4.7 和 DeepSeek V4 的真实表现,发表了一份长达万字的实测报告。同时,他们还将行业里基准测试的猫腻、模型的定价逻辑以及市场的竞争格局分析得一清二楚。今天,我们就来给大家分享一下,看看智能编码助手的未来方向在哪里。
智能编码市场核心结论
我们先来给出报告的核心结论:在 GPT-5.5 发布之后,OpenAI 终于重新回到了 AI编码领域 的前沿梯队;而 Anthropic 凭借 Claude Opus 系列,依然牢牢占据市场的主导地位。开源阵营的 DeepSeek V4 虽然技术亮眼,但是已经难以撼动闭源大厂的优势。更重要的是,所有厂商吹嘘的基准测试分数,正在彻底失去参考价值。按任务计费的成本效率(Cost Efficiency per Task: 完成特定任务所需的总投入),才是衡量编码模型的真正核心指标。
接下来,我们来逐个拆解一下三款最具代表性的模型。
OpenAI GPT-5.5:重回前沿的颠覆者
首先登场的,是本次测评中最具颠覆性的产品:OpenAI 的 GPT-5.5。这款模型是 OpenAI 基于代号为 Spud 的全新预训练框架,推出的首个公开发布版本,也是 OpenAI 自失败的 GPT-4.5 之后,第一次真正意义上的预训练规模升级。
在 GPT-5.5 发布之前,从去年11月 Opus 4.5 推出后的半年时间里,OpenAI 的编码模型在绝大多数核心指标上都算不上全球顶尖。当时 SemiAnalysis 团队的日常开发工具清一色都是 Claude Opus。而现在,GPT-5.5 已经全面融入了他们的日常工作流,甚至在部分任务上的表现已经实质性超越了市面上所有其他模型。
分析师团队首先纠正了一个外界广泛传播的错误信息:英伟达 和 OpenAI 都曾用精准的表述宣称 GPT-5.5 是在10万颗 GB200 NVL72 集群上完成训练的,但是这个所谓的“训练”仅仅是后训练阶段的强化学习(RL阶段),模型在预训练核心阶段从未达到过这个规模。这只是 OpenAI 在宣传上的文字游戏,大家要擦亮眼睛。
再看大家最关心的定价。OpenAI 的模型历来比 Anthropic 更加亲民,但 GPT-5.5 打破了这个惯例。它的 API 定价为每百万输入 token 5美元,每百万输出 token 30美元。这个价格是 GPT-5.4 的两倍,甚至比 Anthropic 的 Opus 4.7 还要略高一点。
GPT-5.5 的服务模式与技术亮点
出于安全层面的考量,GPT-5.5 最初只开放了 ChatGPT 和 Codex 的访问窗口,随后才正式上线 API 接口。SemiAnalysis 团队也是在阿尔法测试阶段,通过 Codex 和 API 完成了全方位的实测。除了标准版,OpenAI 还为 GPT-5.5 推出了专属的优先级服务,价格是标准版本的2.5倍。
这里要区分清楚 AI 厂商常用的两种加速服务:分别是快速模式(Fast Mode: 提供模糊的性能承诺,如高倍价格换取加速)和优先级服务(Priority Service: 提供保守且具体的服务等级协议,如99%时间内的最低输出速度)。目前 Anthropic 和 OpenAI 都提供这两种服务,但是真正获得市场认可的,只有 Opus 4.6 的快速模式。
另外,OpenAI 还同步推出了 GPT-5.3-Codex-Spark 模型,这款模型是专门为 Cerebras 芯片设计的蒸馏版 GPT-5.3。还有面向科研场景的 GPT-5.5 Pro 版本,仅通过 ChatGPT 和 API 提供服务,主打科学研究和长程推理任务,而非日常的智能编码工作。这款模型在 BrowseComp 和 FrontierMath 两大基准测试中拿下了当前最优成绩,定价和 GPT-5.4 Pro 保持一致,为每百万 token 30和180美元,未来大概率会在科学发现领域放出更多重磅成果。
GPT-5.5 的标准版和 Pro 版都提供了五档推理强度调节,从 xhigh、high、medium、low 到 non-reasoning,这是一种能力与成本的权衡。从 OpenAI 的 o1 系列开始,高推理强度就意味着更好的输出效果,但是同时会消耗更多的 token、响应速度更慢,这也是所有 大模型(Large Language Model: 基于海量文本训练的 AI 系统)的通用规律。
而 GPT-5.5 最核心的技术亮点就是 token效率(Token Efficiency: 完成任务所需的token数量与效果的平衡)。OpenAI 在模型卡片中明确标注,它在基准测试分数高于 GPT-5.4 的同时,token 消耗量更低。这个点至关重要,也是 SemiAnalysis 团队反复强调的核心逻辑:衡量模型定价的核心指标已经不再是每 token 的价格了,而是完成单个任务的总成本。例如,Mythos 模型的单 token 价格是 Opus 的5倍,但是因为它完成任务需要的 token 更少,整体成本反而被抵消,甚至端到端响应速度更快。Token 效率 将成为2026年 AI模型 竞争的核心关键词。
Anthropic Claude Opus 4.7:小幅升级与成本隐忧
聊完了 OpenAI 的 GPT-5.5,我们把目光转向它的头号对手 Anthropic 的 Claude Opus 4.7。Opus 系列一直是 SemiAnalysis 团队的主力开发工具。Opus 4.7 作为 Opus 4.6 的直接替代版本,整体属于小幅升级,在多项基准测试中分数有所提升,使用体验也保持了一贯的稳定,但是并没有带来颠覆性的技术突破。团队成员也是勉强接受了这款更新。
为什么说勉强呢?原因就是 Opus 4.7 至今没有推出快速模式。而工程师们已经愿意为了更快的速度牺牲一部分微不足道的质量。2.5倍速度、6倍价格的权衡能让开发者进入真正的心流状态,这是当前编码工具的核心需求之一。
从 Opus 4.6 升级到 4.7,用户能感知到的变化更多来自功能层面而非原始性能。现在的头部编码模型已经足够强大,日常开发任务都能完美完成。工程师们的吐槽点已经从功能测试是否通过,变成了代码风格、实现思路、架构设计和 token 效率,几乎不会再出现模型完全搞砸代码提交的情况。
Opus 4.7 的五大功能更新
具体来说,Opus 4.7 的核心功能更新有五个,每一个都直接影响使用体验和成本:
- 新增了高分辨率图像支持:强化学习的训练目标也明显调整,模型可以直接通过截图完成前端样式的开发,不再需要通过无头浏览器或者 Playwright 等工具运行程序测试,前端开发的效率大幅提升。
- 在推理强度层级中新增了 xhigh 的档位,介于 high 和 max 之间,让用户可以更精细地控制模型的推理耗时和能力输出。
- 默认隐藏了思考过程 token:虽然用户依然需要为这部分 token 付费,但是必须主动开启才能查看。Anthropic 通过这种方式简化了输出界面,但是也增加了成本的不透明性。
- 推出了测试阶段的任务预算功能(Task Budget: 用户为模型完成任务设定的效率阈值):仅支持 API 调用。用户可以给模型建议完成任务的效率阈值,如果预算限制过严,模型会选择简化步骤甚至拒绝执行。这和传统的最大输出 token 限制不同,后者是对输出长度的硬性约束,前者是对任务执行效率的柔性建议。
- 最关键的变化是全新的分词器:Anthropic 直接承认,新的分词器通过更细粒度的 token 计数提升了性能,但是也导致 token 使用量会最多增加35%。这相当于直接涨价35%,是所有用户都无法忽视的成本变化。
在模型行为上,Opus 4.7 默认减少了工具调用的次数,更依赖自身推理完成任务。SemiAnalysis 团队实测后并不认可这种调整,需要手动把推理强度从高调到 xhigh 或 max 才能让模型调用足够的工具,完成复杂任务的多步骤规划,这和官方宣传的 token 效率优化完全相悖。
这里还有个事件:在 Opus 4.7 发布前,大量用户指责 Anthropic 故意降低 Opus 4.6 的性能。Anthropic 对此坚决否认,但是 SemiAnalysis 的多位工程师都明确表示 4.6 的性能在那段时间出现了明显异常。直到4月23日,也就是 Opus 4.7 发布一周后,Anthropic 发布了事后分析报告,承认在3月到4月期间出现了三个影响所有 Claude Code 用户的 bug。这些 bug 潜伏了几周才被发现,这也印证了工程师们的直观感受。这三个 bug 的时间窗口分别是3月4日至4月7日、3月26日至4月10日、4月16日至4月20日。作为一款主打编码的 AI工具,如此长时间的 bug 未被修复,也侧面暴露了闭源模型的潜在风险。
开源阵营DeepSeek V4:技术亮眼,差距犹存
接下来我们再来聊聊开源阵营的扛把子 DeepSeek V4。DeepSeek 在去年凭借 R1 版本惊艳全球,也引发了行业对开源模型是否会让人工智能商品化的激烈讨论,甚至引发了 GPU 短缺的连锁反应。而这次发布的 V4 版本,分为 Pro 和 Flash 两个型号,虽然没有再次颠覆市场,但是技术实力依然不容小觑。
先看参数架构:DeepSeek V4 Pro 总参数1.6万亿,激活参数490亿;V4 Flash 总参数2840亿,激活参数130亿。对比上一代 V3 的6710亿总参数、370亿激活参数,Pro 版本实现了升级,Flash 版本则是轻量化降级。但是客观来说,无论是总参数还是激活参数,DeepSeek V4 和 OpenAI、Anthropic 的闭源前沿模型相比,依然存在明显的差距。
V4 相比 V3 最核心的突破是把上下文窗口从128k直接提升到100万 token。所有技术创新都围绕长上下文性能(Long Context Performance: 模型在处理长文本输入时的理解和生成能力)展开,包括压缩稀疏注意力 CSA(Compressed Sparse Attention)、重压缩注意力 HCA(Heavily Compressed Attention)、流形约束超连接 mHC(Manifold Constrained Hyperconnection)三项核心技术。
官方数据显示,在100万 token 上下文场景下,V4 Pro 的单 token 推理浮点运算量仅为 V3.2 的27%,KV缓存 占用仅为10%,90%的 KV缓存 reduction,甚至比谷歌之前发布的 TurboQuant 论文效果还要惊艳。这对存储行业的影响值得关注。
在基准测试方面,DeepSeek 认为传统基准无法衡量真实任务能力,因此自研了智能编码、中文写作、检索增强搜索、长周期白领任务等专属基准。V4 Pro 虽然在这些任务中能和头部模型抗衡,但是在核心领域依然落后。例如,在高难度中文写作任务中,Claude Opus 4.7 的表现依然优于 DeepSeek V4 Pro。这是一个很有意思的现象:海外模型在中文任务上反而超越了本土开源模型。
DeepSeek V4 的技术开源与推理性能
技术层面,DeepSeek V4 开源了模型权重和详细技术报告,还更新了 DeepEP、DeepGEMM、FlashMLA 等被全球实验室广泛使用的库。甚至在 DeepGEMM 中开源了支持 英伟达 GPU 和 华为昇腾 NPU 的超级内核。虽然目前只公开了 NVIDIA Hopper 和 Blackwell 架构的代码,但是未来大概率会让大量推理任务运行在昇腾芯片上。
推理性能方面,SemiAnalysis 的 InferenceX 团队联合 vLLM、Inferact 和 NVIDIA 的工程师,在 H200 集群上实现了 V4 的首日支持。FP8精度 下,单 GPU 吞吐量约为每秒150个 token,交互速度为每秒20个 token。而 V3 的吞吐量为每秒1300到2300 token。作为一款全新模型,V4 还有很大的优化空间。
总结来看,DeepSeek V4 是一次极其出色的工程化发布,紧跟前沿水平,是闭源模型之外成本最低的选择。但是核心能力依然没有达到全球顶尖,SemiAnalysis 自己的核心工作流也不会被 DeepSeek 替代。开源和闭源的差距,正在重新拉大。
实测对比:Codex与Claude Code的用户体验
拆解完三款核心模型的技术细节,接下来进入最精彩的实测对比环节:GPT-5.5 对应的 Codex 和 Opus 4.7 对应的 Claude Code,到底谁更好用呢?
SemiAnalysis 团队向来更推崇 Claude。在 GPT-5.5 阿尔法测试期间,他们把两款模型放在同一场景下极限对比,得出的结论非常客观:GPT-5.5 在 Codex 插件场景下实现了显著提升。此前团队工程师全部使用 Claude,ChatGPT 编码只限于 Cursor 等工具。而现在,大部分工程师会根据任务类型和 IDE 偏好,在 Codex 和 Claude 之间切换。
有工程师表示,Codex 最让人满意的点是在修改代码前会拉取大量上下文信息。不是简单的结构调整,而是需要深度思考的复杂修改。而 Opus 4.7 往往只是快速浏览代码后就直接修改,缺乏对细节上下文的挖掘。还有工程师明确自己会用 Codex 做代码审查、bug 排查、代码解释、文档创建与修改,它对代码结构的理解和推理能力更出色。
但是 GPT-5.5 的缺点也很明显:它对用户真实意图的推断能力不如 Claude Code。人类在给编码智能体发指令时往往简洁且不严谨,Codex 会过于字面化地执行指令,而 Claude 能更好地理解背后的真实需求。同时,GPT-5.5 在代码修改时过于保守,虽然提升了 token 的效率,但是牺牲了准确性,输出中出现“narrow fix”时必须人工二次检查。
团队还做了一个极端测试:让 Opus 4.6 和 GPT-5.5 分别基于现有 token 经济学仪表板创建新的加速器模型仪表板。结果 Opus 4.6 完美复刻了包含所有标签页链接的主页,而 Codex 则完全忽略了主页设计,除非在提示词中明确要求复制主页,否则无法自主推断这个需求。但是在仪表板的数据准确性上,Codex 远优于 Claude。Claude 甚至出现了在 TPU 图表中加入 NVIDIA GPU 的幻觉问题。这说明 Codex 更擅长复杂数据结构的推理(Complex Data Structure Reasoning: 理解和处理复杂数据关系的能力)和窄范围高难度任务(Narrow-Scope High-Difficulty Tasks: 针对特定领域内复杂问题的解决)。Claude 更擅长开放式、从零到一的全新项目开发(Open-Ended, Green-Field Development: 从概念开始构建全新项目)。
基于这个结论,工程师们形成了全新的工作流:先用 Claude 完成新应用、新功能的初始规划和框架搭建,完成第一个版本的原型开发;再切换到 Codex 解决具体问题、修复 bug。而在 GPT-5.5 发布之前,团队全程都使用 Claude 完成这两个步骤。
除此之外,OpenAI 还有一个致命的短板,那就是插件和命令行工具的功能落后。工程师们普遍需要100万上下文的快速模式、远程控制、沙盒插件,实现电脑和手机的跨设备会话。这些功能 Claude Code 的命令行、VSCode 插件、网页端、移动端全部支持,而 Codex 的所有端侧工具都不具备这些能力。即便 GPT-5.5 模型本身足够优秀,OpenAI 也需要加快功能迭代才能追上 Anthropic 的生态优势。
戳破AI基准测试的泡沫:价值与陷阱
聊完模型的真实体验,我们再来戳破整个 AI 行业最大的泡沫——基准测试(Benchmark Test: 衡量模型性能的标准测试集)。几乎每一款新模型发布,厂商都会贴出一张满是高分的基准测试对比表,用看似客观的数字证明自己的模型全球第一。但是 SemiAnalysis 团队明确指出,基准测试已经无法代表模型的真实实用价值了。虽然所有厂商依然会乐此不疲地宣传,但我们要做的就是学会从数字中筛选有效信息,避开所有陷阱。
一个完整的基准测试由三个部分组成:
- 任务:模型要完成的具体操作。
- 评估方式:模型的打分标准。
- 工具套件:模型完成任务的工具、指令、交互界面。
只有理解前两个要素,才能判断基准测试是否有价值。
我们先看最经典的通用基准测试:2020年发布的 MMLU(Massive Multitask Language Understanding: 大规模多任务语言理解测试),包含57个学科、15908道多选题,是早期 AI模型 的核心测试标准。其 harness(测试框架)极简,不支持网页搜索等工具,评分只需要看选项是否正确。2023年 GPT-4 就达到了86.4%的正确率,基本饱和,而且研究显示 MMLU 中有6.49%的题目本身存在错误。后续的 GSM8K、HellaSwag、MMMU、GPQA 等基准也都面临同样的问题。厂商只能通过筛选难题、增加选项、提高难度,推出 MMLU-Pro、MMMU-Pro 等升级版维持测试价值。
2025年1月 Scale AI 发布的人类终极考试 HLE,邀请全球1000多位专家创建2500道题,80%是精准短答案,20%是多选题,支持网页搜索、代码执行工具。但是问题也很明显,那就是题目不代表真实使用场景。30%的化学生物题答案和同行评审文献冲突。可 谷歌 依然在2025年投入九位数预算,专门针对 HLE 的 STEM 题目优化模型,只为拿到高分向投资人交差。
编码基准与智能体基准的局限性
再看编码领域最核心的基准测试 SWE-bench。2023年发布的初代 SWE-bench 从 django、scikit-learn 等12个 Python 仓库自动抓取任务,没有任何人工验证。GitHub 需求描述模糊、测试用例不全面,导致很多正确答案被误判,错误答案被通过,甚至出现任务描述没提、测试却要求精准匹配19个单词错误信息的荒唐情况。
2024年8月 OpenAI 推出 SWE-bench verified,雇佣93名 Python 开发者人工审核,把2294个任务精简到500个,加入代码执行工具,用 Docker 容器提升稳定性。但是依然存在问题:不仅超过一半的难题依然存在评估不公,而且所有任务都来自开源仓库,模型存在训练数据污染(Training Data Contamination: 模型在训练过程中接触到测试数据,导致评估结果失真)的问题。
2026年2月,OpenAI 宣布不再上报 verified 成绩,转而推荐 SWE-bench pro。后者使用更严格授权的开源仓库和私有仓库避免污染,雇佣开发者编写任务和评估,但是依然没有彻底解决所有问题。除了 SWE-bench 系列,编码基准还有多语言版本、Terminal-bench、NL2Repo 等等,各有局限,但依然是厂商宣传的核心依据。
最后是智能体基准测试(Agent Benchmark: 评估 AI 智能体在复杂、多步骤任务中表现的测试)。最具代表性的是 OpenAI 2025年9月发布的 GDPval,覆盖44种职业的真实经济价值任务。它雇佣各行业专家编写任务、示例方案和评分规则,支持办公软件、CAD 工具、网页搜索、代码执行,甚至模拟日历、邮件、云盘等真实环境,用人类专家评分,比传统基准更贴近真实工作。但是依然存在提示词过于明确、缺乏真实场景的模糊性以及单轮对话无反馈迭代等问题。
而厂商在基准测试上的猫腻远比我们想象的更多。例如,OpenAI 发布 GPT-5.4 时,几乎没有加入任何基准测试,也没有和 Anthropic 模型对比,因为当时 GPT-5.4 会被 Opus 4.6 全面碾压。而 GPT-5.5 发布时,重新加入了 Claude 和 Gemini 的对比,却刻意避开了 OpenAI 自己主推的 SWE-bench pro,改用自定义的 Expert-SWE 基准。原因很简单:GPT-5.5 在 SWE-bench pro 上的成绩远不如 Opus 4.7,更比不上未公开的 Mythos 模型。
还有一个关键误区:很多人认为用统一的工具套件测试才是公平对比。但是 SemiAnalysis 通过实测发现,工具套件本身就是产品的一部分。用户关心的是 Codex 和 Claude Code 的整体体验,而非单纯的 GPT-5.5 和 Opus 4.7 模型本身。而且工具套件直接决定了任务成本:提示词缓存、输入输出比以及工具的调用模式都和 token 效率强相关。初步数据显示,Codex 的输入输出比为80:1,Claude 为100:1。更高的输入输出比看似单 token 更贵,但是整体 token 消耗更少,最终任务成本更低。
智能编码战争的未来格局
最后,我们来预判一下智能编码的战争,最终谁能赢呢?当前的格局显然是 OpenAI 和 Anthropic 的双雄争霸,其他玩家暂时无法撼动。DeepSeek V4 的发布足够惊艳,但是开源和闭源的差距正在重新拉大。SpaceXAI 在收购 Cursor 后,有机会冲击第三名,但是需要奇迹才能超越前两位。谷歌 有足够的资源,只要强化学习团队发力,可能带来惊喜,但是目前依然落后。Meta 的 Muse Spark 刚刚入局,还处于追赶状态。
市场份额层面,只有 Anthropic 和 OpenAI 拥有实质性的市场占有率。Windsurf、Cognition、Replit、Vercel V0 等主打编码的创业公司,即便收入几个月增长3倍,也只是模型的封装工具,毛利率为负。所有公司的年度经常性收入加起来只有几十亿美元。而 Anthropic 的估值从90亿美元暴涨到400亿美元,核心驱动力就是 Claude Code 的智能编码业务。
今年年初,所有人都无法想象 Anthropic 会超越 OpenAI。但是现在,抛开云服务商收入分成的会计差异,Anthropic 的年度经常性收入已经在可比口径下超过了 OpenAI,成为智能编码领域的绝对领导者。而且 Anthropic 的收入质量更高,70%来自 API 调用,随着部署规模增长。而 OpenAI 依赖免费的消费端产品,用户基数大但是商业化的效率更低。
不过,OpenAI 的红色警报即将结束。GPT-5.5 让它重新回到前沿水平。而全球算力紧缺,成为 OpenAI 守住市场的关键。Anthropic 正在疯狂地抢购算力,导致 H100 租赁价格持续飙升。但是今年全球的算力增量有限,Anthropic 的 AGI(Artificial General Intelligence: 人工通用智能,具备人类级别或超越人类级别智能的 AI 系统)研发路线让它不会把超过50%的算力用于用户服务。同时,Anthropic 还在通过涨价、降低峰值速率、移除订阅版 Claude Code、封禁第三方工具等方式,把算力转向高毛利业务,逐渐成为 AI领域 中类似依云一样的高端水品牌。这部分被高价劝退的用户,就是 OpenAI 的机会。
未来的竞争,不再是基准分数的内卷,而是算力储备(Compute Resource Reserves: 可用于训练和运行 AI 模型的大规模计算资源)、token效率、生态工具(Ecosystem Tools: 围绕核心模型构建的插件、命令行、IDE 集成等周边工具)、定价策略(Pricing Strategy: 模型服务的费用结构和收费方式)的综合比拼。闭源模型会持续拉开和开源的差距,封装型创业公司的生存空间会越来越小,只有模型 + 工具套件的完整产品(Integrated Model and Tooling Product: 结合核心模型与配套工具链提供完整解决方案的产品)才能在市场上立足。
对于我们普通用户和开发者来说,需要注意的是不要再被厂商的基准测试分数忽悠,而是要关注真实的使用体验、完成任务的成本效率、生态工具的完整性。这些才是选择编码助手的核心标准。不论如何,智能编码的这场战争,才刚刚开始。感谢收看本期视频,我们下期再见。
📌 文中提及的人物和组织
公司/组织: OpenAI, Anthropic, SemiAnalysis, DeepSeek, Google, NVIDIA
产品/模型: GPT-5.5, Claude Opus 4.7, DeepSeek V4, GPT-5.3-Codex-Spark, GPT-5.5 Pro, Mythos, Codex