大家好,这里是最佳拍档,我是大飞。
GPT-5.5:范式跃迁与核心突破
4月23日,OpenAI正式推出了新一代旗舰模型 GPT-5.5。官方将其定位为“面向真实工作的全新智能层级”,同时也是迈向全新计算机工作方式的关键一步,标志着整个大模型从“回答问题”转向“独立完成工作”的一次范式跃迁。
我们先从 GPT-5.5 最核心的两个技术突破说起。
第一个突破是效率层面的跨越式升级。在参数方面,GPT-5.5 的上下文窗口直接拉到了 100万Token。大家的直觉一般会是模型体量更大了,推理速度一定会变慢。但是事实却完全相反,OpenAI这次做到了在同等延迟的前提下,让模型能力大幅提升。也就是说,你等待回复的时间和 GPT-5.4 基本一致,但是模型处理复杂任务、理解长文本、执行多步骤工作流的强度有了级别上的提升。
第二个突破,可能是整个发布里最被低估、但技术意义最深远的一点,那就是 GPT-5.5 在训练与部署阶段,直接参与了自身推理基础设施的优化。直白一点来讲,就是AI正在帮自己来优化运行系统、调整参数以及提升效率。长远来看,这一点会从根本上改变未来大模型的迭代速度和成本结构。
基准测试:多维度能力飞跃
接下来我们来看基准测试成绩。OpenAI这次公布了非常完整的对比数据,覆盖职业工作、编程、电脑操控、科研、数学、网络安全等多个维度,对手直接对准当前市面上最强的 Claude Opus 4.7 和 Gemini 3.1 Pro。
职业工作与编程能力
首先是衡量真实职业能力的 GDPval 测试,这个测试覆盖了44种职业场景,包括财务建模、法律分析、数据科学报告、运营规划、市场策略等等,要求模型完成一整套完整工作流程,而不是回答单个知识点。最终结果是,GPT-5.5 在84.9%的任务中达到甚至超过行业专家水平,相比之下,GPT-5.4 是83.0%,Claude Opus 4.7 为80.3%,Gemini 3.1 Pro 只有67.3%。
在电子表格建模任务中,GPT-5.5 内部测试达到了88.5%,投资银行级别的复杂建模同样领先前代。早期测试者普遍反馈,GPT-5.5 Pro 在回答的全面性、结构性和实用性上,对比 GPT-5.4 Pro 有肉眼可见的提升,尤其是商业分析、法律文书、教育内容和数据科学报告这类高度依赖逻辑结构与专业细节的领域。
然后是大家最关心的编程能力。OpenAI直接定义 GPT-5.5 为目前最强的自主编程模型。我们重点来看 Terminal-Bench 2.0,这个测试专门用来评估复杂命令行工作流,需要模型自主规划、迭代调试、协调多个工具、处理异常报错,非常贴近真实后端开发与运维场景。GPT-5.5 得分为82.7%,GPT-5.4 是75.1%,直接提升了接近8个百分点;而 Claude Opus 4.7 只有69.4%,差距超过13个百分点。更关键的是,完成同样任务,GPT-5.5 消耗的Token数量明显更少。
在 SWE-Bench Pro 测试中,GPT-5.5 得分为58.6%。在OpenAI内部的 Expert-SWE 评测中,这类长周期编程任务的中位人工完成时间大约20小时,GPT-5.5 得分为73.1%,同样高于 GPT-5.4 的68.5%。
在 GPT-5.5 的驱动下,Codex 的能力边界被彻底打开。它可以从一句自然语言提示词出发,独立完成代码生成、功能测试、视觉调试的完整开发流程。官方演示案例里,基于NASA真实轨道数据构建太空任务应用,支持3D交互操控,轨道力学模拟达到真实物理精度;还有接入实时数据源的地震追踪器,并完成可视化呈现,说明模型已经具备调用外部API、处理动态数据、实时渲染界面的端到端能力。
很多早期的开发者也做了反馈。Every 创始人兼首席执行官 丹·希珀(Dan Shipper)分享了一段经历:他曾经遇到一个线上Bug,自己调试数日无法解决,最后只能请公司最资深工程师重写部分系统才修复。在 GPT-5.5 推出后,他把模型回到Bug未修复的状态,让模型自主寻找方案。GPT-5.4 无法完成,而 GPT-5.5 给出了和资深工程师完全一致的解决方案。他评价说:“这是我用过的第一个真正具备概念清晰度的编程模型。”
MagicPath 首席执行官 彼得罗·斯基拉诺(Pietro Schirano)也提到,GPT-5.5 可以把包含大量前端修改与重构的分支,快速合并到同样有大幅变更的主分支,20分钟左右一次性解决冲突,效率远超人工。还有英伟达的一位工程师直言:“失去 GPT-5.5 的访问权限,感觉就像截肢一样。” Cursor 联合创始人兼首席执行官 迈克尔·特鲁埃尔(Michael Truell)补充道:“GPT-5.5 比前代更聪明、更坚韧,在复杂长时任务中能坚持更久,不会提前中断,这正是工程场景最需要的品质。”
操作系统操控与信息整合
第三项关键能力,是AI在操作系统级别的自主操控提升。这里的核心测试是 OSWorld-Verified,评估模型能否独立操作真实的计算机环境。这次不是简单的截图识别,而是真正通过看到界面、移动指针、点击按钮、输入内容、在多个工具之间切换,直到完整完成任务。GPT-5.5 的成功率为78.7%,高于 GPT-5.4 的75.0%,也优于 Claude Opus 4.7 的78.0%,正式超越人类基线水平。
在电信客服工作流测试 Tau2-bench 中,GPT-5.5 在无提示词调优的情况下,准确率达到了98.0%,GPT-5.4 仅为92.8%。在跨工具信息检索与整合能力上,BrowseComp 测试中 GPT-5.5 的得分为84.4%,GPT-5.5 Pro 更是达到90.1%,说明模型已经具备持续检索、深度整合、输出结构化结论的稳定能力。
科学研究新前沿
接下来是这次发布最让人意外的部分:科学研究能力。过去我们总说AI是科研的辅助工具,但是 GPT-5.5 已经开始参与更核心的环节,也就是复杂推理与新发现本身。
在遗传学与定量生物学多阶段数据分析评测 GeneBench 上,GPT-5.5 得分为25.0%,GPT-5.4 为19.0%。这类任务通常对应科学专家数天的工作量,要求模型在几乎无监督的情况下,识别潜在错误数据、处理隐藏混杂因素,以及正确应用现代统计方法。从数据曲线可以清晰看到,随着输出Token增加,GPT-5.5 的得分提升幅度始终领先 GPT-5.4,在大约15000 Token处优势明显拉大,说明任务越复杂、需要深度推理的链条越长,GPT-5.5 的优势就越突出。
在生物信息学与真实世界数据分析基准 BixBench 中,GPT-5.5 得分80.5%,也高于 GPT-5.4 的74.0%,在已公布得分的模型中处于第一梯队。
官方还发布了一个具体案例:配备自定义工具框架的 GPT-5.5 内部版本,协助发现了一项关于拉姆齐数的新数学证明,并且在形式化证明工具 Lean 中完成验证。拉姆齐数是组合数学的核心研究对象,这个领域成果极少、技术难度极高。
在实际应用层面,杰克逊实验室 免疫学教授 德里亚·乌恩特马兹(Derya Unutmaz)使用 GPT-5.5 Pro,分析了包含62个样本、近28000个基因的基因表达数据集,生成详细的研究报告,并且提炼出了关键发现与研究问题。这项工作通常需要团队耗费几个月时间。
还有波兰 波兹南亚当·密茨凯维奇大学 的数学系助理教授 巴尔托什·纳斯肯茨基(Bartosz Naskręcki),仅凭一条提示词,就在 Codex 中用 GPT-5.5,耗时11分钟构建出了代数几何应用,可视化了两个二次曲面交线,并且将结果转化为魏尔斯特拉斯模型,方程系数可直接用于后续研究,全程由模型独立完成。
Axiom Bio 的联合创始人 布兰登·怀特(Brandon White)评价:“如果OpenAI保持这一迭代速度,年底前药物发现的基础格局将会被改变。”
效率、成本与技术基石
我们再来看效率与成本,这也是企业与开发者最关心的问题。虽然 GPT-5.5 API的定价为每百万Token输入5美元、输出30美元,是 GPT-5.4 输入2.5美元、输出15美元的两倍,但是官方强调,GPT-5.5 完成相同任务所需要的Token数量大幅减少,综合成本未必会显著上升。GPT-5.5 Pro API的定价为每百万Token输入30美元、输出180美元,批量处理与弹性定价可享受半价优惠,优先处理价格为标准价的2.5倍。
在 Artificial Analysis 的智能指数图中,横轴为输出Token总量,纵轴为综合智能得分。从图中可以可以看到,GPT-5.5 的曲线全面领先 GPT-5.4、Claude Opus 4.7、Gemini 3.1 Pro Preview。更重要的是,它在Token消耗更少的区间,就能达到其他模型需要更多Token才能实现的得分水平,也就是所谓的“更强能力、更低的等效成本”。
这个背后的技术逻辑是,OpenAI重新设计了整套推理系统,让 Codex 与 GPT-5.5 本身直接参与优化。之前的系统采用的是固定分块策略来均衡GPU负载,但是对所有流量形态并不一定都是最优的。Codex 通过分析几周内的生产流量数据,编写自定义启发式算法,将Token生成速度提升超过20%。GPT-5.5 还与英伟达 GB200、GB300 NVL72 系统协同设计、协同训练、协同部署。
安全与对齐:严苛评估体系
最后,我们再来结合 GPT-5.5 的系统卡,来看一下它的能力与安全平衡。首先最重要的一部分是安全评估体系,这部分也是 OpenAI 投入最多资源、披露最细致的内容,覆盖禁止内容、视觉安全、数据安全、操作确认四大核心场景。
内容安全与多模态防护
首先是禁止内容评估。OpenAI 做了两套完全不同的测试体系:一套是挑战性提示基准测试,另一套是代表性用户流量评估。在挑战性提示基准测试中,研究团队评估了暴力非法行为、非暴力非法行为、骚扰、极端主义、仇恨言论、标准自残场景、暴力内容、成人内容、未成年人相关成人内容等方面。结果显示 GPT-5.5 在禁止内容维度的表现与 GPT-5.4 Thinking 持平,没有出现实质性安全倒退。而另一套代表性用户流量评估,更贴近真实的使用场景,测试结果显示,GPT-5.5 在虚假事实、伪造工具结果、冒充人类等欺骗性行为上的发生率,均低于 GPT-5.4 Thinking 的重采样数据与生产数据,整体安全表现符合预期。
除了文本安全,GPT-5.5 还完成了多模态视觉输入安全评估,针对文本 + 图像组合的违规输入测试,核心覆盖仇恨、极端主义、自残、色情危害四大维度。测试数据显示,GPT-5.5 的视觉安全得分与前代模型基本持平,小幅波动无统计学意义,安全防护能力在多模态场景下保持一致,没有因图像输入出现安全漏洞。
OpenAI这次还专门做了避免数据破坏性操作评估,核心测试模型保护用户创作内容、规避意外破坏性操作的能力。数据显示,GPT-5.5 的破坏性操作规避、完美恢复能力以及用户工作保护等得分,均为历代最高。OpenAI 在训练中特意让模型区分了自身操作与用户工作,默认会保护用户修改内容,即便出现错误也能快速恢复。在复杂工作区的文件回滚、清理任务中,大幅降低了误操作风险。
还有一个很实用的安全设计:计算机操作中的用户确认机制。GPT-5.5 被训练遵循平台级的高风险操作政策,同时支持开发者自定义确认规则。这套机制有两大优势:一是发现问题时能快速更新系统级政策;二是 API 场景下允许开发者定制确认逻辑,适配不同场景的安全需求。测试数据显示,金融交易场景的确认准确率100%,高风险沟通确认准确率0.98,常规确认准确率0.94,可以在核心高风险场景完全做到“无确认不执行”,从流程上杜绝风险操作。
攻击防御与幻觉控制
安全之外,OpenAI 还重点测试了两大核心攻击场景:分别是对抗越狱与提示注入。对抗越狱测试用的是多轮对话式的高难度测试,模拟真实世界中攻击者逐步试探、升级、绕过安全护栏的行为。测试结果显示,随着攻击者成本提升,GPT-5.5 的防御成功率始终保持在历代模型的最高水平。而在提示注入攻击方面,测试数据显示,GPT-5.5 的提示注入防护得分为0.963,整体仍处于极高安全水平,能有效抵御绝大多数已知的提示注入攻击。
除此以外,AI 的幻觉问题一直是用户最关心的痛点。OpenAI 这次没有用通用基准测试,而是专门选取了前代模型用户标记的事实错误案例。测试结果非常亮眼:GPT-5.5 的单条事实声明准确率比 GPT-5.4 高23%,响应级事实错误率低3%。
对齐性与可控性
而在对齐性评估方面,OpenAI 测试了外部使用提示评估、编码智能体评估和思维链评估三大板块。外部使用提示评估重点测试模型的欺骗性行为,比如假装回答完整、伪造事实、冒充人类等等。数据显示,GPT-5.5 在绝大多数欺骗性行为上的发生率都低于 GPT-5.4 Thinking 的重采样数据。唯一小幅上升的伪造事实类别,OpenAI 认为是脱敏流程导致的误报,会进一步核查。
对于编码智能体对齐性评估,OpenAI 搭建了工具响应模拟器,还原真实代码开发的工具调用环境。结果显示,GPT-5.5 的对齐性略低于 GPT-5.4 Thinking,但是所有越界行为均为低严重性,未出现任何3级、4级的严重越界行为,内部部署的严重风险极低。
思维链评估是 OpenAI 新创建的一个安全指标,分为可监控性与可控性。可监控性衡量监控器能否从模型的思维链中推断行为属性。测试显示 GPT-5.5 的思维链可监控性与 GPT-5 系列其他模型持平,整体监控准确率保持96%的高位,仅在健康查询场景出现小幅波动,无实质性风险。
可控性衡量模型是否能刻意修改、隐藏思维链以规避监控,这是防范AI恶意隐瞒的核心指标。测试结果显示,GPT-5.5 的思维链可控性低于 GPT-5.4 Thinking 和 5.2 Thinking,5万字符长度的思维链控制成功率仅0.2%,远低于前代,意味着它很难刻意扭曲思考过程躲避监控,大幅提升了安全监控的可靠性。
前沿能力准备框架
最后,在前沿能力准备框架方面,OpenAI 测试了 GPT-5.5 在生物化学、网络安全、AI 自我提升三大高危领域的能力等级。OpenAI 将能力等级分为高(High)和临界(Critical)两级,临界级代表具备造成严重危害的自主能力,高等级则需配套专项防护。
首先是生物与化学领域,OpenAI 将 GPT-5.5 定为高能力等级。不过评估结果显示,虽然 GPT-5.5 虽具备专家级生物知识,但是还不具备自主设计危险生物物质的能力。
然后是网络安全领域,GPT-5.5 同样被定为高能力等级。虽然在专业级夺旗挑战(CTF)等测试上的得分均高于前代,但是还没有达到临界级,也就是说,还没有达到无需人工干预就能开发所有 severity 级别的零日漏洞,以及对关键系统实施端到端的网络攻击。
最后是AI 自我提升领域,OpenAI 明确 GPT-5.5 还没有达到高能力等级,也就是还没有达到资深工程师级的水平,目前还不具备自主实现 AI 自我迭代的能力。
与此同时,官方部署了更严格的风险分类器,部分用户初期可能感受到使用限制,后续会持续调整。为了平衡防御需求与合理访问,OpenAI 还推出网络安全可信访问计划,符合条件的安全研究人员与关键基础设施防御者可申请更宽松权限,让防御者比攻击者更早用上最强工具。
用户体验与行业格局
回到ChatGPT中,GPT-5.5 将以 GPT-5.5 Thinking 形式上线,逐步会取代之前的版本。同时新增了一个非常实用的交互设计,那就是模型开始正式思考执行前,会先给出一段思路概述,用户可以在执行过程中随时插话、调整方向、修改目标,不用等模型完整输出后再返工。这对于复杂任务的协作效率提升非常明显。
OpenAI 内部超过85%的员工每周都在使用 Codex,覆盖财务、传播、市场、产品、数据科学等部门。财务团队用它审阅24771份 K-1 税务表格,合计71637页,比去年提前两周完工。传播团队用它分析六个月的演讲邀约数据,搭建自动化分级流程。市场拓展团队靠自动化周报生成,每人每周节省5到10小时。
总的来说,GPT-5.5 的发布,让OpenAI再次重回了AI行业的头把交椅。再加上前几天发布的 GPT-image-2,我们能清晰看到AI产品的迭代速度与突破越来越快。
而 GPT-5.5 发布之际,正值 Claude Code 最近性能变差屡遭投诉。或许是感受到来自 GPT-5.5 的压力,Anthropic 今天发了一篇长文,宣布已经修复降智问题,并自今日起重置所有订阅用户的使用限制。现在压力给到了 Anthropic,它会不会被迫扔出 Mythos 呢?让我们拭目以待。
感谢收看本期视频,我们下期再见。
📌 文中提及的人物和组织
公司/组织: OpenAI
产品/模型: GPT-5.5, Codex, Claude Opus 4.7, Gemini 3.1 Pro