OpenAI 发布 GPT-5.2:性能飞跃、经济价值与商业合作新篇章 Best Partners TV 2025-12-12

OpenAI 发布 GPT-5.2,全面回应市场竞争

随着 Google Gemini 3 的发布,OpenAI CEO Sam Altman 上周罕见地拉响了 Code Red (红色警报),并宣布所有资源回流 ChatGPT 主线,其他业务一律靠边站。这是 OpenAI 成立以来第一次进入红色警报状态,也是它第一次如此明确地承认,竞争压力已经大到必须全力应对。就在今天,OpenAI 发布了 GPT-5.2 模型,打出了一记回应谷歌的重拳。

GPT-5.2 将向所有 ChatGPT 付费用户开放,并通过 API 提供给开发者。整体分为三个版本:首先是 Instant,速度优化版,适用于信息查询、写作和翻译等常规任务;其次是 Thinking,擅长处理复杂结构化任务,比如编程、分析长文档、数学和规划;以及 Pro,高端版,专注于在高难度任务中提供极致的准确性和可靠性。

GPT-5.2:职场实用主义与经济价值的提升

OpenAI 应用 CEO Fidji Simo 表示,设计 GPT-5.2 就是为了给用户创造更多经济价值,即让 AI 真正能干活。做表格、写 PPT、敲代码、看图、读长文、调用工具、搞定复杂项目,这些都是 GPT-5.2 的拿手好戏。数据显示,平均每个 ChatGPT 企业版用户表示 AI 每天能为他们节省 40 到 60 分钟,重度用户每周能省 10 小时以上。

GPT-5.2 Thinking:多项基准测试刷新纪录

GPT-5.2 Thinking 是这次发布的重头戏。在评估 44 个职业知识型任务的 GDPval (GDPval 测试) 中,它成为首个在总体表现上达到或超过人类专家水平的模型。具体来说,在与行业专家的对比中,GPT-5.2 Thinking 在 70.9% 的任务中胜出或持平,并且完成任务的速度比人类专家快 11 倍,成本还低于 1%。这些任务涵盖了美国 GDP 排名前 9 个行业,包括销售演示文稿、会计报表、急诊排班计划、制造业图纸、短视频制作等真实工作场景。

在编程方面,GPT-5.2 Thinking 在 SWE-Bench Pro (SWE-Bench Pro 测试) 这个相当严格的测试中拿到了 55.6% 的成绩,创下了业界新高。更夸张的是,在 SWE-bench Verified (SWE-bench Verified) 中,它直接达到了 80%,成为目前最高记录。这意味着 GPT-5.2 Thinking 能够更可靠地调试生产环境中的代码、实现功能需求、重构大型代码库,并将端到端的修复工作做得更高效,同时减少人工介入。

前端开发方面也有明显提升,早期测试者表示,它在处理复杂或非常规的前端 UI 任务时表现更出色,特别是涉及 3D 元素的场景。OpenAI 放出了几个根据单一提示生成的示例,包括海浪模拟器、节日贺卡生成器、打字雨游戏,仅需一个提示词即可生成整个单页应用,并具备可调节参数、逼真动画效果和流畅 UI 风格。

事实准确性与长文本处理能力显著增强

在事实准确性方面,GPT-5.2 Thinking 相较于 GPT-5.1 Thinking 的幻觉率更低,在一组匿名化的 ChatGPT 查询中,GPT-5.2 Thinking 出现错误的回答减少了约 30%。对于专业人士来说,这意味着在研究、写作、分析与决策支持等任务中,出错率更低,用起来更加放心。不过,OpenAI 也提醒,像所有模型一样,GPT-5.2 并不完美,关键性的任务还是需要自己进行核查。

在长文本理解方面,GPT-5.2 在 OpenAI MRCRv2 (MRCRv2 基准测试) 中的表现遥遥领先。这个测试评估的是模型能否正确整合分布在长文档中的信息。对于深度文档分析这类涉及数十万 token (token) 的跨文档信息整合任务来说,GPT-5.2 的准确率远超 GPT-5.1。尤其在 MRCR 的 4 针测试中,在最多 256k token 的上下文里,GPT-5.2 是首个接近 100% 准确率的模型。这意味着专业用户可以用 GPT-5.2 来高效处理超长文档,如报告、合同、学术论文、访谈记录,甚至是多文件项目,它都能够在处理上百页内容的同时,保持逻辑一致和信息准确。

视觉理解与工具调用能力大幅提升

在视觉理解方面,GPT-5.2 Thinking 是目前 OpenAI 最强的视觉模型。在图表推理和软件界面理解方面,错误率下降了大约一半。模型被要求识别图像输入中的组件,并返回带有大致边界框的标签。即使在低质量图像上,GPT-5.2 也能识别主要区域,并放置与每个组件真实位置大致匹配的框,而 GPT-5.1 仅标记了几个部分,并且对空间排列的理解要弱得多。这意味着模型能更准确地解读数据仪表盘、产品截图、技术图纸、可视化报告,适合用在金融、运营、工程、设计、客服等以视觉为核心的工作场景。

在空间理解能力和工具调用能力方面,GPT-5.2 Thinking 也有所提升。在 Tau2-bench Telecom (Tau2-bench Telecom 测试) 中,GPT-5.2 Thinking 取得了 98.7% 的新高成绩,展现了在长、多轮任务中可靠使用工具的能力。即使将推理强度设置为最低档,GPT-5.2 的表现仍然显著优于 GPT-5.1 和 GPT-4.1。这代表 GPT-5.2 Thinking 在执行端到端工作流方面更强,无论是处理客户服务、从多个系统中提取数据,还是执行分析任务,都能够高效地完成全流程输出,中间环节更少出错。例如,当询问一个需要多步解决的、复杂的客户服务问题时,GPT-5.2 可以更加有效地协调多个 Agent (Agent) 之间的完整工作流。OpenAI 举了一个实际案例:一位旅客报告了航班延误、错失转机、需要在纽约过夜以及医疗座位的要求。GPT-5.2 不仅管理了整个任务链,包括重新预订、特殊协助座位和赔偿,还提供了比 GPT-5.1 更完整的结果。

数学与科学能力实现硬核突破

数学和科学能力的提升可能是这次发布里最硬核的部分。在 GPQA Diamond (GPQA Diamond 测试) 这种研究生级别的科学问答测试里,覆盖物理、化学、生物学等领域,GPT-5.2 表现明显更强。FrontierMath (FrontierMath 测试) 那种评估专家级数学问题解决能力的基准测试,它也能啃下来,创下解决了 40.3% 问题的新纪录。更牛的是,在 ARC-AGI-1 (ARC-AGI-1 测试) 中,GPT-5.2 Pro 是第一个突破了 90% 准确率的模型,相比去年 o3-preview 的 87%,表现更强,成本却降低了约 390 倍。对于专注于考察流动性推理能力的、更难的 ARC-AGI-2 (ARC-AGI-2 版本),GPT-5.2 Thinking 得分为 52.9%,创下了链式思维模型的得分新高。GPT-5.2 Pro 更进一步,达到 54.2%,进一步扩展了模型推理新颖、抽象问题的能力。

官方博客中提到一个令人印象深刻的案例:在统计学习理论的一个开放问题上,GPT-5.2 Pro 甚至直接给出了一个可行的证明方案。这个问题来自 2019 年学习理论大会 COLT (COLT 上提出的未解难题) 上提出的未解难题。研究人员没有预先设计算法或提供证明思路,也没有输入中间步骤或提示,而是直接请求 GPT-5.2 Pro 给出完整证明,结果模型提出了一种可行的解法,并通过人工验证、外部专家评审确认了解法的正确性。随后,作者还问了一些简单的后续问题,看看这个思路能延伸多远。GPT-5.2 Pro 将结果从原始问题扩展到了更高维度的设置以及其他常见的统计模型。在这个过程中,人类的角色始终都聚焦在验证和清晰的写作上,而不是负责搭建数学推导的框架。这说明 GPT-5.2 Pro 在一些有明确公理基础的领域,比如数学、理论计算机科学,已经可以发挥更实质性的科研辅助作用,包括探索证明路径、验证假设,以及发现隐藏的联系等等。

成本与模型整合

性能表现如此强劲,代价自然也是不小的。相比 GPT-5 和 5.1,GPT-5.2 的输入输出价格贵了整整 40%。尤其是 Thinking 和 Deep Research 模式消耗的算力远超普通的聊天机器人,因为它们需要思考得更深。由于 OpenAI 现在用于模型推理的开销大部分是直接投入,而不是用 微软 Azure (微软 Azure) 的云服务积分抵扣,需要长期投入,所以这种玩法能撑多久,真不好说。

总的来说,GPT-5.2 更像是对前两次模型升级的整合,而不是完全重构。如果说 8 月的 GPT-5 是架构重启,引入了可以在快速响应和深度 Thinking 模式之间切换的路由机制;那么 11 月的 GPT-5.1 让系统变得更温和、更具对话性,也更适合智能体和编码任务;而现在的 GPT-5.2,则是在这些优势的基础上,打造出更可靠的生产级模型。有一个非常重要的细节是,这次推出的三款 GPT-5.2 模型,底层知识库都已经更新到了 2025 年 8 月 31 日。

上线计划与商业化进展

目前,GPT-5.2 已经开始在 ChatGPT 中陆续上线,优先开放给付费用户。GPT-5.1 还会保留在传统模型选项中三个月,之后就正式下线了。API 那边也在同步开放,开发者已经可以用上了。价格比 GPT-5.1 贵一些,但是 OpenAI 说因为 token 效率更高,实际总成本反而更低。

除了模型本身以外,OpenAI 的商业化上也有两个极具反差感的消息。虽然这次发布并没有推出新的图像生成模型,但是今天 OpenAI 跟迪士尼达成了三年的授权协议。用户可以生成包含迪士尼、漫威、皮克斯和星球大战等 200 多个角色的社交视频,部分生成视频还能在 Disney+ (Disney+) 上播放。作为交换,迪士尼向 OpenAI 投资 10 亿美元,还会成为 OpenAI 的重要客户。内容 IP 加 AI 生成,这背后的想象空间确实挺大。

另一个值得关注的消息是,ChatGPT 的成人模式终于有了明确时间表。随着越来越多的 AI 聊天机器人涉足成人内容,OpenAI 也不打算当圣人了。根据 彭博社 (彭博社) 的报道,Fidji Simo 已经明确这个功能预计会在 2026 年的第一季度上线。在此之前,OpenAI 会继续优化年龄识别的功能,确保未成年人自动启用内容保护机制。目前年龄预测模型正在部分国家进行早期测试,用来评估识别青少年的能力,并且确保不会误判成年人。

OpenAI 十年回顾与未来展望

最后,OpenAI 还搞了一波回忆杀,带大家回顾了这十年走过的路。十年前的今天,2015 年 12 月 11 日,OpenAI 正式成立。这十年,他们取得了太多太多突破性的成就:2016 年,开源强化学习平台 OpenAI Gym (OpenAI Gym),成为学界、工业界强化学习研究的基础工具;2018 年,预训练语言模型 GPT (GPT) 诞生,标志着大模型革命的开始;2019 年,1.5B 参数的 GPT-2 出世,自然语言进入爆发式迭代;2020 年,175B 参数的 GPT-3 引爆全网,超大规模模型的时代来临;2021 年,Codex (Codex)DALL·E (DALL·E) 相继发布,代码与图像生成开启;2022 年,ChatGPT (ChatGPT) 真正引爆了全世界的大模型革命。再之后的大事记,大家就都知道了。

Sam Altman 表示,过去的十年非常精彩,OpenAI 的工作比他想象的还要特别。他还剧透,会有一个圣诞小礼物下周上线,大家可以猜一猜会是什么呢?

总之,面对 Google Gemini 的步步紧逼,OpenAI 选择用 GPT-5.2 这套组合拳来回应。它更快、更强,也更像一个成熟的商业产品。与此同时,一边拥抱迪士尼的米老鼠,一边准备推出成人模式,OpenAI 既要保持技术领先,又要快速变现,既要占领企业市场,又不放过任何流量入口。接下来,谷歌和其他对手又将会如何出招呢?让我们拭目以待。

感谢大家观看本期视频,我们下期再见。

📌 文中提及的人物和组织

人物: Sam Altman

公司/组织: OpenAI, Google, Disney, Marvel, Pixar, Bloomberg

产品/模型: GPT-5.2, GPT-5.1, GPT-5, GPT-4.1, GPT-3, GPT-2, Codex, ChatGPT, Gemini 3

媒体/书籍: YouTube, 彭博社