GPT-5.4 深度解读:从对话工具到全能数字员工的跨越式进化 Best Partners TV 2026-03-07

操控未来:原生计算机使用能力与全能型进化

2026年3月6日,OpenAI 正式发布了 GPT-5.4 系列模型,这标志着 AI 从单一功能的强化转向了真正的全能型进化。该系列涵盖了面向 ChatGPT 和 API 的 GPT-5.4 Thinking 版本,以及专为处理极端复杂任务设计的 GPT-5.4 Pro。这是 OpenAI 首次将前沿推理、高效编码与 智能体(Agent: 能够自主理解目标并执行任务的系统)能力深度整合。Sam Altman 在社交平台 X 上指出,GPT-5.4 不仅在知识工作和搜索方面表现卓越,更具备了原生计算机使用能力(Native Computer Use: AI 直接操控操作系统 UI 的能力),支持高达一百万个上下文 Token(Token: 文本处理的最小单位),并能在响应过程中实时调整策略。

此次升级最核心的突破在于其原生计算机使用能力。这意味着 AI 不再仅仅是生成代码供人类执行,而是能像人类一样直接操控电脑。它支持通过 Playwright 编写代码操作浏览器,或直接基于屏幕截图发出鼠标和键盘指令。在 OSWorld-Verified 基准测试中,GPT-5.4 的成功率从前代的 47.3% 飙升至 75.0%,甚至超越了 72.4% 的人类表现。房地产科技公司 Mainstay 的测试数据进一步证实了其实战价值:在房产税门户测试中,GPT-5.4 的尝试成功率高达 100%,且完成速度提升了 3 倍,Token 消耗降低了约 70%。这种能力使其能自主爬取网页数据、自动填充表单、安排日历及发送邮件,全程无需人工干预。

视觉深度感知:重构办公自动化与专业领域壁垒

为了支撑精准的计算机操控,视觉感知能力也迎来了显著飞跃。在 MMMU-Pro 视觉理解测试中,GPT-5.4 在无工具辅助下取得了 81.2% 的成绩。OpenAI 引入了原始图像输入精度模式,支持最高一千零二十四万像素的全保真感知。这种视觉上的“明察秋毫”直接提升了浏览器操作的成功率,在 Online-MindToWeb 测试中,仅凭截图观察的成功率就达到了 92.8%,远超现有的 AtlasAgent 模式。

在更广泛的知识工作领域,GPT-5.4 展示了“灭绝级别”的竞争优势。根据 GDPval 基准测试,该模型在 83.0% 的职业项目上达到或超过了行业专业水平。特别是在电子表格建模这一办公核心场景,其内部测试得分从 68.4% 提升至 87.3%。同步上线的 ChatGPT for Excel 插件允许用户通过自然语言构建复杂的财务模型和情景分析。此外,在 HarveyBigLaw Bench 法律文档评测中,GPT-5.4 的准确率达到 91%,在处理结构化复杂交易和长篇合同时表现出极高的细节处理能力,被业界评价为首个在 APEX-Agents 基准上平均分超过 50% 的顶级模型。

编码极限与百万级上下文的生产力变革

编码能力作为 OpenAI 的传统强项,在 GPT-5.4 上实现了与通用推理、计算机操控的深度融合。它继承并增强了 GPT-5.3-Codex 的优势,在 SWE-bench Pro 软件工程基准上表现卓越,且延迟大幅降低。全新的 fast模式 可提升 1.5 倍的 Token 生成速度。AI 写作助手公司 HyperWrite 的 CEO 评价其编码能力“近乎完美”,甚至标准版在编码任务上已超越了之前的 Pro 版本。在硬核测试中,GPT-5.4 展现了从零构建编译器以及对任天堂 NES ROM 进行逆向工程的惊人逻辑力。

为了应对超大型任务,GPT-5.4 配备了一百万上下文窗口,允许将整个代码库或海量科研文献一次性输入。虽然在 MRCR v2 长文档检索测试中,准确率会随着长度增加(超过 512K 后降至 36.6%)而出现衰减,但在 128K 这一日常工作阈值内,其表现极其稳定。为了优化效能,OpenAI 引入了工具搜索功能:模型不再每次请求都携带完整的工具定义,而是先获取轻量列表,需要时再实时查询。在 MCP Atlas 基准测试中,这种模式在不损失准确率的前提下,使 Token 消耗降低了 47%,显著降低了构建大型 Agent 系统的成本。

科研硬核突破:复杂推理与就业市场的结构性迁徙

在学术与科研层面,GPT-5.4 展现了迈向 通用人工智能(AGI: 具备人类同等或超越人类智能的系统)的潜力。在物理学“地狱级”基准 CritPt 测试中,GPT-5.4 Pro 拿下了 30.0% 的高分,而 2025 年的顶尖模型大多仅有个位数表现。此外,在研究生级多学科问答 GPQA 和竞赛级数学 FrontierMath 中,该系列模型也刷新了纪录。尽管在 HealthBench 健康问答和 Terminal-Bench 终端操作等个别细分领域存在小幅回退,但其整体事实准确性提升了 18% 至 33%,是目前事实性最强的模型。

然而,技术的飞跃也带来了现实的阵痛。伴随 GPT-5.4 的发布,美国科技行业就业人数持续萎缩,岗位蒸发速度甚至超过了 2008 年金融危机。这种“结构性失业”源于头部公司利用 AI 实现了效率倍增——原来五个人的工作,现在只需一个人类配合 AI 即可完成。从投行分析师、资深律师到初级程序员,AI 正在从“对话框里的助手”转变为“坐上工位的数字员工”。GPT-5.4 的定价上涨(API 输入价格上涨超 40%)并未阻止开发者的热情,因为其释放的生产力潜能已彻底改变了商业博弈的底层规则。这场由代码和像素驱动的“白领革命”,正以前所未有的速度重塑人类社会的职业版图。

📌 文中提及的人物和组织