AGI 进展与 OpenAI 的技术路线
大家好,这里是最佳拍档,我是大飞。 在最新的专访中,OpenAI 联合创始人兼总裁Greg Brockman 抛出了一系列令人震撼的言论。他说,人类通往 AGI (Artificial General Intelligence) 的路程已经完成了 70% 到 80%;下一代神秘模型 Spud 已经完成了预训练;而 OpenAI 豪掷 1100 亿美元的基建投入,根本不是成本包袱,而是能持续造血的收入中心。
今天我们就来分享一下这期访谈的核心内容。
首先,Greg 为什么敢说 AGI 已经完成了 70% 到 80% 呢?在他的定义里,AGI 并不是指 AI 在所有领域都超越人类,而是能够像人类一样,高效操控电脑处理各类智力工作的通用能力。他提到,如今的 AI 已经在写代码、科学计算等许多核心任务上超越了人类,尽管在一些基础的物理交互任务上还存在短板,但是这种参差不齐的能力表现,并不影响它逼近 AGI 的核心门槛。
更关键的是,OpenAI 已经清晰地看到了通往 AGI 的科技树。Greg 举了一个例子:有一位物理学家被某个难题困扰了许久,将问题提交给 OpenAI 的模型后,仅仅 12 小时就得到了完美的解法。这位物理学家惊叹道:“这是他第一次在一个模型身上,真切地感受到模型是在思考的。” 这种能够攻克人类顶尖智力难题的能力,让 OpenAI 坚信,他们走的路线是完全正确的,纯文本模型的潜力远未枯竭,它终将直通 AGI。
可能有朋友会疑惑,Google DeepMind 的 Demis Hassabis 曾经表示,像视频生成这样需要理解物理世界规律的模型,才更加接近 AGI。如果 OpenAI 专注于 GPT 路线,会不会错失关键进展呢?对此,Greg 给出的答案是:首先,AI 领域的发展必须做出取舍;OpenAI 从创立之初就坚定了自己的路线,只有集中所有力量在同一个方向上,才能形成足够的突破推力。
其次,OpenAI 并没有放弃图像、语音等多模态能力,而是将它们全部统一到了 GPT 架构之下。这一点非常关键,也是 OpenAI 技术战略的核心:大一统技术架构。他们的图像生成技术并没有采用传统的扩散模型,而是基于 GPT 架构开发;语音交互、文本处理也都是同一个核心模型的不同微调版本。这种技术上的高度统一,让 OpenAI 能够将所有研发精力集中在一个点上,实现效能的最大化。
Greg 强调,AGI 的真正强大之处,就在于能将看似毫无关联的应用——无论是科学研究、编程、语音对话还是图像生成——全部装载进同一个极简的技术底座中一举拿下,这也是“通用”二字的真正内涵。
从 Sora 到超级应用:战略聚焦
聊完技术路线,我们再来看看 OpenAI 近期最受关注的战略调整:暂缓 Sora 的大规模投入,转而聚焦超级应用。
在 Greg 看来,这是基于技术现实和算力约束的必然选择。他解释道,Sora 虽然强大,但是它与 GPT 系列模型位于科技树的完全不同分支,构建方式截然不同。在当前算力极度紧张的情况下,同时推进两个完全独立的技术分支是难以为继的。
更重要的是,知识工作领域的 AI 应用即将迎来真正爆发,而机器人技术还没有成熟到大规模部署的阶段。因此,OpenAI 选择将主要精力集中在 GPT 系列上。这并不是放弃 Sora,而是将它纳入到机器人技术的长期研究计划中,等待合适的时机再推进。
这里 Greg 补充了一个背景:OpenAI 面临的算力缺口远比我们想象的要庞大。他回忆道,在 ChatGPT 发布时,团队曾经问他应该购买多少算力,他的回答是“买下所有能买到的”,但即便如此,他们依然无法满足后续爆发式的用户需求。
直到现在,OpenAI 每天都要做出痛苦的抉择:有限的算力应该倾斜给哪个业务?该优先发布哪些功能?在这种情况下,将算力集中投入到回报更快、应用更广泛的 GPT 推理模型和超级应用上,无疑是最理性的商业决策。
超级应用的终极形态
那么,这款被 OpenAI 寄予厚望的超级应用到底是什么样子呢?
Greg 给出了一个画像:它本质上是 ChatGPT 的终极进化形态,一款能够让用户零距离体会 AGI 全能性的终端级应用。未来的聊天框将不复存在,取而代之的是你的私人金牌助理——一个时刻为你着想、深懂你的喜恶、与你的目标高度对齐且极度可靠的 AI。它将成为你在数字世界里的化身与代理人。
这款超级应用将深度整合对话、编程、网络浏览等所有功能,打破不同场景之间的壁垒。比如,你忘了怎么在笔记本上设置触发角,只需一句话吩咐,AI 就会自动帮你调好;你需要做一份复杂的数据分析报告,AI 可以直接连接你的电子表格,提取数据、进行分析并生成可视化图表;甚至你想搭建一个网站,哪怕没有任何编程经验,也能通过自然语言指令,让 AI 完成从代码编写到上线部署的全过程。
这里不得不提 Codex 的进化。这个最初为软件工程师量身定制的代码模型,正在快速走向大众化,变成属于每一个人的 Codex。Greg 分享了一个真实案例:他们公关团队的一位同事,将 Codex 深度绑定到 Slack 和电子邮箱中,系统不仅能自动梳理海量的邮件反馈,还能出色地完成归纳提炼,极大提升了工作效率。还有人利用 Codex 为 Adobe Premiere 编写插件,自动将视频划分为不同章节并启动剪辑流程。这些都是过去难以想象的应用场景。
更重要的是,超级应用将具备长期记忆能力。回顾 ChatGPT 的发展,早期它没有任何记忆机制,每个人点开都是从零开始的同一个 AI,就像在和陌生人对话。而未来的超级应用,能够记住与你的每一次互动,掌握你的上下文语境,从而提供更加精准、个性化的服务。
Greg 透露,超级应用将采取小步快跑、循序渐进的方式推出,最终会分模块兑现完整愿景。第一步将是大幅提升 Codex 在日常知识工作中的易用性。目前 Codex 对于非技术开发者来说门槛还比较高,比如环境配置时的报错提示,不懂代码的用户很难理解。OpenAI 要做的,就是彻底扫除这些使用门槛,让这款绝顶聪明的 AI 真正普惠千行百业。
竞争压力与易用性转向
之所以要这么做,不得不提到 OpenAI 内部的竞争心态和产品转向。自从 2022 年 ChatGPT 发布以来,OpenAI 一直被视为 AI 领域的绝对王者。但是这两年来 Anthropic 等竞争对手的崛起,让市场格局变得愈发激烈。Anthropic 推出的 Claude 应用矩阵,包括聊天机器人、平台和代码助手,已经构建起了超级应用的雏形。这也给 OpenAI 带来了不小的压力。
Greg 并不避讳这种竞争,他坦承道:OpenAI 曾经在最后一公里的易用性上投入不足。过去,他们的模型在编程竞赛中霸榜,但是却没有考虑到真实世界的代码库往往充斥着混乱,也就是常说的“屎山代码”,与实验室里的纯粹环境截然不同。
直到去年年中,OpenAI 才组建突击团队,专门攻克这些现实问题,收集高价值的训练数据,构建高仿真的训练环境,让 AI 真正体会现实中敲代码可能遇到的各种突发状况。
经过一年多的努力,Greg 表示,现在 OpenAI 的产品在盲测中,已经完全追平甚至超越竞争对手,用户内心往往更青睐他们的产品。目前唯一的短板在于前端界面体验,这也是他们接下来要重点解决的问题。
他强调,OpenAI 正在经历一场深刻的转向,将易用性贯穿到端到端的产品设计内核中,而不是先做一个赤裸裸的大模型,再随便套一个外壳。现在,OpenAI 在做前沿研究时,心里就会装着终端产品形态,时刻思考用户将会怎样在现实中使用它。
内部文化:挑战者的心态
这种转向也体现在公司内部的氛围上。Greg 说,OpenAI 最令人恐惧的时刻,是在 ChatGPT 发布后的假日聚会上,他感受到了一种“我们赢了”的氛围。但是他当时就意识到,OpenAI 一直是一个不被看好的弱者(underdog)。竞争对手都是拥有雄厚资本、人力和数据优势的巨头。自满是最大的危险。
因此,即便现在处于领先地位,OpenAI 依然视自己为挑战者。内部已经取消了所有支线任务,所有战略炮火都集中在主线上。
下一代模型 Spud
在这种高度聚焦的状态下,OpenAI 的下一代模型也即将浮出水面。这就是被媒体多次提及的神秘模型 Spud。
关于 Spud,外界有诸多猜测,而 Greg 在专访中首次公开了它的定位:一个新的预训练基础模型,是 OpenAI 过去两年研究心血的结晶。
他详细解释了 OpenAI 的模型开发流程:首先是预训练,生成一个新的基础模型,作为后续改进的地基;随后是强化学习过程,让模型学会应用所学的知识;接着是后训练,让模型在各种不同情境中进行模拟练习;最后是行为对齐与可用性的最后一公里优化。
Spud 就是这个流程中的第一个环节——新的预训练模型。它的出现将为后续的模型迭代奠定坚实基础。
但是 Greg 强调,Spud 只是 OpenAI 技术进步的一个节点,而不是终点。对他们来说,重点从来不在于某一次的单一发布,因为一旦发布某个版本,它很快就会成为后续更强版本的前期基础。OpenAI 追求的是驱动一台不断加速轰鸣的进步引擎,而 Spud 只是这趟旅程中的一步。
Spud 的能力边界与突破
那么,下一代模型到底能实现哪些今天做不到的事情呢?
Greg 给出了具体的描述:它能够解决难得多的问题,表现会更加细致入微,对指令和上下文的理解也会深刻得多。业内经常会谈论一种所谓的大模型气味(Big Model Smell),就是当你面对一个真正更聪明、更强大的模型时,能感受到它在主动贴近你、顺应你。
过去,当你问出一个问题而 AI 没能完全领会时,你不得不费力解释,心里想着“你其实应该能弄明白的”。而这种挫败感在下一代模型中将会大幅减少。
从能力提升来看,下一代模型将实现拔高上限和托起下限的双重突破。
在拔高上限方面,它将能够解决更多开放式的科学难题,制定更长远的时间规划,就像之前帮助物理学家攻克难题那样,在更多领域实现突破性的科学发现。
在托起下限方面,无论你想要做什么微小的事情,它都会变得比以往有用得多,哪怕是写一封邮件、整理一份笔记,AI 都能给出超出预期的结果。
不过,Greg 也提到,普通用户可能不会立刻感受到这种变化。就像 GPT-4 发布时那样,最初公众的反应有些失望,但随着使用场景的深入,才逐渐意识到它的强大。这是因为人类对 AI 的心智模型转变相当缓慢,我们每个人脑海中都预设了一个 AI 能够做什么的边界。只有当 AI 突破这个边界,为我们做到一些极其不可思议的事情时,我们才会真正改变认知。
他分享了一个身边的案例:他的一位朋友患有癌症,医生告诉他病情已经到了晚期,束手无策。但这位朋友通过 ChatGPT 查阅并理解了各种治疗方案,探寻了大量不同的思路,最终凭借这种方式获得了更好的治疗结果。在这类关乎生命的应用场景中,AI 的价值不言而喻,但前提是你要对 AI 能够切实帮到你,抱有一定程度的信念,愿意倾注心力去挖掘它的价值。
Greg 相信,未来这种案例将会越来越多,AI 能为人类排忧解难的事实,将变得对每一个人都显而易见。
自动化 AI 研究员:加速进化
除了面向普通用户的超级应用和下一代模型,OpenAI 还有一个更具野心的计划,那就是推出自动化 AI 研究员,预计今年秋季就能和大家见面。
这个计划被视为加速 AI 自身进化的关键一步,也是 Greg 口中 AI 进入起飞阶段的重要标志。
简单来说,自动化 AI 研究员就是能够自主完成研究科学家全部端到端工作的 AI 系统,只不过这一切都是在硅基芯片上由程序完成的。但这里的自主并非意味着人类彻底放手不管,而是像指导一位初级研究员那样,由资深研究员提供方向和反馈,审查生成的图表,根据愿景给出目标,而 AI 则负责执行具体的研究工作,包括数据分析、实验设计、结果验证等等。
Greg 解释道,AI 进入起飞阶段,意味着它正在指数级增长的曲线上变得越来越强大。其中一个核心原因就是 AI 改进 AI,也就是利用 AI 来加速下一代模型的研发进程。这种正反馈循环将让技术进步的速度,变得前所未有的快。
而自动化 AI 研究员的出现,将进一步放大这种效应,极大地加速大模型的开发和全新研究突破的产生,让这些模型在现实世界中更加实用、好用,迭代速度也会越来越快。
AI 安全与全球治理
但技术的飞速发展必然伴随着风险,这也是公众最关心的问题之一。Greg 毫不避讳地表示,他绝对担心 AI 发展可能带来的安全隐患,因此 OpenAI 把模型的安全红线视为重中之重,正源源不断地倾注海量资源去攻克相关难题。
其中最典型的就是提示词注入攻击。如果打造一个极其聪明、能力超群且连接了海量工具的 AI,必须确保它不会因为某些人输入奇怪的指令而被恶意利用。
他提到,OpenAI 在这方面已经取得了令人瞩目的成果。他们将人类面临的一些问题,比如网络钓鱼攻击,引入 AI 的开发流程中,作为思考的基础。每当开发或发布一个模型时,OpenAI 都会深思熟虑,如何确保它能与人类价值观对齐,并真正为人类所用。
但是他也承认,有些问题并非纯粹的技术难题,也不是 OpenAI 凭一己之力所能解决的,比如如何让所有人都从这项技术中受惠,如何构建全球范围内的 AI 治理体系等等。
面对开源参与者对这场军备竞赛缺乏安全防护的担忧,Greg 提出了**韧性(Resilience)**理念。他认为,与其让一家机构垄断 AI 开发来保证安全,不如构建一个开放的系统,允许成千上万的参与者共同加入进来。就像电力的发展史一样,它本身蕴藏着巨大危险,但是通过制定安全标准、出台法律法规、设立质检体系,我们构建起了完备的安全基础架构。对于 AI 而言,同样需要一场广泛深入的全球对话,让所有人都有权参与其中,决定它的未来,而不是让它成为某个中心化利益集团闭门造车的产物。
AI 对就业市场的影响
聊到这里,我们不得不触及一个更现实的话题:AI 对就业市场的冲击,以及公众对 AI 的普遍恐惧。YouGov 的民调显示,预计 AI 会对社会产生负面影响的美国人,是预计会产生积极影响的三倍。这种恐惧主要来源于两个方面:一是对失业的担忧,二是被科幻文化中渲染的末日负面叙事所误导。
Greg 认为,AI 对职场生态的重塑是一把双刃剑。一方面,AI 将为人类释放不可估量的宝贵时间,打破隔阂、重塑人际纽带,并以前所未有的方式拉平商业门槛,实现真正意义上的创业民主化。未来,创业不再需要庞大的资金和团队,一个人加上 AI 就能完成过去需要一个团队才能做到的事情,比如开发产品、处理后台业务、进行市场推广等。
但另一方面,这也在倒逼人类必须火速完成技能迭代,学会成为驾驭 AI 的新牧羊人。
Greg 说,在变革风暴面前,人们总是更容易看清自己将失去什么,却很难看清自己会得到什么。我们对过去的经验有着深刻的依赖,但人类进化的核心从来都不在于这些具体的技能,而在于创造力、共情能力和建立深层人际连接的能力。
他强调,现在我们每天对着发光屏幕敲敲打打的工作方式,在 100 多年前根本不存在。这种生存状态并不自然。AI 的出现将把人类从机械性的脑力劳动中解放出来,让我们能够回归人类的本质:活在当下,感受身边的世界,与其他情感鲜活的生命建立真正的联结。这也是他对未来感到无比激动和期待的根本原因。
数据中心投资:误解与现实
除了就业问题,公众对 AI 相关基础设施的抵触情绪也不容忽视。皮尤研究中心(Pew) 的民调显示,绝大多数人认为数据中心对当地环境、家庭能源成本以及附近居民的生活质量是弊大于利的。
对此,Greg 进行了正面回应,澄清了公众的许多误解。他以 OpenAI 位于阿比林(Abilene)的数据中心为例:这个设施即便不是全球最大的超级计算机,也是最大之一。但它全年的用水量,仅仅跟一个普通家庭全年的用水量相当,远非外界传言的耗水大户。
在电力方面,OpenAI 明确承诺会自掏腰包,绝不拉高当地居民的用电价格。
更重要的是,数据中心的入驻还能为当地带来实实在在的好处,不仅能带来可观的地税收入,创造大量的就业机会,还能推动当地电网基础设施的升级。
Greg 解释道,如今的电网存在大量闲置电力(Stranded Power),也就是发电量明明足够,但是因为输电网落后而无法被有效利用的能源。数据中心的入驻,为电网升级提供了实质性的理由和资金动力。很多地方因为数据中心的建立,公共事业公司改善了基础设施,反而让当地居民的电费降低了。
OpenAI 正以极其积极的姿态融入社区生态,反哺丰厚的税收红利与就业机会,而不是像外界担心的那样破坏社区环境。
算力作为收入中心
支撑这一切的,是 OpenAI 豪掷 1100 亿美元进行基建投资的底层商业逻辑。很多人质疑,如此巨额的投入是否风险过高。但是 Greg 的观点颠覆了传统认知:他认为算力绝不是成本中心,而是真正的收入中心。
他用一个非常形象的比喻来解释:这就像招募销售人员,只要你的产品供不应求,只要你有规模化的销售渠道,那么你手下的销售人员越多,你赚取的利润就越多。
目前的现实是,OpenAI 建设算力的速度,永远赶不上需求爆炸式增长的步伐。随着社会向 AI 驱动型经济全面转型,全球所有的算力加起来,也无法支撑人人都有专属个人智能体的愿景。因此,提前布局算力基础设施,不仅能满足自身产品的需求,还能通过 C 端订阅与 B 端企业服务构建稳固的盈利飞轮。
Greg 的底气还来自于市场的真实反馈。自 ChatGPT 发布以来,用户对 AI 的需求就持续爆发,而且这种需求已经从个人用户延伸到了企业层面。现在,每家企业都意识到 AI 能带来立竿见影的降本增效,要在未来生存并保持竞争力,就必须全面拥抱 AI。软件工程师们自发使用 AI 的热情,已经蔓延到了企业内部的各种脑力工作场景。这个行业的极高付费意愿和爆炸式的收入增长,已经是板上钉钉的现实。
普通人的 AI 时代应对之道
面对如果预测出现偏差,公司是否会面临破产的尖锐问题,Greg 表示,OpenAI 有多种退路。但他们押注的并不是某一家公司的前途,而是整个赛道的未来。他坚信,只要这项技术能被真正打造出来,就一定能释放出巨大的价值。六个月前,OpenAI 内部就已经看到了 AI 重塑知识工作的清晰趋势。现在证据已然确凿,再过六个月,所有人都会身临其境感受到这种变革。到时候,我们可能会面临一种共同的痛苦:拥有极其强大的模型,却因为算力匮乏而无卡可用。
最后,普通人该如何应对即将到来的 AI 时代呢?
Greg 给出的建议是:重中之重的第一步,是彻底、深度理解这项技术本身。那些从 AI 技术中攫取最大价值的人,都有一个共性,那就是带着极其旺盛的好奇心去探索。你需要尝试将 AI 无缝衔接到你的日常工作流中,并且必须亲身跨过最初的那道认知门槛,也就是克服那种面对一个空白对话框,“我到底该怎么输入”的迷茫与无措。只有真正使用过、体验过,你才能明白 AI 的优势在哪里,局限又在哪里,而不是被外界的恐惧或夸大之词所误导。
其次,要培养出一种主体操控感(Sense of Agency)。这意味着你要建立起一种“我就是项目的经理,我来指引方向,我会发号施令并分配工作,我来把控质量和监督进度的”思维模式。AI 是强大的工具,但它永远不能替代人类的决策和责任。Greg 强调,在人类与智能体的关系中,人类的问责归属是系统的核心。如果你让 AI 建一个网站,结果智能体搞砸了,让用户受到了损失,那并不是智能体的错,而是你的错。因此,你不能当甩手掌柜,必须保持对系统的掌控感,理解它的优劣势,在关键节点进行把控。
最后,也是最核心的一点,明确你自己的渴望。AI 是赋能工具,它能帮你实现目标,但不能替你设定目标。你到底想做什么呢?想解决什么问题呢?想创造什么价值呢?只有将这些内心所想真正勾勒清晰,你才能借助 AI 技术去大展宏图,将想法变为现实。
Greg 在专访的最后表示,他的团队在 AI 领域已经深耕和思考了极其漫长的时间,眼前正在上演的这场技术变革,已经比他们最初设想的更为震撼人心、更能惠及大众,并且必将产生大得多的正面积极影响。
对于那些害怕 AI 的人,他最核心的建议是:亲手试试现在的 AI 工具。只有通过自己的切身体验,你才能真正明白 AI 的价值。这种豁然开朗的感觉,不是听别人描述或者看科幻电影就能比拟的。
结语:拥抱变革
好了,以上就是本次专访的核心内容了。AI 带来的变革已经不可阻挡,它会重塑我们的就业、重构我们的生活。但是最终的走向,依然掌握在每一个人的手中。究竟是被技术淘汰,还是成为驾驭新技术的牧羊人,取决于我们现在的认知和行动。
感谢收看,我们下期再见。