机器人终局之战:具身智能的未来与大模型的平行路径 Best Partners TV 2026-05-05

具身智能的终局之战:伟大平行的启示

大家好,这里是最佳拍档,我是大飞。今天这期内容,我们来聊聊有关具身智能(Embodied Intelligence)的话题。

在红杉资本举办的AI Ascent峰会上,英伟达具身智能研究主管、前OpenAI研究科学家、前谷歌大脑成员的Jim Fan,做了一场堪称机器人终局宣言的演讲。在这场演讲中,Jim Fan直接宣告:机器人领域的终局之战已经打响,而打赢这场战争的剧本,早就被大语言模型(Large Language Model: 基于海量文本训练的AI系统)的成功路径给写好了。

可能很多朋友会觉得,机器人不就是机械臂、人形机器人、工厂自动化那一套吗?跟大语言模型有什么关系呢?Jim Fan在演讲里反复强调了一个核心观点:过去我们做机器人,全都走错了方向。我们一直在纠结怎么让机器人更听话、怎么优化远程操作、怎么给机器人加更多的传感器。但真正的破局点,其实在于模型范式和数据范式的彻底重构。简单说,机器人要想做到真正的通用,就必须从远程操作的旧时代,彻底跨越到物理世界模型(Physical World Model)的新时代。

历史的回响与“伟大的平行”

演讲开场,Jim Fan先讲了一个非常有历史感的小故事。时间回到2016年的夏天,在红杉资本的办公室里,走进来一位穿着标志性亮面皮夹克、手臂肌肉线条非常明显的男人——他就是英伟达创始人兼CEO黄仁勋。在这块金属板上,黄仁勋写下了一句话,致埃隆·马斯克(Elon Musk)和OpenAI团队:“为了计算与人类的未来,我向你们献上全球首台DGX-1。”那是当时AI领域最顶级的算力硬件。

Jim Fan说,那是他第一次见到黄仁勋。当时他像所有懂事的实习生一样,赶紧跑过去排队,在这块金属托盘上签下了自己的名字。他还开玩笑地说,你们仔细找,能看到安德烈·卡帕西(Andrej Karpathy)的签名也在上面。这两个人,后来一个成为了OpenAI的核心科学家,一个成为了英伟达具身智能的领军人物,全都被写进了计算机历史。

Jim Fan感慨道,那时候的他,对自己即将参与的这项伟大事业一无所知。但后来的发展,完全印证了OpenAI联合创始人伊利亚·苏茨克维尔(Ilya Sutskever)的那句经典名言:“如果你信仰深度学习,深度学习必不负你。” 深度学习确实给所有人带来了超乎想象的回报。从GPT-3到InstructGPT,再到o1系列模型和如今的AutoResearch,大语言模型只用了短短六年时间,就完成了三次阶跃式跨越,直接杀到了AGI(Artificial General Intelligence: 通用人工智能)的终局之战。

说到这里,Jim Fan半开玩笑地说,他非常嫉妒大语言模型领域的研究者,他们正在享受人生中最好的一场狂欢,驾驭着名为Mythos的模型,一路狂飙冲向AGI。那凭什么机器人技术不能分一杯羹呢?

于是,秉持着一个科学家的尊严,他果断“抄作业”,并且给这套方法起了一个非常响亮的名字——“伟大的平行”(The Great Parallel)。

模型策略:超越VLA,拥抱世界动作模型

什么是“伟大的平行”呢?Jim Fan解释道:既然大语言模型可以通过预测字符串走向成功,那么机器人为什么不能通过预测物理世界的下一个状态也走向成功呢?他认为,把预测下一个词升维成预测下一个物理状态,机器人就可以完全复刻大语言模型的成功路径。先用世界模型做预训练,学习整个物理世界的规律;再通过动作微调,把庞大的物理模拟能力对齐到真实机器人需要执行的具体任务上;最后用强化学习走完最后一公里,让机器人具备自主决策、自主纠错的能力。“打不过,就加入”,这就是Jim Fan的核心逻辑。大语言模型已经验证了这套路径100%可行,机器人没有理由不走这条捷径。因此,Jim Fan将机器人的未来定义为一场全新的“终局之战”。

那么,如何打好这场“终局之战”呢?Jim Fan指出了两个关键:模型策略(Model Strategy)和数据策略(Data Strategy)。

首先,我们来说模型策略,也就是机器人到底该用什么样的模型架构,才能实现刚才说的“伟大的平行”。Jim Fan在演讲里非常直接地宣告:过去三年统治机器人领域的视觉-语言-动作(Vision-Language-Action, VLA)模型,已经走到了尽头。像Pi-zero、GR00T这些经典模型,全都属于VLA范式。这套范式的思路是:先用视觉-语言(VLM)模型做预训练,然后在上面嫁接一个动作头,让机器人根据视觉输入和语言指令输出对应的动作。

但是,Jim Fan毫不客气地指出,VLA模型从根上就有问题。如果我们拆开模型结构就会发现,VLA本质上是LVA模型(语言-视觉-动作模型),因为绝大部分参数都分配给了语言模态,语言是一等公民,视觉和动作只是配角。这种设计让VLA模型非常擅长编码知识和理解名词,但是在处理物理规律、执行动词的时候,完全力不从心。它就像一个头重脚轻的偏科生,重心完全放错了地方。

Jim Fan用一个经典例子说明:把可乐罐移动到泰勒·斯威夫特(Taylor Swift)的照片上,VLA模型确实能做到,也展现出了一定的泛化能力。但这根本不是我们想要的通用机器人能力。我们想要的机器人,是能像人类一样,在完全陌生的环境里,完成从未见过的复杂物理操作,而不是简单地移动物体。

那么,替代VLA的新范式是什么呢?Jim Fan给出的答案是——视频世界模型(Video World Model)。很多人觉得,Sora这类视频生成模型生成的只是AI视频“垃圾”,只能看看猫咪弹班卓琴、看看风景短片,没什么实际价值。但是Jim Fan指出,直到最近大家才恍然大悟,这些视频模型正在内部自动学习模拟下一个世界状态:重力、浮力、光照、反射、折射……所有物理规律都不是人工编码进去的,而是模型通过大规模预测下一个像素块自动涌现出来的。更厉害的是,视觉规划能力也会随之涌现。比如Sora走迷宫,它不是靠算法计算路径,而是在像素空间里直接向前运行物理模拟,自己找到出口。Jim Fan把这种能力称为“物理学垃圾”,但正是这种看似粗糙的物理模拟,恰恰是机器人最需要的核心能力。

问题来了,如何将这种视频世界模型真正应用于机器人?答案是动作微调(Action Fine-tuning)。视频世界模型能预测未来所有可能的物理状态。我们只需要通过微调,将这些无限叠加的可能性,压缩到对真实机器人至关重要的那一小部分状态切片上,让模型不仅能“看见”未来,还能决定机器人该做什么动作。

基于这个思路,英伟达团队直接推出了一个划时代的模型——DreamZero。Jim Fan用非常隆重的语气介绍DreamZero,这是一种全新类型的策略模型,它能够“梦见”未来几秒钟的画面,并且根据这个“梦境”直接做出动作决策。大家要知道,机器人的电机动作是高维连续信号,本质上和视频的像素信号是一模一样的。所以DreamZero可以在渲染视频画面的同时,直接将动作一并渲染出来,联合解码下一个世界状态和下一个动作。

这种设计带来的效果是颠覆性的:DreamZero能够零样本(Zero-shot)解决训练中从未见过的任务和动词。也就是说,机器人没学过某个动作、没见过某个物体、甚至没遇到过某个场景,依然能靠预测未来物理状态直接完成任务。在实验中,研究人员可以把DreamZero正在“梦见”的画面可视化出来,结果非常惊人:视频预测成功,机器人动作就成功;视频出现幻觉,机器人动作直接失败。这意味着,视觉和动作终于在模型中重新回到了一等公民的位置,不再是语言的附庸。

Jim Fan说,DreamZero现阶段还做不到100%成功,但是它就像当年的GPU一样,能够在各种复杂情况下勾勒出正确的动作轮廓。这也是机器人迈向开放提示(Open Prompt)的第一步:你只需要输入文字指令,机器人就能理解并执行,不需要复杂的编程,不需要大量的示范数据。

基于DreamZero,Jim Fan正式提出了新一代模型范式——世界动作模型(World Action Model, WAM)。在演讲现场,他甚至半开玩笑地说:“让我们为曾经的老朋友VLA模型默哀片刻,它们居功至伟,愿它们安息。世界动作模型WAM,万岁!”

数据策略:从远程操作到第一人称视角视频

讲完模型范式,我们再来说数据策略。我们都知道,机器人的智能本质上是数据喂出来的。没有高质量、大规模的数据,再好的模型也是空中楼阁。Jim Fan直接给过去三十年机器人数据采集的主流方式——远程操作(Teleoperation, Teleop)——判了死刑。

他展示了一张照片:英伟达首席科学家比尔·达利(Bill Dally)正在实验室里做遥控操作。Jim Fan调侃说,以比尔·达利的薪水级别,这段操作轨迹绝对是人类历史上最昂贵的遥控操作数据。过去三年,可以说是遥控操作的黄金时代。行业投入了海量资金,研发VR头显、低延迟流媒体、复杂的操控设备,甚至做出了看起来像中世纪刑具一样的外骨骼操控装置。但即便如此,遥控操作依然有一个无法突破的物理极限:那就是每台机器人每天最多24小时。而实际情况更加残酷:一台机器人每天能有效录制3小时数据,就已经是“机器人之神”大发慈悲了。现实情况是,机器人动不动就故障、罢工、停机,数据采集的效率低到令人发指。

那么,如何突破这个瓶颈呢?Jim Fan给出了第一个过渡方案——UMI(Universal Manipulation Interface)。UMI的思路非常巧妙:你直接把机械手戴在自己手上,像人类一样自然操作,直接采集数据,把机器人的躯干排除在数据采集闭环之外。简单说,就是“人怎么动,数据就怎么来”,无需操控机器人,也无需复杂设备。后来团队又升级出Dex UMI,一款可以和五指灵巧机械手一对一映射的外骨骼,采集精细操作数据的速度比传统遥控操作快几十倍,成功率也高得多。使用UMI采集的数据训练机器人策略,甚至可以做到完全零遥控操作数据,直接打破了24小时的物理限制。Jim Fan开玩笑地说,机器人终于不用再被困在数据采集的闭环里,它们都“开心”坏了。

但是,UMI就是终极方案吗?Jim Fan明确表示:不是。他反问现场观众:“在座有开特斯拉(Tesla)或者Waymo的吗?”当你们开车的时候,其实正在为全球最大的物理数据飞轮做贡献。最妙的是,使用FSD全自动驾驶时,数据上传是完全无感的后台过程,你根本察觉不到。对比之下,佩戴UMI外骨骼或数据手套依然非常繁琐,有很强的侵入性,远远达不到开车上班那种无缝、自然的状态。所以,机器人领域必须有自己的FSD等效方案,数据采集必须隐于无形、退居幕后。只有这样,才能在各行各业、所有创造经济价值的劳动中,完美捕捉人类所有的灵巧操作。

最终,Jim Fan给出了机器人数据的终极答案:人类第一人称视角视频(Egocentric Videos)。英伟达团队为此专门打造了一套系统,名叫EgoScale。EgoScale的训练数据,99.9%都来自人类第一人称视角视频。研究团队用了2.1万小时真实世界的人类第一人称数据进行预训练,全程没有使用任何机器人数据。预训练目标是预测人类的手部关节和手腕姿态。到了动作微调阶段,只需采集50小时高精度动捕数据,再加上4小时的遥控操作数据(占比不到0.1%),就足够了。依靠这种数据范式,EgoScale可以泛化到各种极度灵巧的任务,比如分类扑克牌、操作注射器转移液体,甚至一次性学习叠不同款式的衬衫。Jim Fan畅想,未来机器人护士走进家庭,这些基础操作将是必备技能。

而EgoScale研究中最震撼的发现,是机器人领域的Scaling Laws(规模法则)。Jim Fan说,在灵巧任务的训练时长和最优验证损失之间,存在一条极其清晰的对数线性关系曲线。这是大语言模型提出Scaling Laws 6年后,机器人领域首次得到完全对应的数学规律。这意味着,机器人的进化,和大语言模型一样,是可预测、可规模化,可以通过算力与数据持续放大的。他用图表展示:X轴是与机器人硬件的对齐度,Y轴是可扩展性。遥控操作的可扩展性最差;UMI这类数据穿戴设备可支撑数十万小时数据;而第一人称视角视频,若启动类似FSD的数据飞轮,未来一年数据量能轻松突破1000万小时。

基于这个规律,Jim Fan做出了明确预测:未来一两年,遥控操作占比将持续下降,直到几乎可以忽略不计;市场将出现大量针对不同硬件的穿戴数据设备;而最终,机器人技术的核心数据养料,一定是第一人称视角视频。演讲至此,他再次半开玩笑地说:“让我们为亲爱的老朋友‘遥控操作’默哀片刻,你曾立下汗马功劳,安息吧。传感器化的人类数据,万岁!”

规模化强化学习:从Real-to-Sim-to-Real到DreamDojo

在讲完数据策略之后,相信很多人会有一个疑问:就算有了世界动作模型、有了海量人类数据,机器人的强化学习怎么规模化呢?总不能造100万台实体机器人去跑强化学习吧?那成本就高到天上去了。

不过,Jim Fan早就想到了完美的解决方案:那就是Real-to-Sim-to-Real(真实到模拟再到真实)终极闭环 + DreamDojo神经模拟器。

先看Real-to-Sim-to-Real:现在只需用一台iPhone,对真实世界的物理对象拍张照片、做一次3D扫描,就能将所有物体提取出来,在物理引擎里自动重建可交互的数字孪生。这些数字孪生物体是可以被机器人操作、移动、碰撞的,和真实世界几乎没有区别。然后,我们可以在模拟环境里,用这些“数字表亲”做无限数据增强。iPhone直接变成了一台口袋级世界扫描仪,我们就这样把物理世界批量移植到数字世界,从而解决了强化学习最缺乏的环境问题。

但是,传统图形引擎仍有局限,能否做得更好呢?答案是DreamDojo。DreamDojo是英伟达团队打造的全功能神经模拟器,它直接将视频世界模型转化为模拟器:输入连续的动作信号,实时输出下一帧RGB图像和传感器状态。DreamDojo中的每一个像素都不是真实拍摄的,而是模型生成的。最厉害的是,整个过程完全不需要物理方程,也不需要图形引擎,纯靠数据驱动就能捕捉不同机器人的物理机制。

这意味着,机器人的大规模并行强化学习,再也不需要海量实体机器人。只需少量的实体机器人工作站、一批做世界扫描的图形算力,以及海量跑世界模型的推理算力。Jim Fan总结出一句终极公式:“算力即环境,环境即数据”。这句话直接道破了未来机器人竞争的核心壁垒。

终局里程碑:物理图灵测试、API与自动研究

讲到这里,整场演讲进入最高潮:机器人技术的终局,以及三大终极里程碑。Jim Fan说,他喜欢把研究比作解锁《文明》游戏里的科技树成就。对于机器人来说,有三个终极成就,一旦全部解锁,这场终局之战就彻底打完了。

第一个里程碑:通过物理图灵测试(Physical Turing Test)。什么是物理图灵测试?简单说,在各种各样的活动中,人类无法分辨一项任务是人类做的还是机器人做的。其核心标准是:投入单位能量,稳定产出单位劳动。这样一来,机器人不再需要大量维护、能耗、人工干预,而是像人类工人一样,低成本、高效率、稳定地输出劳动价值。Jim Fan自信预测,2到3年之内,就能通过物理图灵测试。

第二个里程碑:构建物理API(Physical API)。当我们拥有一整支机器人大军时,它们可以像软件一样,通过API和命令行统一配置与统筹调度。未来,这些机器人将由OPUS 9.0这样的系统统一编排,打造出完全自主运行的“黑灯工厂”(Lights-out Factories)。这些工厂就是未来的“原子打印机”:输入Markdown设计图纸,完全自主输出成品。除此之外,还有能自动做化学、生物、医学实验的“湿实验室”,彻底解放科研生产力。

第三个里程碑:实现物理的自动研究(Physical Auto-research)。这是最科幻、也最震撼的终局目标:机器人开始自主设计、自主改进、自主制造出远超人类能力极限的下一代机器人。机器人不再是人类的工具,而是能自我进化的智能体。

很多人一定会问:这真的能在有生之年实现吗?Jim Fan给出了一个极具说服力的时间逻辑:从2012年AlexNet首次前向传播(一个连猫狗都勉强分清的模型),到2026年探讨智能体自动研究,只用了14年。2026年正好是2012年和2040年的中点,而科技发展不是线性的,是指数级爆发的。因此,他有95%的把握断言,2040年之前,我们将走完机器人终局之战的全部历程,抵达科技树的顶点。

演讲最后,Jim Fan说了一段非常有情怀、也很有力量的话。他说,我们这一代人,若生得太晚,可能已经无缘探索地球的未知疆域;若生得太早,也许还无法真正启航浩瀚星辰。但是,我们生逢其时,恰好能够亲手攻克机器人技术的终极命题。这仿佛正好回应了他在演讲开头所说的那句话:“如果你信仰机器人技术,机器人技术也必将不负于你。”

好了,以上就是本期视频的全部内容了。如果你对具身智能、世界模型、机器人技术感兴趣,欢迎在评论区留言讨论。感谢收看,我们下期再见。

📌 文中提及的人物和组织

人物: Jim Fan

公司/组织: Nvidia

产品/模型: DreamZero, World Action Model

关键字: embodied-intelligence robotics world-models scaling-laws physical-api auto-research