机器人投资前沿:GPT时刻何时到来?中美竞争与商业化路径 硅谷101播客 2025-11-28

引言:火热赛道下的冷思考

近期,机器人领域新闻频出,引发广泛关注。一方面,硅谷人形机器人初创公司1X发布的家用机器人NEO,凭借精美的广告片迅速走红,但很快便因其背后依赖人类远程操作而受到质疑,这并非我们期待的具有泛化能力的真正机器人。另一方面,高盛的一份研究报告指出,尽管中国机器人公司的股价高涨,但几乎没有一家获得大规模订单。这些公司的产能规划普遍在每年10万至100万台之间,而高盛预测到2035年,全球人形机器人的出货量可能仅为138万台。

尽管存在质疑,但整个具身智能(Embodied Intelligence: 指能够通过物理实体与环境进行交互、感知、学习并执行任务的智能系统)赛道正与AI同步飞速发展,在过去两到三年吸引了大量资金。本文将从投资人视角,探讨如何看待具身智能赛道的泡沫、中美机器人公司的战略异同,以及哪些商业化落地可能较早实现。

机器人赛道的“GPT时刻”何时到来?

从投资视角看,2025年的人形机器人赛道无疑存在一定的过热现象,但这几乎是任何技术大爆发前夜的必然阶段。我们更关注的是,如何在过热中寻找清晰的投资机会。目前,机器人的本体、大脑、小脑、仿真以及世界模型等关键技术曲线正逐渐汇聚,具身智能已不再仅仅是一个概念。

然而,从当前的产品演示来看,无论是1X的NEO还是Figure的机器人,其稳定性和成功率都远未达到市场宣传的水平,在规模化和泛化能力两个关键指标上尚未实现实质性突破。因此,从产品和技术能力来看,目前的估值确实偏高。但若着眼于未来的市场潜力,我们才刚刚触及物理AI的可能性,这个市场的潜力是巨大的,对于风险投资而言,当前的估值是可消化的提前布局。

大家都在等待机器人赛道的GPT时刻(GPT Moment: 指某项技术取得突破性进展,能力发生质的飞跃,并引发大规模应用和行业变革的时刻)。我们认为,这个时刻的到来将分为两个阶段,类似于从GPT-3到ChatGPT的演进。

目前,机器人领域更像是BERT(BERT: Bidirectional Encoder Representations from Transformers,一种基于Transformer架构的预训练语言模型,在2018年定义了清晰的技术路线)时期。我们已经有了清晰的技术路线,例如VLA(Vision-Language-Action: 视觉-语言-行为模型,一种能理解视觉和语言输入并生成相应行为指令的模型)和RT-2等模型指明了方向。

第一个阶段将是“GPT-3时刻”,其标志是“涌现”的出现。2020年的GPT-3模型能够利用海量数据,训练出一个拥有1750亿参数的大模型,展现出惊人的能力。我们期待机器人领域也能出现类似的时刻,即能将现有的各种训练数据有效利用起来,训练出一个在参数和性能上都达到一定规模的模型。

第二个阶段则是“ChatGPT时刻”。ChatGPT在GPT-3的基础上,通过RLHF(Reinforcement Learning from Human Feedback: 从人类反馈中进行强化学习,一种用于微调模型的训练方法)等后期调优,使得模型效果显著提升,真正变得可用。对于机器人而言,这个阶段的标志将是其具备了长动作链的泛化能力。机器人能直接通过语言和视觉接收人类指令,并将其分解为一系列动作来完成,例如“去厨房拿个杯子,倒上水,再放回桌上”,这是一个端到端的泛化过程,而非简单的脚本指令。

不过,机器人要复制ChatGPT在C端用户量的规模性爆发存在难度,因为它涉及软硬件一体化和具体的应用场景。因此,机器人的第二个爆发阶段可能更接近于iPhone的模式:初期增长缓慢,但一旦数据和使用场景建立起来,市场就会迅速扩张并变得稳定而庞大。

中美机器人战略对比:软件定义 vs. 硬件迭代

在中美机器人领域的竞争中,两国公司在战略打法和核心优势上呈现出明显差异。

美国公司,如特斯拉、Figure和Physical Intelligence,更偏向于软件驱动,尤其是在大模型层面。他们倾向于从基础模型出发来驱动具身智能的进步,很多团队带有浓厚的学院派色彩,常以发布突破性论文来引领技术方向。

相比之下,中国公司如宇树科技、智元机器人和优必选,在硬件迭代上拥有显著优势。中国的供应链生态极为成熟,甚至可以实现一天迭代三次硬件产品,这在硅谷是难以想象的。这种快速迭代的能力,使得中国在硬件创新上能够更快地拿出成果。

然而,两者的发展最终需要融合。软件的进步会推动硬件的发展,而硬件的成熟也为软件提供了物理载体。美国的机器人公司在很多时候也需要依赖中国的供应链,而中国的公司则密切关注美国最新的模型进展。特斯拉是一个很好的融合案例,埃隆·马斯克在上海学习中国生产模式多年,并将其应用到Optimus项目中,实现了软硬件的协同发展。

商业化之路:数据飞轮与场景选择的挑战

机器人的商业化进程,本质上是一个数据驱动的冷启动过程。必须先在特定场景中收集足够的数据来训练模型,模型优化后才能更好地服务于该场景,从而形成一个正向循环。

中国在场景和数据的开放性上具有优势。例如,在中国,工厂愿意开放产线数据,让机器人进行大规模部署和学习。这种开放性使得中国的数据飞轮可能比美国更早转动起来。相比之下,美国对数据隐私和生产安全的保护非常严格,这在一定程度上阻碍了机器人数据的收集。

然而,美国市场的ROI(Return on Investment: 投资回报率)更高。一旦机器人能够替代人力,其在物流、养老等场景的商业价值和付费意愿都非常强。

目前,商业化仍处于初期阶段。高盛报告中提到的供应链厂商积极扩产但实际订单寥寥无几的现象,反映了一种“害怕错过”的心理。供应链厂商希望通过提前布局产能来争取未来的订单,而非等待订单驱动。这种现象存在一定的泡沫和风险,尤其是在硬件设计尚未稳定、落地场景尚不清晰的情况下。例如,特斯拉Optimus在年中就曾推翻了原有的硬件设计,导致所有相关订单暂停,给上下游带来了试错成本。

投资逻辑分野:专用设备 vs. 具身智能

在投资逻辑上,机器人领域存在两种不同的路径:一类是传统的先进制造,另一类是新兴的具身智能。

先进制造,如协作机器人、AGV(自动导引运输车)等,本质上是专用设备。它们可以通过增加芯片和控制算法实现智能化,但并不需要海量数据进行大规模模型训练。这类公司的核心是解决特定场景下的自动化问题,其投资逻辑和评估方式与传统制造业类似。

具身智能则完全是数据驱动的,并且大概率是人形的。之所以选择人形,是因为我们能获取的大部分有效数据都与人类活动相关,无论是遥操作、动作捕捉还是视频数据。判断一个公司是否属于具身智能赛道,一个简单的标准就是看它是否需要海量的人类数据来训练模型。具身智能的核心目标是实现“泛化性”,即让一个机器人能够完成多种不同的任务,而不仅仅是重复单一动作。

这两种路径并非相互排斥,而是代表了不同的投资策略。先进制造可以产生巨大的投资回报,但具身智能代表了更长远、更具爆发力的技术突破方向。

技术栈的拆解与展望

具身智能的技术栈非常复杂,包括大脑(基础模型)、小脑(运动控制)、本体(硬件结构)等。从投资角度看,最有价值的部分无疑是“大脑”,即软件定义和数据驱动的部分。无论是做硬件还是做控制算法,都必须紧密跟随“大脑”的技术演进。

关于硬件,虽然供应链已经相对成熟,但其进步往往是线性的,很难出现指数级的爆发。软件的突破往往能够更好地利用现有硬件,甚至降低对硬件的要求。未来的趋势是垂直整合,即软硬件一体化,形成一个完整的系统。

在软件层面,我们正处于从“BERT时刻”迈向“GPT时刻”的关键时期。技术上的突破,如Google的RT-2模型,会直接引发投资热点的转移。因此,关注最新的学术论文,理解技术发展的底层逻辑,对于判断投资方向至关重要。

前路挑战:幻觉、安全与现实差距

当前机器人发展面临几大核心挑战:

  1. AI的“幻觉”问题:目前的大模型,包括Transformer架构,都无法完全避免幻觉(生成不准确或虚构信息)问题。当这种不确定性被应用到与物理世界交互的机器人上时,其执行任务的成功率和安全性就成了巨大挑战。
  2. 数据稀缺与成本:尽管视觉数据丰富,但像触觉、力反馈等关键的传感数据几乎为零。从零开始收集这些多模态数据成本极高,难度巨大。
  3. 安全性问题:现有的人形机器人重量大、运动僵硬,一旦失控或跌倒,可能对周围的人(尤其是老人和小孩)造成严重伤害。在解决这个问题之前,机器人很难真正进入家庭。
  4. Sim-to-Real的差距Sim-to-Real(Simulation-to-Reality: 从仿真到现实,一种将在虚拟环境中训练的模型部署到现实世界的技术)是获取数据的重要补充手段,但仿真环境与真实世界之间始终存在差距。目前,仿真数据的质量和成本效益仍有待提高,无法完全替代真实数据。

未来预测:五年内或迎首个泛化应用

对于未来的发展时间线,一个可能的预测是:未来两到三年,行业可能会经历一次类似上一代AI的泡沫破灭或低谷期。

大约在五年内,我们有望看到机器人领域的“ChatGPT时刻”到来,即第一个真正具备泛化能力的应用场景出现。这个场景很可能首先出现在To B领域,如高度结构化的生产环境或餐厅、零售等商业场景。在这些场景中,机器人可以在人类的监督下执行任务,并逐步建立安全记录和用户的信任感。

至于我们想象中那种能进入家庭、分担家务的通用机器人,可能还需要更长的时间,或许是十年以上。在此期间,世界模型、多模态交互等技术的发展将是关键。最终,机器人产业的成熟将依赖于整个生态系统的协同努力,包括学术界的理论突破和产业界的脏活累活。