播客获奖与机器人特辑引言
哈喽,大家好,欢迎收听《硅谷101》,我是泓君。有个好消息要告诉大家,我们的播客获得了2025年苹果播客的年度编辑精选,这已经是我们第二次入选苹果的年度精选播客了。对于独立播客来说,苹果一直是一个很重要的分发渠道,它每年的播客评选其实也是业内很有重量级的一个奖。所以今年很开心,也很荣幸能获奖。当然,也希望我们能够继续努力,做出大家更多喜欢听的好内容、好节目。
言归正传,回到我们今天的主题——机器人特辑。上一集我们让中美的投资人从投资的角度分享过他们对机器人的一些观点。其实我们的节目很早就一直在关注机器人这个领域,从谷歌的PaLM-E(Pathways Language Model Embodiment: 谷歌推出的大型具身语言模型)、RT-1(Robotics Transformer 1: 谷歌的第一个机器人Transformer模型)、RT-2(Robotics Transformer 2: 谷歌的第二个机器人Transformer模型)大模型出来的时候,我们就一直在关注机器人的大脑,我们把它称作是模型层。前几个月我们也聊过Physical Intelligence(一家专注于通用机器人AI的公司)的π0和π0.5的开源,也请英伟达的朋友聊过仿真。但还有一个非常关键的环节值得被大家关注,就是灵巧手(Dexterous Hand: 能够进行精细复杂操作的机器人手部系统)。因为业内有一句话是,真正决定机器人上限的不是它走得有多快,而是它的手能做到多细。
今天为了把这样的一个主题讲透,所以我们请了两个不同背景的嘉宾。一个专攻灵巧手的模型与算法,另一个是硬件方向的顶尖人才。今天跟我在一起的嘉宾是UC Berkeley机器人的博士齐浩之。
齐浩之: 你好,泓君。
泓君: 齐浩之马上去芝加哥大学担任助理教授。我知道你之前是在Meta的机器人组做研究科学家,马上也会去亚马逊的组做研究科学家,整个经历还是非常丰富的。
齐浩之: 是,我在这两个地方主要就是做一些机器人和灵巧手相关的研究。
泓君: 对,而且其实伯克利也是一个机器人人才辈出的地方,待会我们可以详细地聊一聊。还有一位是TetherIA的创始人兼CEO陶一伟,他的英文名字是Evan Tao。
陶一伟: 泓君好,大家好。
泓君: Evan之前是在特斯拉的Optimus(擎天柱: 特斯拉开发的人形机器人项目)做高级机器人机械工程师。
陶一伟: 是的,这段经历也非常有趣,我一会期待分享给大家。
灵巧手的发展现状与挑战
泓君: 好,大家对特斯拉的机器人,尤其是灵巧手发展到什么阶段了,我觉得还是非常关注的。那我觉得在开始的时候,我们说到机器人的灵巧手,这个灵巧手到底发展到什么程度了,可能是听众最迷惑的一个部分。因为比如说我们其实看了很多的机器人Demo的展示,大家明明就看到我们现在机器人可以去拿吸尘器,可以去倒垃圾、烧水,甚至把盘子放在洗碗机里。我记得特斯拉它有一年的发布会,擎天柱现场还可以给大家应该是倒酒,就看起来这个手已经是很智能了。所以大家可不可以概括一下,现在机器人的手它能做哪些场景,它到了一个什么样的发展程度?不然浩之先来。
齐浩之: 好的,如果总结来说的话,我会认为大家在有人去指挥的情况下,也就是遥操作(Teleoperation: 人类操作员远程控制机器人执行任务的方式)的情况下,如果这个手的手指不需要很精细的动作,它是一个比较简单的问题。比如说我们今天看到擎天柱倒酒,大家如果注意这个视频里面它手的运动的话,它其实手指之间没有一些交互,也没有一些互相的协作,它就是把手放到出酒的那个把手上,然后往下压。这个在控制上面是会比较简单的。与此相对的是,比如说今天我们想让一个机器人使用我们家庭里面的各种工具,比如说像螺丝刀、像剪刀这样的东西,在这个过程中,我们的手指是需要更加精细灵巧的操作。在这种情况下,它的操作就会变得很难,以及我们需要它适应于可能不只是一家一户,可能是千家万户不同的工具,这个难度就会呈指数级的上升。
泓君: 所以就是说现在机器人它可能你刚刚提到了一个字是精细运动,还有一个我理解就是讲它的泛化能力(Generalization Capability: 机器人适应不同环境和任务的能力),就是把它放在不同的场景中,在这两块是还需要加强的。
齐浩之: 是的,没错。
陶一伟: 对,我这里也稍微补充一点。刚才齐老师可能是从系统端的角度来讲这个问题。我想补充可能是更多地从硬件这方面去切入。一是把现有的硬件方案做得更可靠,就是说让机器人能够在真实的环境中不停地长时间稳定地运行,并且和自然物体的交互在长时间使用中并不会有任何的损坏。这个事情实际上也没有完全地去做到。并且为了从系统的AI角度能控制机器人做更多高精度的任务,这个硬件还是需要继续地去迭代它,就比如增加它的自由度(Degrees of Freedom: 描述机器人关节或物体在空间中运动的独立参数数量),并且增加它的触觉传感(Tactile Sensing: 感知物体接触、压力、纹理等触觉信息的传感器)。从这些角度继续去升级我们现有的硬件产品,并且在这个过程中,由于系统复杂性的增加,同时它的可靠性又变得更大挑战的问题。所以说这也是从硬件端还需要我们去做的很多工作。
泓君: 对,刚刚提到增加它的复杂度、自由度,待会我们可以详细讨论一下,包括特斯拉几代的方案、触觉。浩之应该是这方面顶级的专家了。那在此之前,也可以给听众一个更加形象的例子。Evan其实在今年办我们年会的时候,你们是有来在我们的年会现场去用机器人表演开可乐的。其实我们之前在彩排的时候开可乐,它能不能开成功,它是一个不稳定的状态。比如说当时我也想去试,让这个机器人打开可乐,但是我可能没有任何的经验,我就是随意放的一个角度,可乐它开的那个方向,它并没有对准机器人的手指。这个时候,它可能需要机器人旋转一下,它才能把这个可乐打开。旋转一下这个动作,它对机器人很难吗?
陶一伟: 没错,您提到这个是一个非常好的问题。首先开可乐本身看似可能是只要有一双手,再加上一个指甲就可以实现,但是真正把它放到一个双臂机器人系统上,整个还是非常有挑战的工作。而我们仅仅也只是浅浅地Demo了一下这样的一个事情,但是我们未来还有非常多的工作,怎么样能让这整个的事情变得完全自动地实现起来,并且成功率非常高地去实现,还是一个很长的路要走。刚才您提到的关于可乐怎么最好的我们去对准这个事情,精度是一个方面的问题。实际上还有更多的是在于,首先感知到现在可乐的状态,以及像人你可以实现用任意姿态去抓起这一瓶可乐,然后在手上单手里面调整可乐的角度,去达到一个最完美的状态,让你的另一只手可以过来,又以一个最完美的状态把它拉开。这个机器人还是需要一个过程,包括机器手的硬件设计、控制这些方面的能力。
泓君: 现在世界上有其他的公司,比如说它在自由度上做得更多的,他们能做到很好地去旋转可乐,然后再把它打开吗?
陶一伟: 我觉得一些比较头部的公司去调整优化一下他们的硬件,包括去更多地在这方面下一些工夫,也是可以实现这么一个Demo的。但是目前说让它完全自主去做,我觉得可能还是没有看到哪一家可以去做到。这个可能更多的我要看看齐老师的观点。
泓君: 对对,因为齐老师你好像之前我记得你还有论文是讲用视觉跟触觉做手内旋转的,应该是这方面的顶级专家了。
齐浩之: 我的看法可能是,当然现在大家有不同的宣传策略,或者说他们的一些发展,或者研究的侧重点。比如说对于像陶总这样的硬件厂商,他们可能目标是为了证明他们的硬件非常地好用,无论是从机械结构上,或者说能用它做的一些控制系统上。在这种情况下,去展示一些很炫酷的展示视频是非常好的。与此相对的,还有一些做灵巧手的算法,但是不做灵巧手硬件的,他们可能就会比较少的展示这样方面的能力,而更多的是一种展示它的泛化性这方面的能力。就开可乐这个例子来说,这个例子它可以变得很难,也可以把这个例子变得简单。但是可能就像我觉得陶总刚才也提到,他们的目标可能是最终自主地开可乐,比如说自主地开可乐在任何可乐的朝向,或者可乐在桌面上的排布,这样的情况下是最难的。但是我们也可以通过限制可乐的朝向,以及进行一些远程操作的方式,让拍出视频的难度变得更小一点。就正如陶总所说,如果我们只优化这个视频,有一些头部的硬件厂商,或者算法的研究院,他们可以做出来。但是可能从长远的角度来看,我们更应该专注的是什么样的灵巧手的构型是能够适用于最多种类的任务,以及对于算法的接口最好。
泓君: 对,所以现在浩之根据你的研究,你觉得已经有公司它能做到我随意摆上去,我们不说任何环境、任何场景,我们就说这个可乐罐它的瓶跟它的开口,它不一定是正对着这个机器人的手的,它能把它打开的这样的一些公司吗?
齐浩之: 我觉得现在是没有这样的公司的。如果一个公司他们今天想要完成这个任务,他们可能会从技术上来说,应该可以花几个月去做到这件事情。但是他们可能需要花费非常多的资源和非常多的时间去做这件事情。可能就是出于对他们本身公司路线的考量,他们不会去做这件事情本身,而更像是做一些算法上的改进,让他能够缩短以后想要做这件事情的时间。
泓君: 就是他们不会针对单个的任务去做这种优化,而是他是希望现在在优化的方向是让他适应尽可能多的任务,就是还是更加看重它的泛化性。
齐浩之: 是的。
泓君: 了解。如果照这个来说的话,我印象中之前Figure AI他们放了一些视频出来,大概就是有机器人它能把盘子放进洗碗机里。所以这个视频它可能是拍很多次失败,挑出来的一些成功的案例,还是像你说的它其实是通过遥操,它只是一个展示类的视频,它并不代表机器人拥有这样的一些能力?
齐浩之: 我觉得这里面没有一个确定的信息源吧。但是我觉得现有的算法是可以做到在一个固定的场景下,能比较容易地拍出这种视频。比如说它整个任务的成功率可能有80%-90%。在这种情况下,拍一个视频也是自主完成的,它的难度也没有特别高。但是它距离让这种人形机器人走入千家万户,它可能差的是如何在每一个场景下都可以以100%的成功率去完成这些任务。比如说把盘子放到洗碗机里,很可能90%也是不够的,因为有10个盘子,如果直接碎了一个,这样看大家就不想用这个机器人了。所以可能需要改进的就是成功率以及老生常谈的泛化性的问题。
泓君: 所以我理解现在在灵巧手的问题上,大家关注的也还是泛化性。
陶一伟: 对,我这里也补充一下。实际上我们在每一个任务中,还是要去细分地看一下它整体的难度。因为刚才泓君您提到装洗碗碟和从洗碗机里往外拿,这个任务拆解下来,它主要是机器人拿起碗碟,打开洗碗机的门,然后放进洗碗机的架。这几个还是就像齐老师说的,做简单的抓取物体,并且拉动一些拉杆,这样相对来说比较简单的任务。这个难度实际上跟刚才我们谈到的开可乐还不是一个数量级。因为开可乐仔细去分析这个事情,它实际上是一个用左手或者右手把可乐从桌面上拿起来,调整好罐口方向,再用另外一只手从空气中对准之后,以一个合适的角度卡入拉环,并且以一个合适的角度和力去打开这个可乐。并且在这个过程中,因为它是一个双手对一个物体进行同时操作,你的另外一只手要对抗这个拉可乐的力,对抗的过程中你又要怎么保证你的手指不会产生过大的力,把这个易拉罐给捏爆。这个是一个从整体机器人控制系统上来说,比整个收纳碗碟是更难的非常多的一件事情。
泓君: 简单来说就是碗碟它不需要双手的配合,它可能也会有力跟形状跟抓取的这些问题,但是它的配合度会少了很多,它不会有拉的那个力,对吧?
陶一伟: 没错。
泓君: 是,这样说理解了。所以大家觉得现在如果我们综合来说,整个灵巧手它的瓶颈是在哪?它是整个机器人行业的问题,就比如说我们还是说这个模型的问题、泛化性的问题,还是说灵巧手它除了这个之外,它还是有很多它自己这个行业独有的难题?
陶一伟: 灵巧手我们不能光看它是硬件的一个模块,它能产生它的价值,肯定是要配上至少一个双臂的这么一个系统。这个双臂的系统会形成一个最小可以用来工作的机器人。但是当我们想要真正让它泛化地去在一个环境里执行任务,你就会需要一个移动的底盘、移动的平台。有了这样移动的平台,大家就会说轮式的是不是可以,针对一些可能更复杂的路面情况,包括机器人上下的运动,大家又会说甚至还真的是一个全人形的更合适。所以说真正能让灵巧手有价值,肯定不是简简单单一个硬件模块可以去解决的事情,它的难点肯定是整个机器人到处都是难点。
齐浩之: 经常也会有人问我,做灵巧手最难的地方是什么?我认为现在来看硬件和软件还会有一个很大的提升空间。从软件来说,我的理解是一些比较成熟的在机械臂或者一些轮式机器人上面的算法,就是一些机器学习的算法,当把它们直接应用在灵巧手或者人形机器人这种更复杂系统的时候,它会出现一些之前没有预料到的问题。比如说现在的灵巧手可能有四五个手指,每一个手指有各种各样的关节,每一个关节都可能与这个环境发生交互,与这个物体发生交互。那么怎么能在保证这些交互所产生的一些影响是对我们有利的?比如说我们今天想要抓一个物体,如果我们用一个夹爪去抓,我们只需要考虑两个接触点该怎么去触碰这个物体。但是如果我们现在给了10个接触点,那么这10个接触点该怎么去分别地接触这个物体?有的接触点之间可能是互相对抗的作用,这种情况下在计算复杂度上就会显著地变难。
齐浩之: 第二点就是从硬件层面来说,我开始研究灵巧手可能是2021年、2022年,在那个时候是只有非常少的选择我们可以买到并且还可以用的灵巧手。在最近的一两年吧,我们的灵巧手硬件,尤其是国内厂商,还有美国这边一些造硬件的公司,都有了长足的进步。所以我觉得这方面的瓶颈在逐渐地减少。但是我的预测是还需要几轮的迭代,才能做到一个真正像比如说大家现在能看到的宇树机器人那样,一个逐渐收敛的构型。
泓君: 就现在的灵巧手,就市面上能买到的,大家的形状硬件都各不一样,你其实就要去根据这个硬件调配自己的软件。
齐浩之: 就是以像人的灵巧手居多,但是每一家公司他们的技术路线都会有所不同。像陶总的公司应该是绳驱的技术方案,也有一些公司是把电机放在灵巧手的手指上,这种驱动方案。
灵巧手主流技术路线分析
泓君: 其实说到技术路径,就我知道现在业界比较流行的有几种:一种是连杆驱动(Linkage Drive: 通过刚性连杆机构传递动力和运动的驱动方式)的,一种是绳驱(Cable Drive: 通过拉动柔性绳索来驱动关节运动的机制)的,绳驱还分单向绳驱跟双向绳驱,还有电机驱动(Direct Drive: 电机直接驱动关节,无减速器介入的驱动方式)的。Evan或者浩之,你要不要跟大家简单地介绍一下这些技术路线各自的优劣势是什么?现在业界的主流方向在向哪个方向发展?它有没有收敛的趋势?
陶一伟: 我先从硬件本身这个角度来谈一下,之后可能麻烦齐老师再补充补充从使用者的角度来看,到底哪一种是它更倾向的。首先我们先看三个主要的方式:一个就是连杆,另外一个绳驱,最后一个就是直驱。
陶一伟: 连杆最早应该是大家比较传统意义上那种假肢手,是采取这样的一个结构驱动方式。它通过底下驱动器,无论是直线的推杆、电缸,或者是用蜗轮蜗杆的方式,产生一个旋转运动,最后实现手指弯曲。这是属于传统意义上六自由度的低自由度灵巧手。它更多的是像手的一个形状,但是它的手指的运动轨迹其实相对还是比较低自由度的。它的指尖是跟随一个固定的路线,是个一维的这么一个轨迹。大拇指它的设计也是它侧摆之后,直接正对应食指或者中指之间,它也是通过这么一个固定轨迹的方式去合拢。所以说从使用的角度来说,它似乎和夹爪来说,它的特点并没有那么的明显。这是低自由度连杆手的一个特点。
泓君: 低自由度它一般是会达到多少个自由度?
陶一伟: 一般是六个自由度。
泓君: 六个自由度,差不多就是五个手指这样合拢,还有一个自由度在哪?
陶一伟: 是大拇指的侧面摆动,就是大拇指有两个自由度,其他的手指各一个自由度。
陶一伟: 没错。连杆手实际上还有另外一条路线,也是高自由度的路线。就是之前韩国一篇论文叫ILDA,这篇论文的手基本上思路也是通过一个相对更复杂的连杆方式,把每个手指根部设计出三个主动的直线驱动器,通过也是比较复杂的连杆系统,实现每个手指三个自由度的方式。这样的手的确还是比较先进,但是它可能存在的问题是它的体积还是比较大,并且它所有的零部件进行刚性的连接,使用中缺少一些柔性。这个柔性不仅在抓握物体的过程中感觉并不是非常的柔顺,并且它也会在碰撞的过程中相对来说更容易损坏一些。这是第一个连杆驱动优劣势。
陶一伟: 我第二个谈一下直接驱动的这些方式。直驱(Direct Drive: 电机直接驱动关节,无减速器介入的驱动方式)的灵巧手其实是这一两年才逐渐出现的这么一个方案。实际上现在电机驱动器也有很多的发展,把电机驱动器做得足够小,使得这样的直驱方案变得可行了。因为原来小型的微型电机并没有像现在发展的这么多,尤其是最近市场上有这方面的需求,所以电机做得越来越小,功力密度做得越来越大,使得把电机集成化、小型化变得可行,正好能够在人手的这么一个尺寸下做得还是很不错的。优点我觉得比较明显的就是它的自由度可以做得非常高,它可以在每个关节排布一个驱动器,并且它从控制角度来说,因为是关节和电机直接对应的,是相对来说比较容易去做的。它的缺点可能更多的是一个字,贵。
泓君: 贵。
陶一伟: 我觉得最终可能应该成本也能往下走。但是它更多的一个点在于它把电机做得微小之后,它的减速比(Gear Ratio: 减速器输出轴与输入轴转速之比,影响扭矩和速度)还是相对来说比较高。它大的减速比会使得整个的传动透明性(Transmission Transparency: 驱动系统在运动时对外部力反馈的敏感程度,越透明越能感知外部交互力)比较差一些。也是说它里面的齿轮、零部件都比较精密,也是在实际的应用中可能寿命或者是抗冲击能力会是它的一个问题。并且因为他把他的电机所有的这些零件做得非常小型化,使得它的所有结构都非常需要有高强度的金属结构,这就使得整个手的系统的重量没有办法做得非常的小、轻。所以普遍直驱的灵巧手都是在将近一公斤或者一公斤以上,这个在机器人末端来说还是挺大的一个负载。
泓君: 一公斤的手,那好重,这设计平衡都是一个问题。
陶一伟: 的确,对,这些是它的一些问题。还有一些就是包括刚才提到的可靠性、易维护性,这可能我们还是看一看这个方面的发展。所以它现在算是业界里面从灵活度来说是做得比较高的这样的一种灵巧手。也可以理解成它是能完成更多的精细运动跟复杂动作的类型。因为之前是有人跟我推荐过,说我们应该去聊一聊Sharpa这家公司,就觉得它做得还挺好的,他们好像就用的这种电机直驱的方式。
陶一伟: 没错,他们做得真的是非常的惊艳。
泓君: 怎么个惊艳法?
陶一伟: 它的产品的完成度非常高,感觉它集成的很好,整个工业设计还非常不错。它每个关节有独立的电机,使得它的整个真的是非常灵活。
泓君: 它能做到哪些其他灵巧手做不到的工作,或者只有他们能做的?
齐浩之: 我觉得从展示这个视频的角度来说,他们可能做了一些比如说用相机拍照,比如说有一个双臂灵巧手的系统给大家发牌。这两个是比较惊艳的。
泓君: 双臂灵巧手给大家发牌,发扑克牌?
齐浩之: 对,扑克牌。
泓君: 这个很难。
齐浩之: 这个会比较难。因为比如说我们想象一叠扑克牌的时候,两张牌之间它的间隔很小。当我们自己人手发牌的时候,我们需要控制一个比较精确的力,才能把这个牌从这个牌堆上面拿出来,然后再给大家。如果说碰牌的点不是很准,或者是力太大,很容易一下发很多张牌,或者把牌堆给打散。所以他们做的这个视频还是相当惊艳。如果要一张牌一张牌地发,对手部精细度的要求还是比较高的。
泓君: 对,这个是直驱的方案。还有一种应该是Evan你这边比较熟悉的,就是拉绳跟绳驱的这种方案。
陶一伟: 对的,绳驱的方案其实现在市面上几家主流的公司方案的话也主要分两种,一个是双向拉绳的方案,一个是单向拉绳的方案。双向拉绳主要以最早我们可能都听说过灵巧手的皇冠的明珠吧,Shadow Hand(Shadow Robot Company生产的高级机器人灵巧手)他们的一个产品,是一个15万美金的天价产品,超高26个自由度的灵巧手。他们的方案就是,在每个关节用两根绳同时连到旋转电机的两个方向上,使得旋转电机向顺时针转就是弯曲,逆时针转就是伸直,是这样的一个思路。还有比较类似的另外一款目前开源的手势叫ORCA Hand(苏黎世理工学院开发的开源双向拉绳灵巧手),是苏黎世理工做出来的。他们这个也是非常不错的一款双向拉绳开源的灵巧手方案。
陶一伟: 这样的灵巧手比较大的难度在于一个双向拉绳,一个张紧问题。因为当你一个旋转轴去控制末端的另外一个旋转轴的时候,它需要保持两侧绳的长度一定要是长时间保持不变的。因为如果你稍微有一个绳在使用的过程中材料会产生蠕变,这个蠕变一旦发生,就会有一个松动的现象发生。这个松动的现象使得系统的精度降低,并且比较难以控制。从解决的角度来说,ORCA Hand有一个比较聪明的方式,一个精妙的设计,就是在它驱动器上用了一系列的棘轮机构,使得你可以轻松地去张紧这个绳。但是这个问题也是在于你张紧,你还是是在使用过程中时不时要去调整一下这个东西。这是这个方案比较大的一个难度。还有一点就是这种高自由度灵巧手,其实绳子本身虽然不占太多的体积,但是绳区设计的这个走线实际上在机械设计中它对空间的利用率实际上非常低。它不像是你设计齿轮,或者设计其他类似的方案,你可以说很紧密地把电机排布在一起。你要去考虑到整个绳的走线,整个关节运动中绳的一个范围变化,一个非常动态的事情。所以使得高自由度灵巧手,尤其是绳驱方案,很少有能够全部做在手掌内的。这就使得它的驱动器都要往手腕以下去延伸。像Shadow Hand和ORCA Hand以及特斯拉,实际上我们国内有一家公司源升智能,他们做的绳驱方案是把驱动器全部整合在手掌内,但是这样也的确使得他们手掌的体积稍微还是比较大的。
泓君: 所以特斯拉是双向拉绳,对吧?
陶一伟: 特斯拉是单向拉绳的方案。
泓君: 它是单向拉绳的方案。
陶一伟: 对,说到另外一个主流的方案就是单向拉绳。单向拉绳好处就是说,对于腱绳材料的蠕变它不是那么的敏感,它可以通过算法的方式相对容易地去克服这个事情。但它的缺点就是说它的伸直运动是没有主动的力,相当于是靠弹簧去实现伸直。这个弹簧伸直的过程中,一是这个力相对来说还是比较小的。如果你想要尽量去优化你的抓握力的话,因为你在抓握过程中实际上是跟你的弹簧力一个对抗,你有更强的伸展力,你就浪费掉你的抓握力。但是有的时候人在一些精细的操作,人用手的过程中,反向地推这样的力也的确是有的时候也会有它的作用。但是的确现在这个阶段大家还没有特别考虑到需要这个点,相对来说还是更少的应用场景。
泓君: 更多的就是我们还是在解决抓握的事情,就没有想到张开的事情,是吧?
陶一伟: 对,张开的的确还用得并不是那么多,可以这么说。
泓君: 了解。你们用的是哪种方案?
陶一伟: 我们其实是单向拉绳还有一个直驱方案的混合方案。对,这个我们目前还是属于一个比较保密的状态。反向推你可以想象,你如果去闭着眼睛在你的书包里掏一些东西,你可能需要把其他东西拨开,然后去抓住你想要抓的那个物体。这个的确是需要一个推,但是更多的还是要整手的触觉。所以这个确实是非常难的一个问题了,现在大家都没有去考虑这个事情。
泓君: 对,那业界现在大家在向哪几个方向收敛呢?
陶一伟: 从我看来,硬件上业界现在主要是朝着直驱和单向拉绳这个方向去收敛,包括特斯拉还有我们都是这样的一个方式。直驱的话也是非常惊艳的,连杆的时候可能相对高自由度做的公司会少一些。
泓君: 好,Figure AI他们用的是什么方案?还有Physical Intelligence?
陶一伟: Figure AI我简单看一下他们的专利,可能是一个六自由度的,或许是连杆或者是其他的一些方案的一个手。
泓君: 那浩之有什么补充的,包括你作为使用者你的体验?
齐浩之: 我自己是用过连杆和直驱电机的这两种,我确实没有用过绳驱动的手。我们现在去做机器人+AI大概有两种比较主流的方式。第一种方式就是先用遥操作采数据,去训练一个神经网络去完成某些任务。在这种情况下,比较经典的代表可能是Aloha(A Low-Cost Open-Source Hardware System for Bimanual Teleoperation: 一种低成本双臂遥操作硬件系统),还有像Physical Intelligence的这条路径。另外一条比较主流的路径是,在一个物理的模拟器中去用强化学习(Reinforcement Learning: 机器学习的一种范式,通过与环境交互学习最优策略)去训练这么一个网络,就直接把这个网络从仿真器里面迁移到真实世界。比较成功的案例就是基本上所有大家看到的四足机器人、双足机器人跳舞、走路,都是走的这条技术方案。
齐浩之: 灵巧手的话,任何一种方案在现在这个时间点都有它的缺陷。但是其中的这套从仿真器中训练一个网络,再迁移到真实世界也是非常流行的。所以这个就有一个问题,我们在选择灵巧手的时候,会去衡量它有多容易被仿真。之前我们比如说比较连杆的手以及直驱的手,我们会觉得直驱的手相比于这个连杆的手会容易仿真很多。所以在我们做一些需要高自由度,需要一些用强化学习才能学到的这种灵巧操作的时候,就会选择用直驱的这个手。在之前这种直驱的手,就像刚才Evan说的,它最大的缺陷是当时的电机非常大,也是在最近几年电机才做得越来越小。比如说Sharpa,当时我们觉得Sharpa惊艳的另外一个原因就是说,在Sharpa之前跟人手差不多大小的这种机器人的手,它一般都是要么是连杆驱动,要么是绳驱。对于我们想做的这个技术路线不太适用。所以当时我们觉得它既有人类的大小,又是电机驱动的,很适用于我们做这方面的研究。所以我觉得挺有意思的。
泓君: 如果用仿真的方式去研究灵巧手的话,其实你首先需要这个手长得跟人类的手一样,甚至你的自由度,你的关节数有多少,要跟人类的手越接近越好。
齐浩之: 我有一个点需要补充,它这个仿真更多的是出于比如说我们用这个仿真器的时候,它的物理引擎有多支持这种机械结构。如果是连杆的话,它的机械结构比较复杂,所以仿真器就不太容易很精确地仿真这种机械结构。电机的话,它每一个电机的仿真是非常简单的。然后用直驱的手,它无非就是很多个直驱电机串起来,所以它的仿真没有难度上的增加。所以它其实更多的是从仿真的角度来说,这两种机械结构有一些区别。跟这些机械手跟人手是否相像,可能区别会少一点。我刚才之所以提到它要跟人手差不多大小,更多的是出于比如说我们想要让这些机器人完成一些人才能完成的任务,那么就需要涉及到跟我们现实世界中各种物体的交互。这些物体的形状以及大小都是按照人手设计的。假如说这个机械手太大,它就很难去抓一个比较小的东西。所以从这个方向考虑,我们就是会偏向于好仿真,并且跟人手差不多大小的这种机械手。
灵巧手市场与特斯拉的演进
泓君: 很有意思。刚刚其实大家有提到Sharpa的手,我看它的价格好像是10万美元一只。还有Evan你刚刚提到Shadow Hand的那个手,它是15万美元。谁在买这些这么贵的灵巧手?都是科研机构跟大公司的研发部门吗?
齐浩之: 齐老师应该是可以买得起的。Sharpa应该是5万一只。
泓君: 5万一只,10万两只。它会按对卖吗?还是它现在其实没有两个手的配合?
齐浩之: 应该是可以按对卖的。我的理解是首先这些厂商他们不会靠卖这个硬件去盈利,至少在此时此刻。因为他们还远远没有到量产的那个阶段。他们现在对于这个公司最重要的,可能是先确定他们现在这个构型哪里还值得被优化,接下来再去往一个正确的方向继续迭代。这样的迭代可能还有很多很多轮。他们的这个价钱很多时候我个人的理解,可能是有一些筛选作用在的。他们只想给那些真正对他们的硬件有一个很强烈的需求的人,可能是大厂,或者是突然有一些非常大的来自于政府资助的这些高校。举一个例子,当时Shadow Hand的一个主要客户就是17、18年的OpenAI,他们当时做灵巧手转魔方,他没有足够的财力去支持他们做这样的工作。
泓君: 挺有意思的。我理解其实他们现在也不是靠卖硬件赚钱,还是希望能把这条路跑通。他们其实也是希望能够吸引在上面的开发者,把生态搭起来,让更多的人去用到他们,去改进这个方案。我是这么理解的。Evan可以从硬件从业者的角度来讨论一下。
陶一伟: 或者从我创业者的角度来讨论一下这个事吧。我们公司的商业模式可能还跟他略有不同。因为就像刚才齐老师说的,他是一个走高端学术路线,包括筛选精品客户的角度来做这个事情。的确,像现在泓君您看到很多Demo在应用场景中似乎已经是可以落地。而我们思路是做一款稳定可靠,价格更低,能让真正地做应用端的客户能够很快地去部署的这么一个产品。可能我的自由度,包括整个的性能,包括触觉没有那么的高级。但是我们会去做一款这样的产品,非常的稳定低价,非常有竞争力。这样使得大家可以在落地的过程中逐渐建立起这个生态,帮我们更多地获得和客户的反馈。这是我们从创业公司的角度来说我们的一个策略。
泓君: 并不代表价格比较便宜的灵巧手没有技术含量,也并不代表它没有商业价值。我反而觉得价格低更容易商业化落地,对吧?
陶一伟: 对,其实我觉得很多,就包括垂直领域的机器人,它都不是通用,它可能也很好落地,应用场景也很多。
陶一伟: 没错,就像我们看到Figure的手,它展示的场景已经非常多。更多的实际上是基于现有的硬件,还是更多地需要靠算法能力的提升,打开它很多的潜力。
泓君: 对,Evan其实你进特斯拉的时候应该是在两年多以前,就2023年7月份对吧?正好是特斯拉Optimus手的研发,你要不要跟大家简单介绍一下它整个的手是怎么演进的?
陶一伟: 没问题。其实是最早我加入的时候,当时做手的团队,我们整个Optimus做机械硬件的团队应该大概是十几个人这么一个团队。做手应该是我和另外一个人,主要是负责这个手的项目。实际上外界现在也不是很清楚,当时那一代手是个什么样的方案。是蜗轮蜗杆绳驱方案,六个主动自由度,十一个全关节,这么一个欠驱动(Underactuated: 系统的自由度数量多于其独立驱动器的数量)的一条手。当时其实在内部我们已经是迭代到了第三代。我当时加入的时候,最主要的一个升级就是增加灵巧手的关节编码器(Joint Encoder: 用于测量机器人关节角度或位置的传感器),就是怎么能够捕捉到灵巧手在空间中的位姿。另外一个是增加它的触觉。虽然这两个工作似乎只是电路上的升级,但是从整个系统设计的角度,因为有了这些新的功能的加入,整个灵巧手当时沿用第一代的构型,就使得装配过程中非常困难。其实我当时刚进去的第一个星期的任务,就是带领生产团队亲手去组装这个刚设计好的第三代灵巧手。就是我用内部他们当时叫第三代灵巧手,的确是个非常痛苦的过程。可能一个手我们从早装到晚也装不出来。从没有搞机械的角度来说,可能很难理解。简单来说你可以想象,因为它有一些弹簧在里面,再加上一些电子的电路的东西在里面,你可能需要既压着弹簧,又去穿另外一个东西,再要去保证线是怎么走。就是你每一个工序可能都要花一两个小时在那里慢慢地做。这个实际上就是一个硬件构型设计上还不完善的地方。
泓君: 是你们自己设计的?
陶一伟: 没错,都是自己设计的。
泓君: 就是Tesla自己做的,他也没有用其他的硬件的方案,就相当于他全部是自己设计、自己研发,然后你来正好就是赶上要自己组装这个事情。
陶一伟: 没错没错。其实就是有了这个经历之后,再加上我们和Elon Musk也是经常去给他汇报。Elon Musk实际上当时看到那个第三代的手,他没有特别满意。因为是从外形的设计包括各方面,还是更多的有点像实验室的样机这么一个状态。
泓君: 他想要什么样的?他想要接近于人手的很炫酷的。他是对外形不满意,还是对里面的技术方案不满意?
陶一伟: 他看到的是一个是外形,一个是产能。外形他觉得不是很满意。另外一个产能,当时可能一天只能组装一两台。就是这样的产能太差。所以他其实当时可能在质疑整个的这个设计环节,就是从外形到这个方案,他是不是好落地。
陶一伟: 是的,所以这就是我当时进去的时候,第一个任务就是带领整个项目,把它的手重新设计一遍。和工业设计紧密地去合作,整个把它的结构从里外重新的架构调整了一下,包括很多的设计细节也是我们独创的。这是我们做出来的一个我们内部叫3.1代的手,但对外就是我们所有目前看到的装机还是大规模装机,一直到现在用的这款手。
泓君: 这是你当时在的那一代。现在装一只手要多久?改进以后?
陶一伟: 现在具体的时间我已经不清楚了。但是应该是非常快的。
泓君: 你离开的时候呢?
陶一伟: 离开的时候我记得是一个星期要一百多台。但是是我们的技术工人在现场装。
泓君: 自己有条产线。
陶一伟: 后面其实就是已经建立一个产线了。
泓君: 就我理解你刚进去的那个时候,它产线还没有建立。
陶一伟: 对,从我们工程师的角度来说,我们肯定先要自己先做一遍,先要走一遍这个流程,之后才能交给工人去做。
泓君: 那现在Elon Musk,包括在你在整个特斯拉的过程里面,他对灵巧手的这个问题上,他有提出过哪些他的想法?或者说这个要怎么改,我们要朝哪个方向演进?包括当时我们刚刚其实有提到,特斯拉用的是单向拉绳的方式,他是同意这种方案的吗?
陶一伟: Elon Musk他是非常坚信第一性原理,所以他的很多的指导也是从这个角度来的。去做仿生这样的事情,拉绳的确就像您说的,是单向拉绳的方案。仿生的问题上呢,就我知道特斯拉内部你们其实是做过人体的分析,去看人体是怎么感知力的,就是人的手他是怎么工作的。
陶一伟: 没错没错。首先我们是看了很多生物解剖上面的学术论文,学习了人的肌腱的运动的发力的方式。还有甚至一个小小的故事,就是说我们其中有一个伙伴的妈妈是一个手部的外科医生,我们也正好有这么一个机会去到现场观察真的人手的结构。当时这个经历还是很有趣的。
泓君: 你觉得收获到了什么?或者对你在做这个工程上的启发是什么?
陶一伟: 就是觉得人体非常精妙。心理上也有一些小小的阴影,当你去仔细看到你内部的结构之后,你会觉得人真的非常的脆弱。也可能这么说,你会感觉人体的系统竟然是个这么脆弱,但是人还是能够似乎活着很好。
泓君: 然后你刚刚提到其实你们有看过很多生物学的论文,包括人体是怎么工作的论文。你觉得从人是怎么工作的,到研究灵巧手,到研究灵巧手的工程,你从人的这个工作里面获得的最大的一个启发是什么?或者说整个特斯拉他从人体的工作里面得到的启发是什么?就是有帮助他去做哪些方向的设计?
陶一伟: 其实特斯拉从上一代到未来马上要发的这一代手,最大的一个变化就是把它驱动器从手掌内移到小臂。这个也是借鉴了一部分人的设计。因为人的手指的弯曲的驱动的肌肉是在小臂上的存在。
泓君: 不是在手掌内?
陶一伟: 是在小臂上。其实是都有。所以说这也是我们自己方案和特斯拉有一些差异的点。它的小臂控制更多的是一个大的抓握力的肌肉,你可以这样理解。因为它的肌肉还是比较大的,还是手掌内分布的肌肉更多的是控制手的一个灵巧的精细化的操作运动。
齐浩之: 我有一个比较好奇的问题,刚才Evan也提到了,装配一个绳驱的灵巧手可能要花的时间非常多,而且要非常专业的人去做。我比较好奇的是,它装配的难度相比于直驱电机的这种灵巧手是如何比较的?以及假设将来我们有一个很大规模的生产线,它生产这种直驱的灵巧手和绳驱的灵巧手,它的产能会不会有一个比较大的区别?
陶一伟: 是的,简单来说我认为是这样的。直驱灵巧手因为作为可能更像传统意义上的机械结构,包括机器人系统,它通过传统的一些比较成熟的机械的工艺的方式,可以实现比较容易的装配。简单来说就是你可以通过拧螺丝或者是焊接的这种方式去组装。这样的方式都是已经比较成熟的方式,它既能保证精度,也可以保证整个效率。从绳驱的角度来说,因为腱绳的方案传统意义上这方面的整合的事情就做得不是那么多。所以说这方面是需要整个行业去推进的一个事情。包括腱绳怎么两端固定的驱动器和末端的执行元件的连接,既能保证它生产速度,同时保证它的精度。这个事情大家还是在探索的过程中。但是这个事情最终还是一个工程的问题,它并不是一个基础的科学问题。所以说随着整个行业的推进,我们认为这个事情最终是能被克服的。
泓君: 简单来说其实直驱现在的生产线相比于绳驱更加完善一点。
陶一伟: 没错没错。
灵巧手算法与触觉传感
泓君: 然后我们刚刚其实聊了很多跟灵巧手的硬件相关的问题。那接下来我们可以聊一聊算法层面的,就是浩之,你这边主要在研究的。我注意到其实你在去亚马逊之前,也在Meta的机器人组。就大家可能知道Tesla的机器人、Figure AI、Physical Intelligence,甚至DeepMind都知道,就是它有机器人项目。Meta的机器人项目主要是在研究些什么?
齐浩之: Meta内部可能会有多个机器人项目。其中有一个项目是做人形机器人的,也是今年年初的时候刚刚成立。所以这个可能也是大家为什么还不太知道的原因。他们可能如果是一个一句话总结,可能就是想做一个家用机器人的产品。可能有点像Optimus,有点像Figure。自己从硬件开始做,然后采数据、做算法。另一个机器人的团队是在Fair这个组织下面。Fair就是Meta的基础研究院。在这个机器人组里面,我们主要的目标还是做研究,我们会着重于去研究各种各样的算法,看哪种算法可以让机器人具有最强的灵巧性。然后我在毕业之后加入这个组之后,这个组主要研究的方向也是灵巧手。在过去的几个月里面,我主要研究的是如何从一些人类的视频中学习这些灵巧操作的技能。比如说现在我们大家可能比较了解的是应用一些遥操作的方式。遥操作就是现在我们有一个操作员,他可以戴一些动作捕捉的手套,或者一些动作捕捉的衣服,然后把这些人的动作映射到机器人的手上。但是这样其实可能有一些缺陷。第一个缺陷就是说每一个操作员都要适配一台机器人。那么如果我们想要把机器手操作的数据一直把它推广到像有语言数据那么多,其实是非常困难的。因为没有那么多机器人以及产能不够。所以另外一条路就是说我们能不能根据一些现有的数据,比如说一些视频的数据,有很多视频是包括人去录制自己如何做饭、如何去清理家务,有一些手的动作。我们就想要研究能不能通过让机器人观看这些手的动作,然后让它自己就学会了这些技能。
泓君: 现在表现怎么样?
齐浩之: 现在我会把它归类为它还在研究的阶段。如果我们的目标是想要达到一个最好的效果,那么肯定是直接用遥操作的方式去采集机器人本身的数据会是最好的。但是因为现在我们还没有把从人类视频中学习数据的这个样本数目推广到足够多,我相信从长远来看,这条路径很有可能会取代遥操作。
泓君: 从长远看,就是直接用视频里面的数据,因为它的数据量更大,样本量更高,对不对?
齐浩之: 对。
泓君: 我觉得挺有意思的。而且我注意到之前1X它还发了一个机器人Neo。这个Neo它是可以进家庭,可以帮你做一些基础的家务的。但是很可怕的是,大家是以出卖隐私的方式去让这个机器人工作的。因为每个机器人后面有一个遥操的人在控制这个机器人。那我理解其实这也是他们自己收集数据的一种方式。
齐浩之: 对,没错。就是我的理解是现在还没有一家公司能够把机器人卖到用户的家里,完成他们想要做的任务。所以1X相当于是一种有点像特斯拉在自动驾驶上面的策略,先把车卖给用户,用户去开这个车,开这个车的同时就采集到了数据。只不过是人形机器人的话,用户自己并不能操作这个人形机器人,所以就有一个他们自己的操作员去操作这个机器人。当然他涉及到的一些隐私问题,一些道德层面上的问题,其实都是需要更多地被讨论。
泓君: 你刚刚提到你其实是2021年跟2022年开始去做机器人的这些部分的。那个时候其实GPT-3已经出来了,但是能不能用端到端(End-to-End Model: 输入原始数据,直接输出最终结果,中间不进行人工特征工程的模型)的方式去训练机器人跟灵巧手,我觉得在那个时候它还不是市场的一个主流方向。我们可以说这两年它才慢慢地,至少是特斯拉它的自动驾驶验证了端到端的这种模式,它的性能会有一个很大的提升。我觉得整个业界才开始都往这个方向走。就是你最开始进入到这个行业的时候,2021、2022,大家研究机器人的一些主要的方向在哪里呢?
齐浩之: 我会认为那个时候大家研究的机器人主要是想让机器人在某一个任务上,在有限的泛化性的要求下,去完成这个任务。因为那个时候说实话,其一就是当时硬件也不是很多,能做灵巧手科研的课题组也不是很多。灵巧手这个问题本身大家也没有很想做。其实是特斯拉宣布做人形机器人之后,整个人形机器人行业和这个灵巧手行业迎来了一波爆发,大家才逐渐开始做这个方面。所以大家没有太多的兴趣,就会导致当时灵巧手所能完成的任务也比较的有局限性。所以大家可能还是专注于先把某一个任务做得比较好。然后在后来最近的几年,就有越来越多的人试图用GPT的研究方式去做一些端到端的模型,包括在一些比较简单的机器人本体上也做得还行。就是也有一些初步的验证结果。比如说Physical Intelligence他们就用很大规模的数据,加上遥操作去展示了,这个机器人有很强的能力。但是对于灵巧手的话,有一个更难的地方,就是灵巧手采集数据会比其他机器人采集数据要难很多。
泓君: 你是说手部的数据?
齐浩之: 对,所以即使我们有操作员不停地一直在采集数据,距离到GPT那个等级的数据,或者说Physical Intelligence那个等级的数据,还不是一个非常简单的任务。
泓君: 所以现在市场上在收集遥操采集数据最多的公司是谁?是Physical Intelligence吗?
齐浩之: 我应该不会百分百确定,但是我觉得是这样的。
泓君: 我上次其实有跟他们的研究员聊,他们π0.5好像是说1万多个小时的数据,对吧?就1万多个小时已经算整个机器人行业最大的真实数据集。
齐浩之: 当然这个是高质量的数据。对,肯定有很多公司在收集数据的过程中,他们所产生的数据远超1万个小时。但是还有一个问题就是在于什么样的数据是有用的,对于训练机器人来说。
泓君: 对,所以你们在做这种模型跟算法,因为我知道大家训练机器人是一个整体,就想让机器人有自主操作的能力,包括让它去行走、抓取。我觉得这些都是要有的,包括做各种的姿势动作。你们会是作为一个整体研究,还是说就是针对手也会做单独的模型?
齐浩之: 都有。比如说我们会有一些研究是专门研究比如说灵巧手加上一个机械臂,它能做一些桌面上的抓取操作这样的任务。他可能在这种研究的情况下,他会更加着重于操作的精细性、泛化性。还有一些研究是比如说一个灵巧手在人形机器人上,这个时候他可能会更关注一些人形机器人边移动边操作的一些案例。比如说这个人形机器人开门,或者说这个人形机器人在走路的同时完成一些操作的任务。
泓君: 你觉得在你的印象里,业界最好的机器人的研究团队是哪一家?
齐浩之: 我觉得还是一个各有所长,百花齐放的时候。就是他还没有收敛到我能给一个排名。
泓君: 我喜欢这个回答。因为我其实挺想知道就是你所说的各有所长,每个团队他的长项是在哪里的?
齐浩之: 比如说专注于做研究,然后发表论文的和专注于做产品的,可能要分开讨论一些。比如说前者就是做研究,会发布论文的,可能现在有我现在所在的亚马逊的前沿AI与机器人研究院,以及英伟达的GEAR的研究院。这些是还在研究前线的实验室,包括高校。
泓君: 就比如说你所在的UC Berkeley,对吧?
齐浩之: 这个绝对是业界的一股很重要的力量,也出了很多我们待会可以提到就是这些机器人公司的创始人。
泓君: 对,我刚才说的就是一些业界的公司。当然高校里面现在做机器人和AI的也是处于领先水平的。然后另外的一些更着重于产品的,或者说更着重于一些创业团队的,比如说像特斯拉、Physical Intelligence、1X,最近改变了大家对数据采集的印象的Sunday和Generalist。这些应该都是在这一波机器人浪潮中在头部的一些公司。
泓君: 这些是美国公司了,还有一些国内的公司。所以在你们看来,其实大家专注的整个的细分方向都非常的不一样。
齐浩之: 是的。
泓君: 那我们聊一下你的研究。因为我知道其实你是有在研究用视觉跟触觉去做比如说手内旋转,或者是用两只多手指去学习一些复杂操作的。整体上你的工作其实是证明触觉带来的提升。你能不能简单跟大家解释一下为什么机器人它要有触觉?触觉加进去了以后,机器人多了哪些能力?
齐浩之: 好,我觉得机器人有触觉其实是有几个方面的好处。我之前做过一个比较有趣的实验。在美国这边可以买到那些有一些麻醉凝胶,像牙医做一些小手术,会把那些麻醉凝胶放到牙龈上。我当时就把一些麻醉凝胶放到我的手上。这个是完全无害的,只是有一些时间让你感觉不到一些东西。然后我就去试图在这种情况下去做一些操作。很多时候这个操作也可以被完成,但是就会感觉它做得很慢。因为实际上我是要用我的眼睛仔细地去看我的手到底有没有接触到我想比如说拿一根铅笔,或者说拿一个板擦这种东西。所以我觉得首先有触觉,它能给你更多的信息。就是在一些当你的手指和物体交互的时候,它能给到更精确的信息。比如说我们现在想象一个人形机器人它去进行一些操作,它的手可能拿到了一个东西。这个时候这个视觉一定是很难看到它到底有没有拿到东西的。因为手把这个接触点挡住了。所以天然地来说,在这种情况下触觉会更有用。
泓君: 所以触觉就是加传感器,对不对?
齐浩之: 对,然后另外一个非常有用的点是说它可以控制力的大小。比如说回到最初我们提到的开可乐瓶的例子,刚才Evan提到我们需要一个手用足够多控制住这个可乐瓶的力,但是又不能把它捏爆。另一只手可能就需要去拉可乐瓶的拉环。然后这个拉环当然也是要有一定的角度,就是使力的角度要非常的精确。不然很可能把这个拉环拉断了,但是可乐瓶还没有开。在这种情况下去感知你操作时候它所用的力也是非常重要的。这样感知力最好的方式就是通过一些触觉传感器(Tactile Sensor: 感知物体接触、压力、纹理等触觉信息的传感器)。
泓君: 所以触觉的传感器它是不仅仅能感知到我摸到了这个物体,它还是能感知力的?
齐浩之: 对。
泓君: 感知力这个是怎么做到的?
齐浩之: 现在有各种技术方案,我可能就简单说两三种。比如说我们可以把一些压杆传感器放到手指尖上。然后这个压杆传感器大概就是说当外界给一定的压力的时候,这个电路会产生不一样的电流。然后根据这个电流的大小来判断这个压力有多大。另外的一些方案就比如说有这种叫视触觉传感器(Vision-based Tactile Sensor: 利用光学成像技术感知触觉信息的传感器)。比如说我们现在有一个手指,我们就在手指内部加了一个另外的相机。这个相机会往外看,它会有一些材料能够当手指进行接触的时候产生一些形变。相机就会捕捉到这些形变。当它捕捉到这些形变之后,就可以反向地推断出外界的力是从哪个方向来的,是有多大的力。把这些信息放到一些视觉处理器,或者一些神经网络中,就可以得到我们想要的触觉信号。
陶一伟: 对,我可以稍微再补充一点。关于触觉,刚才齐老师说的主要是在手指或者手表面覆盖的这样的一些触觉传感器。实际上从我们跟客户的交流过程中,另一部分客户比较在意的灵巧手的说,我们说的力反馈信息其实也是来自于驱动器的一个电流的大小。就是说驱动器到底用多大的力来拉动这个手指。这个也是另外一部分比较重要的力反馈信息。这个其实和人类的感知系统也比较类似。因为当人类去抓握物体或者操作物体的时候,人的皮肤表面是有一层的触觉信号,还有另外一层是来自于你的肌肉收缩的感知能力。
泓君: 我觉得挺有意思的,就是我聊了这么多,其实有一个感受是,我们之所以把机器设计得这么复杂,是因为我们对人体跟我们自身一无所知。
齐浩之: 没错没错。
泓君: 对,然后就是我们刚刚讲到了触觉跟几种力的方案。浩之你还有补充的吗?就是解决触觉的这个力的方案你讲完了吗?
齐浩之: 我觉得刚才Evan补充得非常好。就是绳驱这条技术路线一个很大的优势就是在于,它可以比较容易地实现力控。因为它可以通过收缩这个力的大小来达到这一点。
泓君: 你觉得像你这样的一个研究科学家,大概一天能收集多少这种遥操的力的数据呢?
齐浩之: 这个其实很取决于我想要什么样的任务。假如说我现在最简单的用这个手去抓取一个东西,放到另外一个地方,这其实可以收集很多。这个可能就会被局限在我到底累不累。只要我不累,我就可以一直以很高的成功率收集这样的数据。但是比如说一些更难的任务,比如说我现在要去遥操作一个机器人去用剪子剪窗花或者折纸,这种即使是收集一条都非常难。我觉得这个也是一个我们正在做算法的时候,想要去解决的一些任务。就是这种很难去采集数据的任务,那我们能不能用一些其他的算法上的突破去解决这样的任务。
泓君: 所以现在大家主流的方案是跟着视频学?
齐浩之: 对,大家现在有不同的探索路径。视频是其中一条很多人在研究的路径。还有就是用模拟器作为路径。还有一种就有点像最近出的Sunday和Generalist,就是用一些特定的设备去采这样的数据,然后把它转化成机器人可以用的数据。这个其实是从数据不同的收集方式来训练模型的角度去考虑的。
泓君: 我不知道从现在整个业界跟你观察到一些反馈上,哪一种方式是效果更好的?因为我们说遥操它的数据量小,但是它的数据质量非常高。视频的数据它可能就是有,但是它可能缺乏了很多比如说力的这些信息。但是它的优点是它很多。哪一种效果是好的?就是现在这个事情业内有共识吗?
齐浩之: 如果对于一个公司来说,他们还是用遥操做得比较多。因为他们需要追求绝对的效果。用视频数据很多人在研究,但是我觉得它是一种研究的阶段。包括特斯拉最近也发布了他们用人类视频学到的一些操作的视频。但是我觉得从绝对的能力来说,还是不如遥操作的。之所以在这种情况下还要研究视频,是因为大家相信可能在未来的几个月或者一年,或者更久,当视频的量积累到一定程度之后,它的能力可以超过遥操作。但是应该不是此时此刻。
泓君: 可能它追求的东西是不太一样的。精确性就是还是需要遥操的数据,泛化性可能视频也很重要。我不知道我的总结对不对,我只是凭印象。
齐浩之: 对,我觉得可以这么理解。不同的数据它有不同的特征。有的数据就是能让你得到一个比较快的能力上的提升,但是它比较难采集。然后有一些数据是很容易采集,但是大家如何最好地利用它也没有一个定论。我们业界研究的时候会有一个金字塔模型(Pyramid Model: 一种数据分层模型,顶层数据量少但质量高,底层数据量大但质量参差不齐)这样的模型。比如说遥操作它就在金字塔尖,它的量比较少但是很有用。视频的数据可能是在金字塔的底座,就是它非常的多,但是它并不是最能够提升机器人效果的这个数据。
泓君: 中间的部分呢?
齐浩之: 对,就是中间部分有各种各样,比如说有机器,比如说有仿真。
泓君: 对,我记得之前我有在一个活动上跟很多像DeepMind、OpenAI的这些科学家也讨论过,问大家什么样是他们喜欢的方式。包括那天正好其实是Genie3(可能是指某个大型生成式AI模型,具体指代需上下文确认)这个世界模型(World Model: AI系统内部对物理世界运行规律的模拟和预测模型)刚出来。我发现大家分成两派,截然相反的看法。一派是觉得Genie3对整个的机器人行业帮助不大,不是一个很重要的事情。但另一派就会觉得这个事情很重要,它可以帮助训练机器人。
齐浩之: 我觉得从做研究的角度来看,我肯定是觉得这种新的基础模型肯定是有帮助的。只是我们需要找到方式最好地利用它。说它完全没用,肯定有失偏颇。但是我觉得说它我们只需要去训练一个很大的视频生成模型,它就能解决机器人,其实也是不现实的。因为很简单的道理就是现在的视频生成还没有完全解决它的物理的真实性。虽然我们每年都看到它在物理层面上有越来越多的进步,但是我想我之前比较爱举的一个例子是说,假设我们能够靠学习视频模型,把这个预测物理世界会发生什么解决,那这也就意味着我们可以训练这个语言模型,让它能够没有Hallucination(幻觉: AI模型生成不真实或不准确信息的问题)。因为它相当于学到了一些真实数据的物理规则,而并不是说去简单地过拟合这个数据。所以我觉得语言模型我们现在仍然没有解决Hallucination,那我觉得距离视频模型学到真正的物理世界的规律,还是任重而道远。所以我们不能完全依赖于视频模型去训练我们的机器人。但是它可以提供一些很好的初始化也好,或者是一些其他方面的信号,这些都是可以有帮助的。
伯克利的机器人研究与灵巧手的“GPT时刻”
泓君: 好的,对。然后我们聊一聊你博士的高校UC Berkeley。我注意到它的机器人方向是非常强的。比如说像Pieter Abbeel(皮特·阿比尔: UC Berkeley教授,机器人学习领域专家),他是伯克利的教授,然后他自己也做了一家很有名的机器人公司Covariant(一家专注于AI驱动的机器人自动化公司)。他们其实主要就是抓取的问题。那其实还有一位伯克利出来的,就是刚刚我们反复提到的Physical Intelligence的联合创始人Sergey Levine(谢尔盖·莱文: 伯克利教授,强化学习和机器人学习领域专家)。他在RL方向也是非常顶级的。而且我看他之前是不是除了就是Physical Intelligence这家公司自己做的机器人的大脑跟模型,Google之前的几个大模型,比如说像PaLM-E、RT-1、RT-2的研发,他好像也有参与,对吧?
齐浩之: 对,Sergey是之前在当时叫Google Brain,后来叫Google Robotics里面一直在做Research Scientist。所以他就参与了这些大模型的研发。
泓君: 对,基本上是业界最重要的一些机器人的大模型,就基本上都有他的影子。对,所以你觉得像伯克利在机器人领域还有哪些方向是比较强的?
齐浩之: 我觉得伯克利它的AI其实都比较强。比如说它从最早做一些符号AI开始,就有一定的地位。它的计算机视觉也有很多不错的产出。包括现在做机器学习系统,像vLLM(一种用于大型语言模型推理的开源库)和SG Lang(可能是指与vLLM相关的系统或语言模型)都是伯克利的Sky Lab产出的一些结果。所以我觉得整个AI领域伯克利在各个方面都有一些拿得出手的成果。
泓君: 是。然后我注意到这几个非常强的教授也是教授在创业。因为我之前一直听斯坦福,比如说产学研一体,研发人员或者学生创业比较多。伯克利它在政策上是支持学生跟教授创业的吗?
齐浩之: 我觉得伯克利和斯坦福首先对于学生来说,他们当然都是很支持的。因为伯克利和斯坦福都有对应的商学院,可能有一些课就是讲创业的一些事情。其实也有一些计算机系的课也会讲一些关于AI创业的事情。对于教授创业,其实我觉得美国的学校大差不差。比如说这个教授他可以学术休假,或者说可以有一个叫on leave,我不太知道该怎么翻译的事情。就是在这个时候学校是不会过问你的。平常的时候学校一般是要求你只能是20%的时间在非学校的活动上。
泓君: 好的,了解。所以整体上政策还是都比较相近的。
齐浩之: 对,有一些学校可能特别支持,但是因为这个可能是不太会写出来,所以我也不知道他们具体是一个什么样的策略。
泓君: 了解。你觉得伯克利的研究氛围是怎么样的?
齐浩之: 我觉得首先伯克利AI这个方面有一个很好的点,就是做AI研究的人大家都坐在同一层,就像有一个小型的创业公司。所以你很可能无论你今天就比如说我们做机器人,想找一个很懂计算机视觉的人,他可能就坐在离你走几步路就到的这么一个地方。所以大家的讨论会非常的简单,会非常的方便。这样也促进了不同组之间的交流合作。对于很多学生他们可能想合作一个共同的项目。另外一个好处就是伯克利实验室之间的合作是非常自顶向下的。就是如果两个学生想合作,他们的导师基本我没有听说过谁会阻拦。基本就是这两个学生开始合作,慢慢地由这两个学生的合作带动其他导师方向上的合作。就有很多不同方向之间的融合,就是把不同方向之间比较好的一些想法,或者说一些经验都互相结合在一起。
泓君: 对,我刚刚提到的这几位机器人的大神,就我是在你的Google Scholar里面就看见好像都是有跟你共同署名过论文的。
齐浩之: 是的,这个其实也是刚才我提到的这两点带来的一些好处。
泓君: 还挺有意思的。你们觉得实现手部的灵巧动作,我们就说开可乐,回到开始的问题,有多难?它到了一个GPT时刻(GPT Moment: 指某个技术领域达到像GPT-3/4那样具有突破性、泛化性能力的里程碑时刻)吗?
陶一伟: 说不定我觉得还的确是,如果机器人能够真正做到开可乐,是很好的一个benchmark(基准: 用于评估系统性能或能力的标准测试),就是很好的一个标的。达到了GPT时刻,我认为。因为它的确是一个灵巧性的一个综合能力的一个考量。
齐浩之: 对,我可能想稍微说远一点,举一个例子。比如说我们看20年前,其实就有一些能跑步的机器人,就是本田就是Honda的ASIMO(Advanced Step in Innovative Mobility: 本田公司开发的人形机器人)。它已经能在舞台上很好地跑步,上下楼梯。就有很多质疑的声音说,为什么我们过了20多年,这个人形机器人也就能达到20多年前的水平。然后其实中间涉及到一个问题,就是有多简单能够达到这样的水平。就是现有的算法是可以很容易当它达到了这种跑步,然后你就稍微改一些东西,它可以很容易地达到跳舞。这个跟20年前让一个机器人跑步,可能需要一个很多高精尖的团队一起负责迭代几个月或者几年,是完全不一样的。所以我觉得如果我们未来有一个算法,这个算法框架本身确定了以后,它可以用很短的时间让机器人开可乐,它还可以让这个机器人做开门、拧螺丝这样各种各样的任务。那我觉得确实就是GPT时刻了。
泓君: 我们离这样的一个时刻有多远?
齐浩之: 这个预测总感觉会被打脸。我觉得可能还有3-5年。
泓君: 那这个比我想象中快太多了。
陶一伟: 我觉得从硬件的角度、产品的角度,应该是今年内就会产品能够满足这样的能力。
泓君: 你是说在任何场景下开一罐可乐,机器人也可以旋转它,随便放,就是自主操作,不是遥控?
陶一伟: 可以这么说。我认为硬件是非常快能够达到这个。的确硬件是相当于给整个机器人行业提供一个基石,更多它的上限的天花板是要靠软件和背后的模型能力的提升,来释放出整个系统的能力的。据我观察,最近这两年灵巧手实现了一个井喷式的飞跃,感觉有一个非常光明的未来。
泓君: 为什么?你是觉得是因为整个研究的方法变了?
齐浩之: 我觉得有几方面。第一方面就是市场上来说,人形机器人火起来之后,大家首先更容易有一些硬件,更容易有一些能够做复杂硬件的厂商。然后他们去做灵巧手以及人形机器人。其二就是有很多比较简单的本体,像是轮式或者说平行夹爪,他们在科研问题本身做得也比较开始大同小异了。就是没有一个新的爆点。所以大家正在探索在更复杂系统上如何迭代算法,也就是灵巧手和人形机器人。所以我觉得这两点共同促进了整个研究行业的发展。
泓君: 好的,非常期待。今天聊得非常精彩。谢谢两位。
齐浩之: 谢谢泓君。
陶一伟: 谢谢齐老师。
泓君: 谢谢。好了,那这就是我们今天的节目。如果大家关注机器人行业的进展,我们也会在有重大事件节点的时候继续来关注这样的一个话题。欢迎大家持续地关注我们。播客的听众可以通过苹果播客、Spotify还有小宇宙来关注到我们。那如果大家习惯通过视频的渠道来听播客,可以通过B站和YouTube搜索硅谷101播客来关注到我们。也可以在微信公众号上搜索硅谷101来看我们节目的文字版。我是泓君,感谢大家的收听。
📌 文中提及的人物和组织
人物: 泓君, Elon Musk, Sergey Levine
公司/组织: UC Berkeley, Meta, Amazon, Tesla, Figure AI, Physical Intelligence, NVIDIA, OpenAI, Honda, Google Brain, DeepMind
产品/模型: Optimus, Neo, vLLM, Genie3
媒体/书籍: 《硅谷101》, Google Scholar