序言:AI传奇人物的探索历程与信念之考
近期,AI Stories频道上线了一部关于AI元老级人物Yann LeCun的个人纪录片。Yann LeCun被誉为“卷积网络之父”、“深度学习三剑客”之一,同时也是Meta(Meta Platforms, Inc.: 脸书母公司)的首席AI科学家。这部纪录片虽然不长,却浓缩了这位AI传奇人物四十年的探索历程,也映射出整个深度学习领域从“无人问津”到“席卷全球”的缩影。值得注意的是,该纪录片上线的时机颇为微妙,正值Meta创始人马克·扎克伯格公开暗示,可能会重新考虑旗下知名开源大模型Llama(Large Language Model Meta AI: Meta开发的开源大型语言模型)的开源策略之际。Yann LeCun一直是开源AI最坚定的倡导者之一,他曾多次表示,选择在Meta工作正是因为其对开源的坚定承诺。因此,如果Meta真的收紧开源策略,这位开源信徒能否继续在Meta找到容身之所,以及扎克伯格任命28岁的Alexander Wang出任Meta首席AI官,都成为了外界关注的焦点。本文将借由这部纪录片,深入探讨Yann LeCun的故事,剖析他如何从法国索邦大学(Sorbonne University: 位于法国巴黎的著名公立研究型大学)的一名“孤独探索者”,成长为改变AI格局的“教父”,并为何始终坚信开源才是AI的未来。
早期探索:反向传播算法的萌芽与质疑
对于不熟悉AI的观众而言,Yann LeCun的名字或许陌生,但在AI圈内,他几乎等同于卷积神经网络(Convolutional Neural Network, CNN: 一种专门用于处理图像等具有网格状拓扑数据的人工神经网络)。这项如今广泛应用于图像识别、自动驾驶、医疗影像等领域的核心技术,正是LeCun在三十多年前奠定的基础。Yann LeCun出生于1960年,是法国裔美籍计算机科学家,除了“卷积网络之父”的称号,他更重要的身份是“深度学习三剑客”之一。另外两位是杰弗里·辛顿(Geoffrey Hinton)和约书亚·本吉奥(Yoshua Bengio)。这三位科学家因“为深度学习的发展奠定了基础,推动了神经网络的复兴”,于2018年共同获得了计算机领域的最高荣誉“图灵奖”。
许多人可能不知道,LeCun在博士阶段就取得了一项影响深远的成就:他提出了一种早期形式的反向传播(Backpropagation: 一种用于训练多层神经网络的算法),专门用于训练多层神经网络。如今,反向传播被公认为是深度学习的“核心引擎”之一,几乎所有深度模型的训练都离不开它。然而,在当时,这个想法不仅不被看好,甚至还被同行嘲笑。上世纪80年代,“神经网络”是一个极其冷门的领域,LeCun在法国索邦大学攻读博士时,整个法国都找不到一个与他研究方向相同的人。他回忆那段日子时说,人们当时都在取笑他们这些研究神经网络的人。
尽管面对嘲笑,LeCun并未退缩,因为他有一个坚定的信念:机器真正的力量不在于被动执行人类编写好的程序,而在于学会自主学习。这正是今天AI的核心思想,但在40年前,这简直是“天方夜谭”。为了寻找突破口,他埋首于当时寥寥几位先驱的论文中,包括约翰·霍普菲尔德(John Hopfield)的霍普菲尔德神经网络(Hopfield Neural Network: 一种循环人工神经网络)、杰弗里·辛顿的玻尔兹曼机(Boltzmann Machine: 一种随机递归神经网络),以及特里·塞诺夫斯基(Terry Sejnowski)的深度置信网络(Deep Belief Network: 由多层“受限玻尔兹曼机”堆叠而成的生成式模型)。他逐渐意识到,要让机器“学会学习”,关键在于破解“多层神经网络的训练难题”,而当时的技术只能训练简单的单层或双层网络,对于稍微复杂一点的多层网络,根本无法有效调整参数。
命运转折:与辛顿的相遇及贝尔实验室的突破
命运的转折点发生在1985年,LeCun参加了一场学术研讨会,并遇到了美国科学家、神经网络领域的早期探索者特里·塞诺夫斯基。塞诺夫斯基在听完LeCun的报告后非常兴奋,回到美国便找到辛顿,告知他有一位法国年轻人正在进行与他们相似的研究。几个月后,杰弗里·辛顿专程前往巴黎,希望了解这位法国年轻人的研究。有趣的是,辛顿当时的法语并不流利,两人的交流主要依靠数学公式。正是这些清晰的公式,让辛顿一眼便看懂了LeCun研究的价值,当即邀请他前往多伦多从事博士后研究。
1987年,LeCun博士毕业后,毫不犹豫地前往加拿大多伦多大学,跟随辛顿进行了一年的博士后研究。这段经历成为他后来学术生涯的关键跳板,因为在多伦多,他不仅能与辛顿直接合作,接触到深度神经网络最前沿的思想,还结识了一批后来同样成为AI领域中坚力量的学者。可以说,正是这段合作,为他后来在贝尔实验室(Bell Labs: 20世纪重要的工业研究实验室)的突破埋下了伏笔。
1988年,LeCun离开多伦多,加入了当时全球科技界的“圣地”——贝尔实验室的自适应系统研究部门。对于年轻一代观众而言,贝尔实验室或许有些陌生,但在20世纪,它绝对是“现代科技的摇篮”,包括晶体管(Transistor: 一种半导体器件)、激光(Laser: 一种通过受激辐射放大光线的装置)、光纤(Optical Fiber: 一种利用光的全反射原理传输光信号的介质)、UNIX操作系统(UNIX Operating System: 一种多用户、多任务的计算机操作系统)和C语言(C Language: 一种通用的高级计算机程序设计语言)等改变世界的发明都诞生于此。当时的贝尔实验室汇聚了全球顶尖的计算机科学家和工程师,对于LeCun来说,这里是将理论想法变为实际产品的最佳舞台。
果不其然,加入贝尔实验室后,LeCun仅用一两个月就取得了一项震惊团队的成果:他开发了一个手写数字识别系统。只要将一张写有数字的纸放在摄像头下,按下按键,系统就能以每秒几个字符的速度准确识别所有数字。这个看似简单的“演示”,后来催生出AI领域最早的商业应用之一——自动读取支票金额的ATM系统。具体来说,LeCun和贝尔实验室的团队基于他提出的卷积神经网络,开发了一套“支票手写体识别系统”。这套系统能自动读取银行支票上的手写数字,例如金额,并将其转化为计算机可处理的信息。在1990年代末,这套系统正式投入商用,被NCR等当时的金融设备巨头部署到全球各地的ATM机上。根据后来统计,这套系统在高峰时期处理了全美国超过10%的支票。要知道,在那之前,银行处理支票完全依靠人工,不仅效率低下,还容易出错。LeCun的技术一下子将金融票据处理的自动化水平提升到了新的高度。
卷积神经网络(CNN)的诞生与推广困境
上述一切的核心正是卷积神经网络。LeCun设计CNN的灵感来源于人类的生物视觉系统。我们的眼睛在观察事物时,会先识别边缘、颜色等简单的特征,再逐层组合成复杂的物体,例如我们会先看到线条,再看到轮廓,最后才能辨认出是“猫”。CNN也是如此,它通过“卷积层”逐层提取图像的低级特征,例如像素或边缘,再通过“池化层”来压缩信息,最后通过“全连接层”完成分类或识别。LeCun将这套架构命名为LeNet(LeNet: Yann LeCun在1980年代末至1990年代初设计的一种卷积神经网络架构),最初就是为了识别手写数字而设计的。
1989年,他发表了一篇著名的论文《利用反向传播算法识别手写邮政编码》(Backpropagation Applied to Handwritten Zip Code Recognition)。在这篇论文中,他详细展示了LeNet如何利用反向传播算法进行训练,以及在手写邮政编码识别任务上的准确率。在当时,这个准确率远远超过了传统的模式识别方法。这篇论文现在被公认为“现代深度卷积网络的起点”,直到今天,我们所使用的ResNet、YOLO等图像识别模型,本质上都是在LeNet的基础上改进而来的。
然而,成功的道路从来不是一帆风顺的。尽管LeCun的技术在实验室里表现出色,但要让整个行业接受它却异常艰难。他在纪录片中解释了背后的原因:当时每个人都使用不同的电脑和操作系统,导致系统很难复现。当时还没有统一的深度学习框架,例如现在的TensorFlow、PyTorch等。要将LeNet部署到不同的硬件上,就需要手动调整大量的代码。再加上当时“神经网络”的名声并不好,许多公司宁愿使用传统的统计方法,也不愿尝试这种“看起来很复杂”的新技术。因此,尽管LeCun手中握着“未来的钥匙”,却很难将其分享给更多的人。这种“不被理解”的状况一直持续到21世纪初。
深度学习的崛起:改名与辛顿的“天才阳谋”
2003年,LeCun已成为纽约大学的教授。他意识到,要让神经网络被更多人接受,仅仅依靠技术改进还不够,“名字”或许也是一个问题。“神经网络”这个词在当时已经与“不可靠”、“难训练”等负面标签绑定在一起。于是,他与杰弗里·辛顿、约书亚·本吉奥等同行做出了一项影响深远的战略决策:将“神经网络”改名为“深度学习”。“深度学习”这个名字一方面突出了“多层网络”的核心特征,即网络的层数多;另一方面也避开了“神经网络”之前的负面标签。
然而,真正让深度学习爆发的,是杰弗里·辛顿策划的一场“天才阳谋”。辛顿当时意识到,要让行业认可深度学习,必须在一个“刚需领域”做出无可辩驳的成绩,而语音识别就是最好的选择。当时,微软、谷歌、IBM三家公司拥有全球最顶级的语音识别引擎,它们使用的都是传统的隐马尔可夫模型(Hidden Markov Model, HMM: 一种统计模型,用于描述含有隐含未知参数的马尔可夫过程),准确率已达到瓶颈。辛顿将自己的三名学生作为实习生,分别送到了这三家公司,给他们的任务只有一个:用深度学习系统替换掉传统引擎里的声学建模(Acoustic Modeling: 语音识别系统中的一个组件,负责将声音信号转换为语音特征)部分,因为声学建模是语音识别的核心,负责将声音信号转化为文字特征。结果超出了所有人的预期,这三名学生开发的深度学习声学模型在所有测试集上的准确率都超过了传统的HMM模型。LeCun在纪录片中提及此事时,忍不住笑称,这手策划真是高明!更关键的是,在那之后不到18个月,深度学习就彻底占领了语音识别领域。几乎每一部智能手机的语音助手,例如苹果的Siri、谷歌的Google Assistant,背后使用的都是深度学习技术。一场“语音识别革命”就此悄无声息地完成,深度学习也从此从“小众技术”变成了“行业标配”。
Meta与开源信念:面临的挑战与坚守
随着深度学习的普及,LeCun的职业生涯也迎来了新的阶段。2013年,他加入了当时还名为Facebook的Meta,负责组建人工智能研究实验室(FAIR: Facebook AI Research,Meta的人工智能研究部门)。2018年,他的头衔进一步提升为“首席AI科学家”,这意味着他不仅要领导FAIR的学术研究,还要参与Meta整个公司的AI战略制定。
LeCun选择Meta的原因,他在纪录片中说得很清楚:因为Meta对开源有着坚定的承诺。这种“开源信念”是LeCun一直以来的核心观点。他在纪录片中站在巴黎的法兰西科学院前表示,我们看到的并非是地区间的竞争,而更多是开放研究、开源世界与闭源生态之间的较量。在他看来,AI的真正进步不在于某个国家或某个公司“垄断技术”,而在于让创新成果普惠大众。开源系统能让全球的开发者共同迭代、改进技术,其速度远远超过闭源生态的“闭门造车”。最典型的例子就是Meta的Llama模型。该模型由巴黎的FAIR团队研发,自从发布以来,下载量已高达8亿次。无数中小企业、科研机构、个人开发者都在使用Llama进行二次开发,有的开发了垂直领域的AI助手,有的优化了模型效率,有的甚至开发了面向边缘设备的轻量化版本。LeCun认为,这才是AI应有的样子,哪个国家处于领先并不重要,重要的是开放研究和开源社区的迭代速度要比那些选择秘不示人的公司更快。
然而,现在这种“开源信念”正面临着考验。扎克伯格最近的表态让外界开始猜测Meta是否会收紧Llama的开源策略。如果Meta真的这么做,LeCun还会继续留在Meta吗?目前他尚未公开回应,但从他过去的言论来看,开源是他的“底线”之一。例如,他曾说过,如果一家公司不再支持开源,那它就不再是我想为之工作的地方。因此,Meta未来的开源策略变化,或许会成为LeCun职业生涯的又一个“转折点”。
AI的未来:安全、增强与新的文艺复兴
除了开源,LeCun对AI的未来还有一个重要观点,那就是他不认同“AI威胁论”。现在很多人担心“AI会失控”、“AI会取代人类”,但LeCun认为这是一种“不必要的恐慌”。他在纪录片中说道,AI失控并不是一个不可避免的宿命,而是一个需要去解决的工程问题,就像制造安全的飞机一样。在他看来,人类在发展技术的过程中,总是能找到控制风险的方法。例如,飞机发明的初期也有很多事故,但现在已经成为最安全的交通工具之一。AI的安全问题本质上也是一样,只要提前设计好“安全护栏”,就能避免风险。
他还犀利地反驳了“智力与统治欲望正相关”的观点。很多人会觉得“AI越聪明,就越想统治人类”,但LeCun表示,看看政界,情况甚至恰恰相反。他提出了一个目标驱动架构(Goal-Driven Architecture: 一种AI设计理念,指AI系统被预设明确目标和安全规则)的设想:未来的AI系统应该被预先设定好明确的“目标”,例如“帮助人类解决疾病”或者“减少碳排放”,同时设置不可逾越的“安全规则”,例如“不能伤害人类”、“不能欺骗人类”等等。他甚至预言,未来不会是“AI统治人类”,而是一种用“我的正义AI”来对抗“你的邪恶AI”的制衡局面,通过不同AI之间的相互监督,来确保技术始终服务于人类。
在纪录片中,LeCun坚定地说道:“我相信社会最终会做出正确的选择,因为民众会提出这样的要求。”在他眼里,AI的终极意义不是“取代人类”,而是“增强人类的智慧”,就像15世纪的印刷机一样。印刷机没有取代人类的写作能力,而是让知识得以更广泛地传播,推动了文艺复兴和科学革命。因此,AI也应该是这样,它能够帮助人类处理繁琐的重复劳动,让我们有更多精力去思考、去创造,最终推动一场新的“文艺复兴”。
生活中的Yann LeCun:爱好与科研的交织
当然,脱下“AI教父”的光环,LeCun也是一个充满生活气息的人。他在纪录片中分享了许多自己的爱好。例如,他从工程师父亲那里继承了动手的能力,从小就痴迷于制造各种飞行器,他说:“我们把它们飞上天,再把它们摔下来,当然不一定是故意的。”现在有空的时候,他还会自己组装无人机,享受从无到有创造东西的乐趣。他还对动物的智慧充满好奇,经常观看关于动物行为学的纪录片。音乐也是他生活中的一个重要部分,品味很广,从古典的巴洛克音乐到现代的硬波普爵士,他都能欣赏。
此外,他对美食也十分执着,尤其怀念巴黎的味道。由于他有四分之一的阿尔萨斯血统,这个法国东北部靠近德国的地区,其饮食文化融合了法德特色。而外祖母做的传统阿尔萨斯炖菜,是他心中“最家乡的味道”。这些爱好其实也影响了他的科研生涯,例如对生物视觉的兴趣让他发明了CNN;对动手的热爱让他更注重技术的实际应用。用他自己的话来说就是:“一个只懂算法的科学家不是一个完整的创造者;只有懂得生活,才能做出真正改变生活的技术。”
结语:笃信的力量,共同书写AI未来
在纪录片的结尾,LeCun将目光投向了年轻一代,说了一段非常恳切的话:“不要让那些负面或者耸人听闻的故事阻碍你前进的脚步。要认识到自己的力量,主动去塑造你所期望的未来。即使是一个简单的想法,只要它对你意义重大,只要你笃信不疑,就能带来改变。未来,取决于你自己。”
这段话其实也是LeCun自己的人生写照。40年前,他在索邦大学研究神经网络时,没人看好他;30年前,他在贝尔实验室推广CNN时,没人相信这项技术能商用;20年前,他和同行将“神经网络”改名为“深度学习”时,没人想到这个名字会改变整个行业。但他始终笃信自己的想法,一步一步坚持下来,最终成为了改变AI历史的人。
因此,对于我们每个人来说,无论是想进入AI领域,还是在其他领域追求梦想,LeCun的故事都告诉我们,真正的创新往往始于“不被理解”,而真正的坚持则源于对自己想法的笃信。AI的未来,也不会是由某一个公司或者某一个国家决定的,它应该是由每一个愿意参与其中、愿意用技术创造价值的人所共同书写的。