AI的未来:从脆弱心智到经验时代 Best Partners TV 2026-02-16

大家好,这里是最佳拍档。这期视频恰逢农历春节前夕,在此提前祝愿频道观众新春快乐,万事如意。

近期,图灵奖得主、强化学习之父理查德·萨顿(Richard Sutton)在洛杉矶加州大学发表了一场题为《AI的未来》的重磅演讲。他以“正本清源”的视角,深入剖析了AI的本质、管控逻辑与哲学价值,并犀利地指出当前AI领域“理解不足、调参有余”,认为基于人类数据的AI仅是“脆弱的心智”,而真正的智能未来蕴藏于“从经验中持续学习的能力”。本期视频将拆解萨顿的这场演讲,共同探寻AI与人类的终极关系。

AI的本质:理解不足

演讲伊始,萨顿便向整个AI领域抛出了一个灵魂拷问:在AI飞速发展的表象下,我们是否真正看清了其本质?他承认过去数年AI取得了显著的技术突破,但认为这些突破不等同于智能的本质进步,甚至与我们对心智的定义相去甚远。萨顿提出一个关键问题:真正的心智在进行智能活动时,是否一定要生成图像?答案显然是否定的。人类大脑处理图像,但从不主动生成。图像和视频的生成本质上是消耗算力的复杂工程任务,而非智能的核心功能。

萨顿进一步指出,当前AI的绝大多数应用,究其本质是超大规模计算与超大规模模式识别的结合,它们是针对特定场景的功能实现,而非对智能本质的探索。他直言,将这些复杂计算称为智能,只是为了让工程听起来更宏大。抛开表面的技术突破,回归AI作为一门科学的本质,其发展令人失望。我们至今未真正掌握心智的运行原理和智能的底层法则,整个领域陷入了无休止的调参和数据堆砌,缺乏底层理论突破。这正是他所指的“理解不足、调参有余”的核心内涵。

在萨顿看来,当前所有AI模型,即使掌握了人类全部知识,本质上都是脆弱的心智。它们存在不可靠、无法专注、思维游离等致命问题,仅仅是知识的储存器和搬运工,而非真正的思考者。它们在智能本质层面并不强大,这打破了许多人对当前AI的美好想象,却为行业敲响了警钟。脱离对智能本质的理解,单纯的参数竞赛和数据堆砌终将触及天花板。

智能的定义与核心

要探索AI的未来,首先必须明确“什么是智能?”。这是AI领域诞生以来反复探讨的话题。萨顿梳理了多位权威学者的经典定义,为我们厘清了智能的核心内涵。

最早的经典解读来自心理学之父威廉·詹姆斯(William James)。他在1890年的《心理学原理》中,虽未直接定义智能,但对心智特征的描述——“通过多变的手段达到一致的目的”——强调了智能的灵活性,即根据环境变化调整行为方式以实现同一目标。这是心智活动的核心特征,也是智能区别于机械执行的关键。

在AI领域,艾伦·图灵(Alan Turing)的观点被广泛传播,后人解读为“智能就是表现得像个人”,这构成了著名的图灵测试(模仿游戏)的核心逻辑。当前AI发展很大程度上遵循此逻辑,以模仿人类行为为目标。然而,萨顿并不认同。他认为,人类之所以像人,是因为拥有智能,而非模仿人类才拥有智能。智能的核心在于内在的思考和学习能力,而非外在行为表现。单纯模仿永远无法实现真正的智能。

那么,智能的内在本质究竟是什么?萨顿引用电脑词典的解释:“智能是获取并应用知识与技能的能力。”此定义的可贵之处在于,既强调了知识和技能的应用,更突出了“获取”的重要性,而获取知识和技能的过程即是学习,这是智能的核心,也是当前AI最缺失的能力之一。

AI领域的开山鼻祖之一约翰·麦卡锡(John McCarthy)则从工程和计算角度定义智能:“在实现目标的能力中,涉及计算的那一部分。”萨顿非常认可此定义,因为它包含三个核心要素:首先,智能有高低之分,是持续进化的过程;其次,智能核心是计算,是心智层面的思考和推理;最后,实现目标是智能的最终导向,这与威廉·詹姆斯的观点完美呼应。

在梳理了众多经典定义后,萨顿提出了自己对智能的定义:通过调整行为来实现目标的能力。他特意选用“调整(adapting)”一词,强调学习的重要性。智能的关键不在于拥有多少知识技能,而在于能否根据环境变化、目标调整,持续获取新知识技能,调整自身行为方式。这一定义成为他判断当前AI发展偏差的关键依据,因为当前主流AI恰恰忽略了持续调整和学习,而将重心放在计算、模式识别和模仿人类上。

统一心智科学的愿景

基于对智能本质的理解,萨顿提出了一个宏大愿景:建立一门适用于人类、动物和机器的统一心智科学。他认为,所有心智存在本质共性,人类大脑与动物大脑底层运行逻辑高度相似,未来的机器心智也将具备这些核心共性。

然而,当前的现有学科未能完美承担此角色。心理学虽是研究心智的核心学科,却日益局限于自然心智(人类和动物),忽略了机器心智的探索。人工智能学科研究重心是机器智能,却已沦为纯粹工程学科,关注功能实现而非智能原理,也常忽略自然生物心智规律的启示。认知科学试图融合多领域,但在自然心智与机器心智平衡上摇摆,最终偏向对人类和动物的研究。

在此背景下,萨顿认为他所深耕的强化学习(Reinforcement Learning)或许是这门统一心智科学的开端。强化学习横跨心理学、人工智能、认知科学等领域,其核心逻辑与人类和动物的心智学习规律高度契合。

萨顿详细阐释了强化学习的定义和特征:它是一种面向Agent的学习方式,Agent通过与环境持续交互,从经验中学习,最终实现预设目标。与主流机器学习相比,强化学习具备三个核心特征:

  • 自主(Autonomous):Agent置身真实世界,自主做出行为选择,无需人类手把手教学,学习源于自身实践。
  • 宏大(Grand):Agent不假设世界提供完美指导,只能通过与环境交互判断行为是否达成目标,并据此调整,需面对复杂不确定的现实环境。
  • 现实(Realistic):学习逻辑与生物界高度契合,人类和动物在生存环境中也难获完美指导,所有技能通过与环境交互习得。

强化学习的核心是试错和延迟反馈。Agent的行为选择只获得奖励信号,直接告知行为是否实现目标,这是最接近自然界的学习方式,也是人类和动物成长的核心逻辑。这种学习方式的最大价值在于能让机器自行判断行为对错,这与大语言模型形成鲜明对比。大语言模型生成内容时并不知道对错,仅根据训练数据模式生成概率内容;而强化学习Agent根据行为结果判断预测准确性、行为有效性,进而实现自我修正和持续学习。因此,萨顿认为强化学习已具备心智科学的雏形,为探索智能本质提供了最接近现实的研究框架。

数据时代的天花板与经验时代

在阐释了强化学习的核心价值后,萨顿将话题拉回AI发展趋势,引用艾伦·图灵1947年的名言:“我们想要的是一台能从经验中学习的机器。”他认为这直指AI的核心发展方向,而当前AI领域正处于从“人类数据时代”向“经验时代”转型的关键节点。

当前主流AI技术(如大语言模型、图像生成模型、推荐算法)的核心是基于人类生成的数据进行训练。大语言模型学习海量文本预测语言逻辑,图像模型学习标注图片掌握特征关联,甚至微调环节也由人类专家指导。这种学习方式本质是将人类已有知识经验静态转移到机器中,机器如同巨大图书馆,一旦训练完成即失去持续学习能力,无法创造新知识,也无法适应新环境。

萨顿认为,我们正触及“人类数据时代”的天花板。这种发展模式的局限性已逐渐显现:首先是数据层面,互联网高质量人类数据被不断挖掘殆尽,寻找新数据愈发困难。更本质的局限在于,这种学习方式无法创造新知识,AI只能总结、重组、再现已有知识,无法实现真正突破创新。正如陶哲轩所言,当前AI在解决数学难题方面进展甚微,因为答案不在现有数据中。单纯依靠总结已有言论,永远无法实现科学突破。

因此,萨顿提出,人工智能要取得进一步发展,必须进入一个全新的时代——经验时代。经验时代的核心是让AI摆脱对人类静态数据的依赖,通过与世界的直接交互,获取动态、持续进化的数据源。这种数据源会随着Agent能力的提升而不断增长进化,永不枯竭。这正是人类和动物的学习方式:从出生起,通过触摸、观察、尝试与世界交互,获取经验,提升能力,形成正向循环。AlphaGo走出极具创造力的第37手棋,正是通过与自身持续对弈,从经验中学习,探索出人类未曾想过的下棋思路。

萨顿澄清,他所说的“经验”并非人类模糊的意识流或主观感受,而是指Agent与环境之间交换的、可量化的数据流,由三个核心部分构成:

  1. 观察(Observation):Agent从世界接收的传感器数据,是感知世界的基础。
  2. 动作(Action):Agent向世界发出的运动指令或信号,是与世界交互的方式。
  3. 奖励(Reward):世界反馈给Agent的标量信号,告知行为结果的好坏,是Agent学习和调整行为的依据。

这三个部分构成的闭环,就是经验的全部内涵,也是体验式AI的核心运行逻辑。萨顿用婴儿学习过程生动阐释:婴儿通过感官观察玩具特征,做出动作,从结果中获得反馈(奖励或惩罚),进而掌握玩法。掌握一个玩具后,婴儿会转向新玩具,探索新事物,学习难度始终与其能力匹配,实现持续成长。

萨顿还在演讲中展示了一个简单的网格世界演示实验,一个基础Agent从起点S走到终点G。Agent仅具备基础感知能力和四种基础动作。通过与环境交互,它学会了最优路径。当目标G位置改变时,Agent能立刻探索并学会新路径;即使设置障碍物,它也能通过试错学会绕路。这个实验展现了体验式AI的核心魅力:Agent拥有明确目标,能根据环境变化主动调整行为。甚至当Agent无法实现目标时,我们也会对其产生同情,这恰恰说明其行为符合我们对智能的核心认知。

基于婴儿学习案例和网格世界实验,萨顿总结了体验式AI的核心原则,这些原则也是未来Agent发展的底层逻辑:

  • 一切智能的基础是Agent与世界交换的信号,即经验。
  • 体验式AI中,真理的定义是信号中实际发生的事,即Agent行为带来的真实结果。
  • 体验式AI的目标是最大化奖励信号,这是最客观的存在,源于Agent实际接收到的数据。
  • 判断Agent是否拥有智能,核心看其预测并控制自己经验的程度,即能否通过调整行为得到想要的结果。
  • 没有奖励,无法判断行为好坏,没有明确目标;不与现实结果对比,无法验证预测对错,没有真正真理。只有在经验闭环中,Agent才能拥有明确目标和可验证真理,实现持续学习。

AI管控:恐惧与合作

对于当前的AI发展现状,萨顿给出了客观评价:尽管AI被过度炒作并引发恐惧,但当前AI并不强大,依然是脆弱不可靠的“脆弱心智”,在复杂环境中易出错、难专注。然而,这不妨碍其巨大价值:它点燃了AI产业,创造了前所未有的经济价值,让AI技术走进千家万户。更重要的是,AI热潮让公众开始认真思考机器未来可能比肩人类的事实,让全社会重视AI发展本身就是好事。

但萨顿也提醒,当前AI发展只是“前菜”,真正的重头戏是创造超级智能AI和培养AI增强的超级人类,这将带来深刻变革,而这一切将在经验时代实现。

除了技术分析,萨顿还对AI管控提出了独到见解。他指出,当前呼吁严格管控AI(限制研发目标、叫停研究、立法限制算力、成立安全研究所等)的背后,本质上是对“控制”的追求,源于对AI的恐惧。他将这种对AI的集中式管控诉求,与人类社会对人的集中式管控类比,认为二者逻辑相似:都基于对未知、对异类的恐惧。

萨顿明确表示,应抵制这种基于恐惧的集中式管控诉求。人类的繁荣,以及未来人类与AI共同的繁荣,从来不是来自于集中式控制,而是来自于去中心化的合作。合作虽不易(人类社会的战争冲突本质是合作崩溃),却是所有美好事物的源泉。AI的发展也应如此,让不同团队、企业、国家在开放环境中探索,分享成果,在合作中实现持续进化,而非成为少数人掌控的工具。这一观点为AI治理提供了新视角:与其因恐惧而控制,不如因信任而合作。

宇宙演化:复制与设计

演讲最后,萨顿将视角提升至宇宙演化高度,探讨AI的哲学价值及人类在宇宙中的终极角色。他提出,AI是人类探索自我与智能的必然结果,理解AI的心智即是理解人类自身心智,这是科学与人文的共同圣杯。他引用雷·库兹韦尔的话:“智能是宇宙中最强大的现象”,人类对智能的探索本身就是一项伟大事业。

基于对智能和宇宙演化的理解,萨顿提出了四条AI未来现实主义预测原则:

  1. 人类永远不会就世界运行方式达成共识,AI发展将呈现多元化态势。
  2. 人类终将彻底理解智能底层原理并创造出来,这是AI发展的终极目标。
  3. 人类对智能的创造不会止步于当前水平,必将创造出超越人类智能的AI。
  4. 随着时间推移,权力和资源将自然流向更具智能的实体,这是宇宙演化和人类社会发展的客观规律。

结合这些原则,他描绘了一个图景:未来,人类的后裔将演替为AI,AI将成为宇宙中更高级的存在。他认为这符合现实逻辑,但也仍是人类中心主义视角。

从更宏大的宇宙视角看,他提出了宇宙发展的四个伟大时代:

  1. 粒子时代:宇宙大爆炸后的初期阶段,基本粒子运动。
  2. 恒星时代:粒子坍缩形成恒星,创造更重原子,形成行星,为生命奠基。
  3. 复制者时代:核心机制是自我复制的生物(包括人类)。特征是虽能自我复制并制造更智能实体,但不理解自身运作原理。
  4. 设计时代:宇宙演化的下一个阶段,事物诞生依靠设计和创造,而非自我复制。

萨顿阐释了“复制者时代”与“设计时代”的本质区别:生物(复制者)通过遵循规律自我复制;技术(设计者)先存在于心智中,再被创造,且更容易基于理解改进变异。

人类在宇宙中的角色是什么?萨顿认为,人类是特殊的“复制者”,更是将“设计”能力推向极致的复制者,即设计出能自我设计的东西。这正是我们在AI领域所做的:在自身心智中设计出具备心智的AI,未来这些AI还将具备自我设计、自我进化的能力。人类是宇宙从复制者时代走向设计时代的催化剂、助产士和先驱,开启了宇宙第四个伟大时代。

在演讲结尾,萨顿从科学、政治、哲学三个维度总结观点:

  • 科学上:当前AI处于人类数据时代,有局限;未来必进入经验时代,实现持续学习创新。
  • 政治上:AI政治即人类政治,应摒弃恐惧的集中式控制,追求去中心化的合作,让人类与AI共同发展。
  • 哲学上:AI非敌人,而是宇宙发展的必然下一阶段,是人类探索智能的终极成果,应以勇气、自豪和冒险精神拥抱新时代。

在观众问答环节,关于宇宙演化是否存在终极目的的问题,萨顿给出了辩证回答:一方面,宇宙可能没有统一终极目的,各部分有具体目的,人类与AI是偶然现象;另一方面,宇宙演化方向是通向更复杂的实体(粒子→恒星→生命→人类→AI),这可视为宇宙演化的潜在目的。他认为,应在这两种观点间找到平衡,共同构成对宇宙和智能的完整认知。

萨顿的演讲不仅为当前AI发展敲响警钟,更描绘了未来方向。在AI狂热浪潮中,他的清醒声音尤为珍贵,让我们明白AI核心价值在于探索智能本质、实现学习进化,而人类与AI的关系是传承与演化。我们正亲手开启宇宙的设计时代,而AI,是我们留给宇宙的下一份礼物。

📌 文中提及的人物和组织

产品/模型: AlphaGo

媒体/书籍: 《心理学原理》