AlphaGo的十年:一场范式革命
大飞: 大家好,这里是最佳拍档,我是大飞。十年前,当谷歌DeepMind的AlphaGo以4:1的比分战胜围棋传奇李世石时,没有人能完全预见这一场棋盘上的胜负会成为人工智能发展史上的一道分水岭,会为后续十年AI从实验室走向现实世界、从游戏领域迈向科学前沿铺就一条全新的道路。十年后的今天,谷歌DeepMind推出了一期特别播客,主持人汉娜·弗莱与DeepMind的科学家索雷·格雷佩尔、科学研究副总裁普什米特·科利展开了一场深度对话,不仅带我们重新回顾了AlphaGo的诞生、开发、对决时刻,也为我们描绘了AI与人类协同探索未知的未来图景。今天,我们就借着AlphaGo战胜李世石十周年的契机,一起走进这场改变了人工智能发展轨迹的范式革命,看看这颗棋盘上的棋子如何撬动了整个科学世界的大门。
围棋的极致挑战
大飞: 首先我们要弄明白的是,为什么是围棋呢?为什么在IBM的深蓝1997年战胜国际象棋世界冠军卡斯帕罗夫之后,围棋会成为人工智能领域尚未征服的最高峰,被视为AI的最后圣杯呢?索雷在播客中给出了答案:围棋的规则其实简单到极致,黑白双方交替落子,最终围地多者获胜。但就是这样极简的规则,衍生出了令人难以置信的复杂性和策略深度。从广度来看,围棋的棋盘是标准的19×19布局,拥有361个交叉点,每一步的合法落子位置平均有200到300种选择。从深度来看,一局完整的围棋对局通常会持续200到300手。更关键的是状态空间,围棋的可能局面数高达10的170次方,这个数字远超目前人类可观测宇宙中的原子总数,这意味着传统的暴力搜索算法在围棋面前完全失去了作用。而普什米特·科利,这位如今领导DeepMind科学工作的科学家,当时还任职于微软,他补充了围棋成为AI终极挑战的另一个核心原因,那就是推理的深度。围棋需要AI具备极强的长程推理能力,要在几百步的博弈过程中始终保持战略的一致性,能够为了全局的胜利牺牲局部的利益,这种能力是传统AI方法根本无法企及的。也正是因为围棋的这种特性,在深蓝战胜卡斯帕罗夫之后的近二十年里,计算机科学家们普遍认为,机器在围棋上战胜人类顶尖高手至少还需要几十年的时间。但是DeepMind的团队却看到了挑战背后的机遇,他们决定直面这个难题。
技术内核:直觉与计算的融合
大飞: 而他们的解题思路,并非是从零开始创造一个全新的算法,而是借鉴了人类棋手的思维方式,那就是直觉与计算的结合,也就是我们常说的快思与慢想。索雷以自己的围棋对弈经历为例,向我们描述了人类棋手面对复杂棋盘的思考模式:当一名围棋高手站在棋盘前,他绝不会愚蠢到逐一分析所有可能的落子位置,这在时间和精力上都是完全不可行的。他会依靠多年的对弈经验、对棋形的直觉甚至是对围棋美学的理解,快速筛选出几个有希望的下法,这就是快思。而在确定了这几个关键下法之后,他会进入深度的计算阶段,一步步推演这些下法可能引发的后续变化,预判对手的应对策略,这就是慢想。这种快思与慢想的结合,是人类智能的典型体现。而AlphaGo的核心技术内核,正是对这种人类认知模式的完美模仿。它将深度神经网络与蒙特卡洛树搜索相结合,打造出了策略网络与价值网络的双网络架构,让机器第一次拥有了类似人类的直觉与计算能力。我们先来看看负责快思的策略网络,它的核心功能是输入当前的棋盘状态,输出每个合法落子位置的概率分布。这个网络的初始训练采用的是监督学习模式,让它学习几百万局人类棋谱中的落子模式和围棋定式。通过这种训练,策略网络能够快速缩小搜索范围,直接忽略掉绝大多数不合常理的下法。而负责慢想一部分的价值网络,则承担着局面评估的功能。它会计算当前棋盘局面下黑白双方的胜负概率,帮助搜索算法在推演到一定深度后,不再继续无意义的穷举,而是根据价值判断,砍掉那些明显没有胜算的推演分支,极大提升计算效率。而蒙特卡洛树搜索,则是AlphaGo慢想的核心。它并非单独工作,而是与策略网络和价值网络深度结合,在模拟中探索未来可能的棋局变化。蒙特卡洛树搜索的核心逻辑是通过几百万次的模拟对弈,平衡探索与利用的关系:探索就是尝试那些看似不常规但可能有惊喜的新下法,利用则是选择当前看来胜率最高的下法。最终在无数次的模拟中,选定那个综合胜率最高的落子位置。这种双网络+蒙特卡洛树搜索的架构,让AlphaGo能够在围棋10的170次方的巨大状态空间中高效导航,这是AlphaGo能够攻克围棋难题的核心技术支撑。
AlphaGo的进化之路
大飞: 而AlphaGo的发展,也并非一蹴而就,它经历了从婴儿版到世界冠军级别的逐步进化。索雷回忆起自己在DeepMind的第一天,就迎来了一个特殊的任务:与早期版本的AlphaGo对弈。这个当时仅训练了几十万局人类棋谱的婴儿版AlphaGo,看似稚嫩,但是索雷即便谨慎应战,最终还是以微小的差距落败。他也开玩笑说,自己成了第一个正式输给AlphaGo的人。而这场失利,也让他第一次深刻意识到了这项技术背后蕴藏的巨大潜力。在那之后,DeepMind团队不断对AlphaGo进行训练和优化,让它在自我对弈中持续进化。而真正让团队看到挑战世界冠军希望的,是AlphaGo与欧洲围棋冠军樊麾的十局测试赛。在这场对决中,AlphaGo以10:0的比分完胜樊麾。有趣的是,索雷此前还与同事戴维·西尔弗打赌,认为AlphaGo无法取得这样的成绩,最终赌输的他不得不穿着一天日本古代棋士的服装上班。而在战胜樊麾之后,DeepMind团队终于下定决心,向当时的围棋世界第一李世石,发起正式挑战。
人机巅峰对决:李世石的挑战
大飞: 2016年的韩国首尔,四季酒店的套房里,这场注定被载入史册的人机大战正式拉开帷幕。当时的李世石是围棋界当之无愧的传奇,手握18个世界冠军头衔,被誉为围棋界的罗杰·费德勒。他的棋风凌厉、极具创造力,在围棋界拥有不可撼动的地位。面对AlphaGo的挑战,李世石最初表现得极具自信,他公开表示自己将轻松击败这个人工智能对手。而他的这份自信,并非盲目自大,而是基于AlphaGo此前与樊麾的对局记录。在他看来,当时的AlphaGo水平还远不足以挑战自己。但李世石并不知道的是,AlphaGo在比赛前夕还在通过海量的自我对弈飞速进步,它的棋力早已不是与樊麾对弈时的水平。一场针尖对麦芒的对决,就此展开。首局比赛的现场,云集了全球的专业棋手和媒体记者,气氛紧张到了极点。比赛初期,李世石凭借自己丰富的经验占据了明显优势,现场的专业评论员几乎一致认为李世石将轻松拿下这一局的胜利。但随着棋局的深入,AlphaGo开始逐渐展现出惊人的局面控制力,它的落子看似平淡,却一步步蚕食着李世石的优势,最终完成逆转,拿下了首局的胜利。当裁判宣布AlphaGo获胜的那一刻,现场一片哗然,所有人都被这个结果震惊了。一位美国职业棋手在比赛过程中还曾经嘲讽AlphaGo的某一手棋愚蠢至极,但是在赛后,他却激动地找到索雷,说出了这样一句话:“这是我一生中见过的最不可思议的事情。”首局的胜利,让世界第一次意识到,AI在围棋上战胜人类已经成为了现实。但是真正颠覆人们对AI认知的,是第二局比赛中的那一手棋——AlphaGo的第37手。在第二局的对局中,AlphaGo在棋盘的第五线走出了一手肩冲的下法。这一手棋,让当时所有的专业棋手都感到难以置信。在人类数千年的围棋发展历程中,形成了一套成熟的落子理论,在边角的争夺中,第三线和第四线是公认的合理平衡点,第三线取实地,第四线取外势,而第五线则被认为过于深入敌方阵地,会损失大量的实地,是典型的无理手。当时担任现场解说的美国职业棋手迈克尔·雷德蒙德看到这手棋时,第一反应是这一定是错的,他甚至反复确认屏幕,怀疑是直播出现了失误,最终才确信AlphaGo真的走出了这样一手看似违背围棋常识的棋。不仅是雷德蒙德,当时在各大平台担任解说的芈昱廷、古力、柯洁等围棋顶尖高手也纷纷表示震惊,芈昱廷直呼“这是什么鬼,没摆错吗?”,古力直言“这步棋令人震惊”,就连素以大局观著称的棋圣聂卫平也表示要对AlphaGo脱帽致敬。但事后的深度分析表明,这手第37手并非AlphaGo的失误,而是一步极具深远战略意义的下法。它看似牺牲了局部的实地,却为AlphaGo争取到了全局的中央影响力。而这手棋也最终成为了AlphaGo拿下第二局胜利的关键。更令人震撼的是,根据AlphaGo的策略网络测算,人类棋手在相同局面下选择这一下法的概率仅为万分之一。索雷在访谈中指出,这手第37手的意义早已超越了棋局本身,它象征着人工智能第一次突破了人类数千年积累的经验框架,发现了人类从未意识到的可能性。这是AI从模仿人类走向自主创造的第一次公开亮相。而这手棋也被人们称为AlphaGo的神来之笔。在连赢三局之后,李世石已经站在了0:3的绝境之上,按照比赛规则,AlphaGo已经取得了最终的胜利。但后续的两局比赛依然牵动着所有人的心。而在第四局比赛中,李世石也为人类赢回了尊严,他走出了被誉为神之一手的第78手,一手极其罕见的挖。这手棋完全出乎了AlphaGo的意料,打破了AlphaGo的局面判断和推演逻辑,导致其后续的下法出现明显混乱。最终李世石抓住机会,拿下了这一局的胜利,成为了这场人机大战中人类唯一的胜局。这一局的胜利也完美展现了人类在极端压力下的创造力与直觉。李世石后来在记者会上表示,他为自己能在或许是人类最后一次战胜机器的时刻挺身而出感到骄傲。而最终,这场人机大战的比分定格在4:1,AlphaGo取得了最终的胜利。
AlphaGo的遗产与科学赋能
大飞: 这场胜利,对于围棋界和AI界产生了截然不同但同样深远的影响。对于围棋界而言,这意味着一个时代的终结,人类不再是围棋这项运动的最强者。但令人欣慰的是,围棋界并未因此消沉,反而迎来了新的发展机遇。AlphaGo的出现,激发了全球范围内对围棋的浓厚兴趣,越来越多的人开始学习围棋,而众多职业棋手也将AlphaGo及其后继者作为训练工具,分析自己的棋局,探索全新的围棋策略,围棋的整体竞技水平也因此得到了显著提升。而对于AI界而言,这场胜利的意义更为重大,它首次验证了深度强化学习在解决极端复杂问题上的有效性。更重要的是,它向全世界展示了AI超越人类现有知识的可能性,为后续人工智能的研究打开了一扇全新的大门。而在AlphaGo战胜李世石之后,DeepMind团队并没有停下脚步,而是在AlphaGo的基础上继续探索,推出了更具革命性的AlphaZero。而AlphaZero的核心突破,就是完全脱离了人类的棋谱和先验知识,实现了真正的自我进化。与AlphaGo不同,AlphaZero在训练之初,仅知道围棋、国际象棋和将棋的基本游戏规则,没有学习过任何一局人类的对弈棋谱。它的学习方式,就是纯粹的自我对弈。在训练的初期,AlphaZero的落子完全随机,就像一个刚接触棋类游戏的孩子一样,对规则一知半解。但是通过数百万局甚至数亿局的自我对弈,它在不断的试错和总结中,逐步掌握了棋类游戏的规律,最终在围棋、国际象棋和将棋三个领域,都达到了远超人类顶尖高手的水平。索雷在描述AlphaZero的学习过程时,提到了一个令人惊叹的现象:AlphaZero首先会在自我对弈中重新发现人类数千年来积累的开局定式,比如围棋中的各种经典定式、国际象棋中的标准开局。这个现象也让研究人员感到欣慰,因为它证明了人类数千年的智慧结晶并非偏离了最优解,而是在探索过程中找到了正确的方向。但是随着学习的深入,AlphaZero开始展现出超越人类的能力,它会逐渐抛弃一些人类的传统定式,因为它在自我对弈中发现了更优的走法。它的落子不再受人类经验的束缚,走出了很多看似随意、难以理解,但最终被证明更为高效的下法。作为一名资深的围棋爱好者,索雷坦言,AlphaZero的棋风让他感到陌生,它不像人类老师教授的那样结构分明、章法清晰,但是它的每一步落子,在几十步之后都会形成精妙的配合。这种超越人类的远见,正是AlphaZero最令人震撼的地方。而AlphaZero的突破,不仅在于它实现了超人类的棋力,更在于它的算法通用性。同一套算法框架,仅仅改变规则输入,就能在围棋、国际象棋、将棋三种完全不同的棋类游戏中达到顶级水平。这个特性证明了强化学习在解决复杂搜索问题上的强大能力,也为后续将这种算法框架应用于科学领域的各类难题奠定了重要的思想基础。从AlphaGo到AlphaZero,DeepMind团队完成了从模仿人类到自主探索的跨越,而这个跨越也让人工智能从游戏领域正式迈向了科学研究的前沿。如果说AlphaGo在棋盘上的胜利是人工智能的一次技术突破,那么它留给科学界最宝贵的遗产,就是将围棋的直觉+搜索范式应用于解决各类复杂的科学问题。而其中最具代表性的,就是AlphaFold、AlphaTensor和AlphaEvolve。在首尔人机大战期间,DeepMind的创始人德米斯·哈萨比斯与同事戴维·西尔弗有一段没有被收录进纪录片的秘密对话。当时AlphaGo刚刚拿下胜利,哈萨比斯兴奋地表示:“我们肯定能解决蛋白质折叠问题。”这句话在当时很多人看来,或许只是一句激动之下的豪言,但如今,它已经成为了现实。索雷指出,AlphaGo的成功让团队意识到,既然AI能够处理围棋10的170次方种可能的局面,那么它同样可以应对其他复杂的组合搜索问题,而蛋白质折叠,正是这样一个难题。蛋白质是生命活动的基础,它由氨基酸链构成,而氨基酸链如何折叠成特定的三维结构决定了蛋白质的功能,这就是蛋白质折叠问题。蛋白质的构象空间同样庞大,而人类科学家为了解决这一问题耗费了50年的时间,此前通过实验手段确定一个蛋白质的三维结构往往需要花费一年甚至更长的时间,而且成本极高。而普什米特在加入DeepMind后,领导科学团队直接推动了AlphaFold的开发。AlphaFold完全借鉴了AlphaGo中的搜索与学习机制,只是将AlphaGo中的棋盘换成了蛋白质的氨基酸序列,将落子下法换成了蛋白质的构象变化。经过海量的训练和优化,AlphaFold成功实现了根据氨基酸序列精准预测蛋白质的三维结构,如今已经能够预测几亿种蛋白质的结构,彻底解决了生物学界50年来的重大难题。而AlphaFold的出现,也为药物研发、疾病研究带来了革命性的变化。目前全球已有超过300万名研究人员使用AlphaFold的数据库,其中超过30%的研究都聚焦于疾病的理解与治疗。而这个成果也在2024年获得了诺贝尔化学奖,成为了AI推动科学进步的最佳证明。而另一个直接受AlphaGo启发的项目,就是AlphaTensor。它解决的是基础计算领域的核心难题:矩阵乘法算法。矩阵乘法是几乎所有现代计算的核心运算,无论是人工智能模型的训练、大数据分析,还是科学计算,都离不开矩阵乘法。尽管人类科学家已经对它研究了几十年,但是最快的矩阵乘法算法始终没有被发现。AlphaTensor将寻找最优矩阵乘法算法的问题转化为了一个游戏,游戏的目标就是使用最少次数的乘法操作正确计算出两个矩阵的乘积。而这个问题的搜索空间比围棋还要庞大。AlphaTensor通过强化学习的方式,在这个巨大的搜索空间中不断探索,最终发现了一种比1969年的斯特拉森算法更优的矩阵乘法方案,打破了这个领域50年来的停滞。这个发现的意义不仅在于算法的优化,更在于实际应用中的价值,即使是微小的乘法操作次数节省,在AI模型大规模部署、数据中心日常运算的过程中,也能带来巨大的能源与成本节约。而更重要的是,这个发现证明了人工智能甚至可以在基础算法领域超越人类的现有认知。普什米特还在播客中介绍了DeepMind的最新进展:AlphaEvolve。这个系统将AlphaGo的范式推向了更广阔的领域,它可以在所有可能程序的搜索空间中寻找解决实际问题的最优算法,比如数据中心的任务分配调度、网络数据包的路由优化、物流行业的路径规划等等。这些问题的共同点都是需要在巨大的搜索空间中寻找最优解,而AlphaGo开创的直觉网络+搜索的范式,正是解决这类问题的通用框架。AlphaGo的遗产正在从棋盘延伸到了生物学、计算机科学、工程学等多个科学领域,人工智能也正式成为了人类探索科学未知的重要工具。
AI的新篇章:机遇与挑战
大飞: 当然,随着AI在科学领域的应用越来越深入,我们也面临着诸多全新的挑战,而这些挑战也决定了未来人工智能的发展方向。普什米特认为,如今在科学领域已经出现了很多AI的第37手时刻,为人类的科学研究打开了全新的视角。但是AI的创造性也带来了一个核心问题:如何区分AI的创新与幻觉呢?对此,索雷和普什米特提出了一个核心解决方案:那就是将AI的生成与验证彻底分离。AI可以拥有无限的想象力,自由地生成各种看似荒谬的假设和解决方案,但是这些假设和方案必须经过严格的验证机制筛选,比如代码测试、数学证明、物理实验等等。只有通过验证的结果,才能被认定为有效的创新。这个思路与科学哲学家卡尔·波普尔提出的猜想与反驳模型高度契合。而另一个更核心的挑战,就是AI的可解释性问题。即使AI给出了正确的答案,如果人类无法理解其背后的推理过程,那么就很难将这些答案融入现有的知识体系,也很难在此基础上进行进一步的探索。普什米特以AlphaFold为例,尽管它能够精准预测蛋白质的三维结构,但是它内部的思维机制,也就是如何从氨基酸序列推导出三维结构的过程,对人类而言仍然是一个黑箱。索雷则补充道,解释其实是一种桥梁,而这座桥梁需要根据接收者的认知水平进行调整。未来的AI可能需要为不同层级的科学家提供不同深度的解释,而如何打造这座桥梁,不仅是一个技术问题,更是人机协作的核心课题。在数学领域,AI的发展也为我们带来了全新的想象空间。DeepMind开发的AlphaProof等系统已经能够解决一些开放的数学问题,并且生成可验证的数学证明。普什米特指出,AI的出现并没有让数学家的重要性降低,反而更加凸显了人类数学家的价值。数学家需要提出正确的问题,设定研究的方向,并且将AI给出的答案转化为人类能够理解的形式。未来,我们可能会面临这样一种情景:AI成功证明了某个重大的数学猜想,比如黎曼猜想,但是它给出的证明过程过于复杂,人类无法完全理解。这个情景虽然令人不安,但是也可能催生全新的数学分支,也就是专注于理解AI的证明,而这也将成为人类与AI合作的全新模式。回顾人工智能的发展路径,索雷还指出了一个有趣的转折:DeepMind最初的研究方向是强调AI在环境中进行强化学习,也就是让AI通过与环境的交互、试错来学习。而近年来大语言模型的成功,却走了另一条完全不同的道路,通过海量的人类文本数据进行监督学习。这相当于让AI直接吸收人类数千年来积累的结晶化智能。但这种纯监督学习的方式存在一个明显的局限,那就是它无法超越人类的现有知识,只能在人类的知识框架内进行学习和应用。因此,当前人工智能的发展趋势是将强化学习与大语言模型深度融合:先用大语言模型吸收人类的海量知识,打下坚实的基础,再通过强化学习进行后训练,让AI在特定领域进行自主探索,突破人类的知识边界。而这个趋势,正是AlphaGo精神的回归,也是人工智能未来的核心发展方向。
AlphaGo的深远遗产
大飞: 十年时间,弹指一挥间。从2016年首尔的人机大战,到2026年AI在多个科学领域开花结果,AlphaGo留给我们的,远不止一场棋盘上的胜利。它更是人工智能发展史上的一个分水岭。如果没有AlphaGo,我们可能不会如此迅速地迎来今天的大语言模型浪潮。正如主持人汉娜在播客结尾所言,这些范式转变的时刻,在人类与机器的故事中屡屡发生。但是AlphaGo的不同之处在于,它第一次展示了机器真正的智能,一种结合直觉与计算、超越人类能力的智能。十年前,那一块19×19的围棋棋盘,只是人工智能探索未知的起点。而十年后的今天,我们正站在AI驱动的科学发现新时代的门槛上。未来,人类与AI的故事还将继续书写,而我们有理由相信,在人工智能的助力下,人类将在探索世界、理解世界的道路上走得更远、更稳。好了,今天的内容就到这里,感谢收看本期视频,我们下期再见。
📌 文中提及的人物和组织
公司/组织: Google DeepMind
产品/模型: AlphaGo, DeepBlue, AlphaZero, AlphaFold, AlphaTensor, AlphaEvolve