AI驱动科学新范式:诺奖得主齐聚AIAS 2025峰会,揭示材料、基因与蛋白质设计前沿 硅谷101 2025-11-06

引言:AIAS 2025峰会与科学新范式

从沙漠空气中提取水、进行基因编辑,到像搭乐高一样设计蛋白质,以及价值10亿美元的新AI发现范式——这些看似不相关的词汇,实则代表着人工智能与科学结合最紧密的领域。而这些前沿进展,都集中出现在2025年10月底于旧金山举办的AIAS(天桥脑科学研究院AI驱动科学研讨会)峰会上。这场为期两天的盛会,汇聚了三位诺贝尔化学奖得主、一位图灵奖得主以及数十位各领域最权威的前沿专家,其含金量可见一斑。本期视频将带大家深入了解这些诺奖得主所传达出的前沿研究与资本布局信号。

Omar Yaghi:AI赋能材料研发,从沙漠取水到碳捕获

今年的新晋诺贝尔奖得主Omar Yaghi分享了一个令人振奋的故事:他利用ChatGPT带领七个AI Agent(人工智能代理:能够感知环境、进行决策并采取行动以实现特定目标的智能软件或硬件实体)组成的虚拟实验室,将原本需要两到三年的材料研发时间,大幅压缩到了两到三周。这意味着,过去一名学生或研究人员需要数年才能完成的研究,现在通过这种实验方式只需数周即可完成。毫无疑问,这些AI技术正在彻底改变科研方式,至少在他的实验室中已是如此,并且也将改变整个化学领域的工作方式。

Omar Yaghi的成名作是发明了一种名为MOF(Metal Organic Frameworks:金属有机框架,一种由金属离子或金属簇与有机配体通过配位键自组装形成的多孔晶体材料)的神奇材料。想象一个分子搭建的“海绵”,内部有巨大的孔隙结构,这就是MOF。几克MOF展开后的表面积相当于一个足球场。这种材料能够从沙漠空气中提取水,听起来像科幻小说。他的MOF-303材料在沙漠中也能显著吸水,并通过日夜温差或太阳加热实现水释放。它还能捕获二氧化碳、储存氢气、过滤有毒气体。

这项前沿技术已经商业化:非电动版靠太阳能每天能产850升水,电动版则每天能产2000升。尽管成本不低,但它不需要电网、不需要排盐水、不需要基础设施,对于偏远地区、岛屿、数据中心来说,如果资金充足,这就能实现“水自由”。

然而,Yaghi现在更关心的是,能否让AI自己设计新的MOF材料。2023年,他们首次尝试让学生将250篇论文喂给ChatGPT,提取MOF的合成条件,例如金属、有机链接物等。准确率超过95%,且仅用了两周。更令人惊叹的是,现在这项工作只需几个小时就能完成,并且AI还可以预测新材料的合成条件。

于是,他们创建了一个由七个ChatGPT Agent组成的研究团队,包括文献搜索员、合成规划师、机器人编程员、3D打印工程师、数据分析师等。他们的任务是结晶一种超级难搞的COF(Covalent Organic Frameworks:共价有机框架,一种由轻元素(如碳、氮、氧、硼)通过强共价键连接形成的晶态多孔聚合物)材料。这种材料有多难?全世界大约100个研究所都尝试过,都只能做到部分结晶。人工做的话,需要两到三年反复试错。结果,这七个AI Agent在第84次实验时成功实现了完全结晶,总共用了两到三周。另一个更难的COF在机器人的协助下,96次实验,三周完成,其中三周时间还是因为需要对机器人进行调试。

如今,Yaghi成立了AIMATX公司,在伯克利大学孵化,目标就是将这套流程产业化。Yaghi最雄心勃勃的目标是,用COF从空气中捕获二氧化碳。他的计算是:在全球600个百万人口以上的城市,各建一个装有10万吨COF的工厂,3.5年内就能够清除完大气里多余的二氧化碳。目前技术难题已经解决,现在就是在AI的帮助下,把成本降得更便宜,大规模地去生产。AIMATX的人工智能模型将实现更低成本的方案,它不断优化,能进一步发现更具经济性的构建方式。目前,成本已较现有方案降低约30%,而这仅仅是起点。

David Baker:深度学习设计蛋白质,构建生命积木

如果说Omar Yaghi用AI从空气中“榨”水让人觉得不可思议,那么去年的诺贝尔化学奖得主David Baker的连线演讲同样让人大开眼界。他展示了如何在AI的帮助下,像玩乐高一样“搭建”全新的蛋白质。

Baker获得诺奖的原因是“计算蛋白质设计”。蛋白质是生命的积木,自然界经过35亿年的进化,创造了大概10的12次方种不同的蛋白质。而Baker所做的事情是,设计自然界从未存在过的蛋白质。David Baker开发的Rosetta软件和后来的AI工具,让科学家们可以像搭乐高一样设计蛋白质。这次他在大会上分享的“用深度学习设计新的蛋白质功能”,其核心逻辑很简单:以前我们“预测”蛋白质会长什么样,现在我们“设计”蛋白质去做我们想做的事。

Baker展示了一个巧妙的类比:大家熟悉的AI画图工具DALL·E生成猫咪图片的过程,与他模型生成蛋白质的过程惊人地相似。他们开发的方法灵感来自计算机视觉中用于生成图像的技术。DALL·E的原理是从互联网上获取大量图像,对这些图像加入不同程度的噪声,然后训练一个神经网络去除这些噪声。训练完成后,就可以从一张完全随机的图像开始,逐步去除噪声,最后得到一张全新的图像,看起来就像来自互联网,但其实是全新生成的,比如一张猫的图片。

他们在蛋白质上也做了同样的事情:将所有通过实验测得的蛋白质结构加入不同程度的噪声,然后训练一个网络去除噪声。训练完成后,他们发现可以从完全随机的氨基酸残基排列开始,逐步去噪,最后得到一个看起来像真实蛋白质结构,但实际上完全新颖的结构。他们用已知蛋白质结构去训练神经网络,训练完成之后,AI就能够把杂乱无章的氨基酸“整理”成一个全新但是合理的蛋白质。

但光是凭空创造还不够有用。就像你不会对AI说“随便画点什么”,而是会说“画一只猫坐在桌子上”一样,Baker他们也要给AI更具体的命令。比如说,设计一个蛋白质,只有在肿瘤微环境的特殊条件下才“展开”发挥作用,在正常组织里保持“休眠”状态,从而减少药物的副作用。在AI的帮助下,他们可以跑很多次生成过程,得到成千上万个不同的候选方案,它们会形成不同的“家族”,可以系统地探索整个可能性空间。

Baker还在大会上提到,他们最近还发布了一个叫RF3的模型,专门做结构预测。通过整合更多的宏基因组数据,几乎在所有指标上都提升了性能。但是模型的泛化能力瓶颈依然在数据。所以模型的泛化能力主要取决于数据集的规模与丰富度,以及模型架构的能力。在一定程度上,模型确实能实现相当好的泛化,但显然有些地方仍需要更多数据。举个例子,对于蛋白–小分子相互作用,这些模型的表现远不如蛋白–蛋白相互作用,因为在这方面的数据还不够多。他认为更多的数据肯定会有助于泛化。

Jennifer Doudna:CRISPR与基因编辑的计算交叉

如果说前两位化学界的大佬讲得过于深奥,好像离普通人很远,那么2020年的诺贝尔化学奖得主Jennifer Doudna,也就是CRISPR(Clustered Regularly Interspaced Short Palindromic Repeats:成簇的、规律间隔的短回文重复序列,一种基因编辑技术)基因编辑技术的共同发明人,她分享的技术进展可能就会让很多受到基因疾病困扰的人深感鼓舞了。

如果你关注生物科技,CRISPR这个名字你肯定听过,它被称为“基因魔剪”,可以精确地剪切、插入、修改DNA序列。但在这次大会上,Doudna讲的不是CRISPR本身,而是生物学与计算交叉点的创新。十多年前,Jennifer Doudna用一种名为CRISPR-Cas9(基因编辑技术CRISPR-Cas9:一种基于细菌和古细菌免疫系统的基因编辑工具,能够精确地识别并剪切DNA序列)的分子剪刀,改变了生物学的格局。这种来自细菌免疫系统的工具,让科学家第一次能够像编辑文字一样编辑DNA。2012年,他们发现了Cas9如何在RNA的引导下精确切割DNA,并将两段RNA工程化为一条“单导RNA”,从而创造出一个人人都能使用的DNA编辑系统。

2023年,基于Doudna团队最初发现的CRISPR格式,美国FDA(Food and Drug Administration:美国食品药品监督管理局)批准了首个CRISPR基因疗法,用于治疗镰刀型贫血症(Sickle Cell Anemia:一种遗传性血液疾病,红细胞呈镰刀状,导致贫血、疼痛和器官损伤),一种影响大约10万名美国人的遗传疾病。第一位接受治疗的患者Victoria Gray如今已经完全康复,并成为该疗法的倡导者。从最初的科学发现到获批上市,这个过程仅用了10年,这在生物医学界是惊人的速度。

然而,疗法的成本依然高昂,手术和细胞处理的过程也很复杂。尽管Doudna领导的创新基因组学研究所(IGI)在旧金山建立了一个治疗中心,计划在未来的三年当中为8名患者提供治疗,同时探索降低成本的新方法,但是这仍然不够。目前来说,最大的瓶颈也是数据。和那些拥有庞大标准化数据集的领域不同,生物学的数据又少又乱,这让机器学习在生物学里面可以说是举步维艰。

于是,Doudna的思路反过来:让CRISPR生成机器学习需要的数据。CRISPR能设计出上百万种RNA导向分子,像扫描器一样逐一“敲掉”或者“修改”小鼠的基因。自动化显微镜系统高通量地拍照,记录每个编辑后的细胞发生了什么变化。这些数据的微妙之处,正是机器学习可以大显身手的地方,找出哪些基因互相配合导致疾病,哪些组合能够产生特定的化学变化。这种方式就像给机器学习提供了“生命的训练集”,成千上万条基因与功能的映射关系,将帮助模型预测蛋白功能、解析基因网络、建模RNA结构。

AI驱动科学发现:第五范式与挑战

回顾AIAS 2025峰会,诺奖得主Yaghi讲述材料设计,Baker讲述蛋白质设计,Doudna讲述基因编辑。从材料到分子到基因,从无机到有机到生命,这是一个完整的科学链条。而他们讲的核心都是同一件事:AI不再是分析工具,而正在逐渐成为发现的主体。这个观点也得到了参与的其他科学家和AI研究员们的认证。

两天大会中,众多明星学者分享了各自领域的突破性进展。除了几位诺奖得主,我们还看到微软研究院AI For Science的总监Christopher Bishop分享了科学发现的第五范式,即AI驱动的发现。Meta AI的Larry Zitnick分享了用AI建模原子的前沿。MIT的Heather Kulik教授讲解了如何用机器学习加速材料研发。

但在这些令人眼花缭乱的科研成果背后,所有人真正想探讨的,是一个更加宏大的命题:AI到底能在多大程度上改变科学研究的游戏规则?Alphabet董事长、斯坦福前校长、图灵奖得主John Hennessy在计算机领域干了50年,见证过PC的革命、苹果的崛起、互联网的诞生和雅虎的辉煌。但是他在大会上说,这一次GenAI(生成式人工智能:指能够生成文本、图像、音频、视频等新颖内容的AI模型)革命不一样。GenAI用了不到一年的时间就进入了人们的日常,而互联网和手机的普及则需要大规模基建。

然而,这里有几个不太美妙的事实。首先是数据危机:按照现在的模型增长速度,全世界的训练数据会在四到五年内用完,这还是假设把所有视频数据都喂给模型的情况下。其次是硬件极限:摩尔定律(Moore's Law:指集成电路上可容纳的晶体管数量大约每两年翻一番,性能也随之提升)的延续已经接近极限,而Dennard缩放定律(Dennard Scaling:指晶体管尺寸缩小,其功耗也按比例降低,从而在不增加功耗的情况下提高芯片密度和性能)早在十多年前失效。晶体管虽然能够继续缩小,但是功耗不再同比降低。还有就是科学数据的困境:科学数据库需要极高质量的数据,这一点前面诺奖得主的演讲中也都有提到。

结语:科学、工业与资本的协同

要解决这些挑战,不仅仅需要前沿的科学家们,还需要工业界和资本界的相互合作,来加速前沿科学的进步与发展。我们也很开心地看到,这样的生态正在越来越成熟和加速转动。这次的AIAS 2025峰会就是一个好的证明。我们将继续为大家关注进一步的动态。

好了,以上就是这期视频的全部内容。我们下期视频再见。

📌 文中提及的人物和组织

公司/组织: Alphabet, MIT, Stanford University, FDA

产品/模型: ChatGPT