递归自我提升与发现模型:大模型向科学探索的演进 硅谷101播客 2026-07-06

AI代码编写能力与递归自我提升(RSI)

哈喽,大家好,欢迎收听《硅谷101》,我是泓君。

最近Anthropic承认了一件事,他们现在80%的代码已经不是人写的,是Claude自己写的。这家全世界最谨慎的AI公司同时发出了一个警告,AI可能很快就要自己设计,自己去训练下一代的AI了。他们管这个叫做递归自我提升,英文是RSI,也是硅谷今年对模型能力最热的讨论方向之一。

今天这集节目我们的含金量高了。我们请到了两位真正正在做这件事情的研究员,他们所在的公司叫做Apodex,背后是陈天桥出资创立并亲自主导的。这家公司给自己的定位也非常特别,他们不做图片生成,不做视频生成,只做一件事,他们自己叫做Heavy Duty Solver,意思是专啃那些没有标准答案,人类自己都不知道从哪下手的难题。他们管自己想做的模型叫做Discovery model(发现模型),不是从已知的信息里面找答案,而是要提出人类还没有想到过的假设,然后自己想办法去验证它,去解决这个世界上还没有被解决的科学难题。这也是为什么这家公司叫Apodex,因为词源就是希腊语里的证明和论证。

如果AI真的可以教自己,人类科学家还剩下什么?让我睡不着觉的一个问题就是,我们怎么知道这个模型在自我进化的时候它没有跑偏?同时Beibin也在这集节目里面讲到了他自己蒸馏自己的想法。这个在过去职业生涯里曾经每天都在跟马斯克、跟陈天桥讨论技术问题的研究员,我采访的时候有那么一瞬间觉得他下一刻就工作不保了。于是我问他,我们假设真的把Beibin蒸馏了,你会担心自己失业吗?说不担心肯定是假的,但即使我担心我其实还是乐观的。

那这集我们就站在AI自进化的分界点上,与两位一线的研究员聊一聊硅谷模型的核心发展趋势,以及未来模型能不能超越人类顶尖科学家的水平,真正地去提出问题,去发现问题。下面就请收听我们今天的节目。

今天跟我在一起的两位嘉宾,一位是Simon杜少雷。Simon你好。

你好。

Simon是华盛顿大学计算机系的副教授,同时也是Apodex的首席科学家,负责训练与推理方向。还有一位嘉宾是Apodex的首席科学家,负责代码与自进化方向的李辈滨。哈喽,Beibin你好。

你好。

自我进化的发展与模型能力的提升

欢迎两位。我们刚刚提到了今年有一个词很火,就是RSI。我发现其实这个大模型它的预训练、后训练包括它的核心的训练方向,它可能是每年都有一些新的方向出来。我记得前几年我们在聊的最火的是DeepResearch深度研究,再到Coding代码方向,今年就到了自进化,Self-evolve的方向。首先想请Beibin跟Simon,大家一起来分析一下,这后面其实是几个不同的方向,还是说它有一个核心的主线在主导这个模型往哪个方向走的?

我感觉从训练的角度来看,其实是同一个能力在提高,其实都是推理的能力,长链推理的能力,还有就是在环境中进行一些探索,执行一些动作,获得了这个信号之后,再进行下一步的探索。不管是在DeepResearch还是Coding这些环境下,其实它的内核都是一样的,只是它的方向有一些细微的区别。

我们说的自我进化这个概念,其实并不是一个新的概念了。我就不说远的,在八九十年代关于AI和machine learning(机器学习)的自我进化,我就光说Language model(语言模型)的自我进化,其实往前推的话也可以推到大概三年前左右。那个时候Google就有一篇论文叫做“LLM as Optimizer”,就是说用大语言模型当作一个优化器,可以优化不同的东西。当时我在AutoGen那边也有和同事出一个类似的概念叫做Agent optimizer(智能体优化器),就是说智能助手可以自己进化自己,自己优化自己。

只不过这两年大家发现模型的能力越来越强了,它可以自我优化的东西越来越多了。就比如说Anthropic有八成的代码是可以自己写的,训练模型不管是从哪个角度来说,从合成数据的生成、自然语言数据的清理,还是自我训练学习的代码、算法,以及infra底层代码,其实它都是一种代码的形式。一旦模型的写代码能力变强了,用它来进行自我提升,自己训练自己,其实是非常自然的一件事情。所以我并不觉得突然今年大家发现我们要自我学习,自我进化,让模型自己训练自己,其实早在两三年前大家已经开始慢慢地做这件事情了。

早期智能体自我进化研究背景

Beibin,你之前的背景是一直在关注模型的自我进化这条线是吗?你要不要简单介绍一下自己的背景?

对,我最开始是在微软研究院那边做多智能体的合作。当然那个时候我们不叫做自我进化,因为那个时候智能体都是一个比较新的概念,所以大家一般对外说都是说智能体。但是实际上我同事的一些工作就已经开始进行一些自我进化的。当时我们叫做agent optimizer和teachable agent,智能体可以教智能体下一次再做类似的事情的时候可以用哪一些技能,和现在的我们说的Skills这个概念有一点像。但那个时候大家用的概念还是比如说context management或者是prompt engineering,就是上下文管理以及prompt engineering,就是工程学怎么样修改prompt。

后来我去了Meta和xAI。在xAI的时候,我们就已经开始关注Agentic RL,就是通过强化学习来加强智能体的一些能力。比如说用工具的能力、写代码的能力,当时还有个概念叫做MCP Tools,当然现在也非常火,用MCP工具的这些能力。所以我们其实在早期,Simon和我大概一年前左右就发现了其实模型提高自己是非常可行的一件事情,包括我们当时做的一些强化学习的数据生成,其实有很大一部分是代码写的。到今年年初的时候,Andrej Karpathy发表了关于AutoResearch就是自己进行科研的一个项目,突然一下这个概念就爆火了。

递归自我提升 (RSI) 的长程任务挑战

对,我觉得非常好的自我进化的总结。今年说到模型的自我进化跟往年来说模型的自我进化有什么不一样的地方吗?我觉得今年大家再提到RSI的时候,他说的是一种递归自我提升。Beibin你要不要跟大家解释一下这个概念,以及比如说我们说这个概念的时候,是不是说以前我们在让AI进化的时候考官还是人,现在考官逐渐变成AI了?它是不是在解决更难的问题?

对的,这是一个非常好的问题。其实自我进化如果大家想象成是一个圆环的话,比如说模型自己找问题,自己出题,自己解答,自己训练自己。那RSI里面的R就代表是Recursive递归式,就有点像垂直的递归式,慢慢向上增长。这一点确实是跟以往的一些自进化有一点点不一样。

当然这一个想法也不是新的,今年跟往年的最大的区别就是在于模型的能力变强了。比如说Anthropic发表的论文或者是说发表的博客有提到80%的代码是它们写的,他们可以做人类大概一天左右时间做的事情。这个能力上来了之后,因为它是可以完成非常长程的任务,所以在一个长程的任务里面,这个模型可以提高自己好几遍。不像过往的,比如我们说LLM as Optimizer或者是agent optimizer的时候,LLM只会一次可能优化自己大概两三个小时。因为你优化太久了,它可能因为自己的偏差或者自己的能力不足,就很难继续往下迭代,因为它可能会犯一个小错误,那个小错误会自我积累,越积累越大,到之后就没有办法进行自我的迭代。

而今年为什么这个recursive这个R出来了?因为大家发现这个模型可以进行很长程的任务,所以它可以让这个模型自己recursive多提高几遍。

对,我看这篇文章里面有一个数据,就是说2024年3月份Claude 3的opus它可以完成人类约4分钟完成的任务,一年后就是3.7sonnet就可以处理需要1.5小时处理的任务。又过了一年,这个Claude4.6 opus可以处理长达12个小时的任务。整个我们看到大模型的改进速度是在翻倍的,而且这个比我们计算机领域的经典的摩尔定律它的翻倍的速度还要快。

是的,当然这个业界各家都有不同的说法,但是好像大家比较接受的判断是这个模型能做到的事情,对于人类时间来说每7个月会翻一倍。

对,您刚刚提到RSI它可以处理长程任务。我们理解这个长程是不是可以理解成它是一个需要很多个步骤,很多个环节来互相印证的一系列任务?假设我给一篇音频的文字稿给到模型去校正这个事实性的错误,这只算一步。但是比如说它能从开始的规划一直到最终这个播客做出来,这中间可能有十几个步骤,它能把每一个步骤都做好。长程任务是指这个意思吗?

是的,我说的长程任务是这个意思。当然不同的人对长程的定义也有点不一样,但是大体方向大家都同意这一点,就是模型可以自己在人类不监督的情况下可以工作很长。像您刚刚说的对于播客文件处理,比如说这个模型可以先剪切一下这个音频,自己听一遍,发现哪里剪得不对重新剪。这样可以循环几次,然后就可以进行到下一个点。这种任务可能平时对一个人类来说可能要花20个小时或者30个小时可以做完。在这个时候,如果我们的模型可以在人类不监督的情况下把这个任务完成的话,我觉得它就完成了这个长程的任务。

长程任务的技术挑战:架构、数据与基础设施

它是怎么做到的呢?这里就有非常多的技术细节。首先就是在模型的架构上可能就要进行一些创新。比如说传统的Self-attention(自注意力机制)其实是一个O(n²),就是我们在算法领域说的是一个Polynomial time(多项式时间)的算法。所以当我们的tokens比较多的时候,特别是在100万个上下文的时候,模型首先就是在推理的时候就会花非常多的资源。这个我们有很多现成的解法,就比如说GDN、GDNv2,DeepSeek-V4 Pro它也有自己的一套架构。

第二就是训练数据。我们要100万上下文Inference support(推理支持)其实不是特别难。我们只要把模型训练好了,放到SGLang或者vLLM里面,给它参数都设置好,它可以支持100万上下文甚至更多的上下文。但是如果你的模型没有在这种非常长的数据下进行训练的话,那它可能就是我们所谓的Out of distribution(分布外)。因为100万上下文是非常长的一个概念,就大概《哈利·波特》好几部书放在一起,而我们的代码即使是最大的代码仓库也很难会填满来满足这100万的上下文。所以在预训练和后训练的数据处理上,也是非常大的一个挑战。

第三点就是infra(基础设施)也是一个难度。不仅是说在测试时的Infra,而且是在训练时候的infra。因为你要如果让这个语言模型就直接输出100万个token的话,我们需要比如说在GPU上做一些什么样的优化,在kernel(内核)上改一些什么样的代码,这些也是非常困难的事情。所以这个就是为何训练这种长程任务相对于普通任务会是指数级的难度增长。

了解,了解。Simon有补充的吗?

还有就是真想解决长程问题的话,可能从agent架构上也可以有很多可以做的。因为即使是我们有100万的上下文可以处理,但是真正长程的任务可能都还是不止100万。这个时候我们还是需要比如说在有限的上下文里处理甚至无限的上下文,那怎么做呢?还是需要一些比如说agent技术,记忆的技术等等,去处理这种超长程任务所涉及的超长上下文这样的问题。

我们听起来很简单,但是这个中间可能涉及到了很多具体细分的技术体系。

Coding能力与自我进化

之前我记得Beibin你有讲过训练一个模型其实本质就是Data数据、infra基础架构和算法,这三件事。其实这三件事都高度地依赖写代码,所以我们今天看到像Claude它能表现出这么强的基础模型的研发能力,主要是因为它coding能力的提升。自进化的能力,它也是跟coding的能力是紧密相关的,我可以这样理解吗?

对,我基本上同意这个看法。

对,所以coding它会变成所有模型的一个标配的底座。

我觉得它会变成大部分模型的标配底座,但并不是所有模型的。比如说聊天型的模型,可能不太需要写代码的能力。当然了,聊天型的小模型可能也是通过一个大模型进行蒸馏的。所以它后面这个大模型需要非常大的比如说reasoning推理能力,需要自我进化,所以能自我进化来蒸馏到小模型里面。所以它背后的这些大模型肯定还是需要高度优化写代码的能力的。

我可不可以理解成单纯的聊天还好,因为现在我们其实都在讲怎么让agent完成一系列的事情,如果一旦涉及到了多步骤让agent去完成不同的复杂的任务的时候,Coding能力就会变得特别关键了?

是的,没错。因为coding其实,写代码不仅是写代码本身,而且可以通过写代码训练自己。另外它在coding里面要进行的归纳、演绎,这些逻辑推理的基本的思想和算法,其实也可以帮助模型在其他的一些方向上进行优化和generalize(泛化),就是可以泛化到其他不同的领域里。

解决递归漂移与模型自我验证

我发现在学术界其实自我进化它还有一个很根本的障碍,我看大家起了一个学术的名词叫做递归漂移。它的意思就是说,模型在自己去生成它的训练数据的时候,它推理的错误会在一次的错误中一代一代去累积。就比如说有的时候我们看它给我们的一个答案,这个答案的结果可能是对的,但是它的推理过程可能是错的。在这种让它自我进化的过程中,它就会把这个错误一代一代累积,最后可能进化的结果就越来越歪。这是两位在真正的训练模型中遇到的一个比较根本性的难题吗?

我非常同意这个看法。这个现象其实也是我们大家一直有注意到的。Apodex有一个不一样的地方,就是我们比较注重verification,就是自我验证。模型自己在训练自己的时候,如果它的验证有任何的漂移或者是bias(偏差)的话,会对结果造成不好的影响,因为它可以累积起来。

所以我们在做比如说写代码和做数学计算的这些任务的时候,我们比较容易验证,可以通过rule-based(基于规则),就是可以通过跑一套测试代码来确定它有没有对。所以在代码领域相对来说更好解决Recursive drift(递归漂移)的问题。

当然了,如果对代码领域有了解的一些专家可能还会发现,即使是有test script(测试脚本),即使有test code(测试代码),它其实偶尔还是会发生漂移。比如说test case(测试用例),不管是人还是AI在写测试代码的时候,可能偶尔会太宽,偶尔会太窄。太宽的时候可能会让错误的解题代码通过,但如果太紧的话有时候会惩罚写得对的代码。所以这种情况下也是还会发生细微的递归漂移,但是它会简单很多。

我其实很好奇,你们怎么去做验证?因为我知道,Apodex验证其实是你们主打的一个核心功能。因为我去试用了一下你们的产品,之后我是有收到一封邮件。这个邮件的标题非常有意思,它叫做很多AI系统生成答案,而Apodex验证它们。后来我才知道,原来你们公司的名字Apodex它是源自于一个希腊语,它的意思就是证明跟论证。所以相当于你们从成立的开始,就把验证、较真写到了名字里面。

Agent Team 与冗余验证系统

验证这一步,我们有很多套方法。因为不同的领域确实需要不同的验证方法。比如说代码,一般来说你可以用单元测试进行验证,当然你怎么写有时候会过宽有时候过窄,这是另一个很难的问题了。数学可以通过证明,证明现在有Lean这样的formal(形式化)验证的方法去验证。

但不得不说,还是有很多的问题其实是更多依赖于人的一种判断,甚至都并不是一种100%正确或不正确。这种时候我们其实是依赖一个Agent系统去做我们现在Apodex 1.0的验证的,我们管这个叫Agent Team(智能体团队)。大概就是说把一个问题,最开始会分解,我们会有不同的子agent,有的是去解决这个问题,我们会有另一个子agent单独地去验证另一个子agent写出来的解法。

之所以要分成两个子agent还是因为上下文的问题,不要让一个agent干所有事情,分成两个agent它其实效果会好很多。这是一个细节,而且一定要拆成两个agent,同时两个agent给它的指示也不太一样。

除此之外还有一些比较重要的技巧。我们最好是有一些冗余,同一个问题你让不止一个agent去做,我们会得到不止一份答案。其实这个冗余的思想在计算机里面有很长的历史了。但我得到不止一个答案之后,我们会让一个全局agent去判断一下哪个agent反馈的答案更准确一些。这样会比只用一个agent去解一个方面的任务会效果好很多。这是从agent方面我们有这些设计去做一些验证。

在训练的时候,我们也会专门针对验证去训练一些能力了。比如说我们会让agent去判断一下不同信息源搜集的信息哪些是更靠谱一些,哪些不靠谱一些。比如说一个论坛上的可能就不如教材上的关于同样的问题靠谱了。Beibin有补充吗?

另外我们在进行强化学习的时候,我们的裁判也会在训练的过程中一起学习。这样可以避免模型学会一些不好的行为,可以避免它进行一些奖励黑客。

如何判断AI公司的技术能力

因为现在我们说市场上的很多公司,他们可能都在做RSI,也都在做验证。大家觉得在这么多的模型公司里面,该怎么去判断一个公司这一块的能力是不是真的强?它是一个技术问题,还是一个,比如说我把更多的精力跟时间投入到这,它是一个意愿的问题呢?

我觉得两个问题都是。首先技术问题肯定是需要有的,因为在自我递归和自我进化的时候,如果它底层的代码、infra或者是训练代码有问题,技术不达标的话,这个是肯定做不成的。另外意愿也是很重要,有一些公司可能还没有意识到自我进化的一些需要强化的点在哪里。

对,真要判断一个公司的技术能力,可能还是需要去了解一些细节。自我进化这方面其实有很多种。比如说我就在harness这个脚手架上进行进化;有的是在预训练的各种配方上进行进化;有的是在后训练,包括搜集数据以及后训练的一些配方进行进化。如果真的想判断一个公司技术水平,我觉得还是要深聊一下,看看他们到底是在哪方面。

据我们了解,说实话在脚手架上进行进化是护城河比较低的一个原因吧。确实它的成本比较低,因为你基本只用调API,你就可以自我进化这些harness这些脚手架了。所以这方面即使是开源社区包括学术界也有很多的结果。据我了解学术界包括开源社区做得也都不错,当然公司里可能会有更多的资源,但其实这些技巧上可能细节上即使不用那么多资源你可以做得很好。

但如果真的要涉及比如后训练这样自我进化比较难的一些方向,确实你需要很多的资源。跟这些公司聊的时候,可以知道他们比如说是通过什么样的方式去进行后训练一些进化。预训练这方面现在可能大家看到的都是一些Auto research(自动化研究),比如说什么自动去训练 NanoGPT,这些确实都是一些比较玩具型的一些任务,因为它们这个模型都比较小,你可能调一个更好的优化器,更好的超参数等等,这些也是最近的自进化的一些paper。但真正把这个能不能scale(扩展)到产品级或真实大模型,其实是需要特别了解的。如果他们光说我是在一个公开的一些Auto research一个benchmark(基准测试)上我怎么怎么样,其实这个并不是代表什么。

Apodex 的全链路自进化方法

讲得特别好,你们现在是怎么做的,或者说你们一个理想式的目标未来会怎么做,现阶段是有哪些路径可以去达成?

我们其实在自我进化的时候把它分成了不同的阶段,我们有预训练和后训练阶段。预训练阶段的话,就是在数据的采集、清理上面会进行不同的自我进化的一些方法。

在后训练里面自我进化可能更加有效一点。因为我们在一个模型出来经过了后训练之后,我们才知道它会有一些什么样的问题。所以我们的后训练自我进化就包括:诊断自己有什么症状,哪里不达标;然后基于自己的诊断来造不同的训练的配方;第三步,拿到自己训练的数据和配方来自己训练自己,在其中需要verify,就是验证自己每一步做的是否正确;最后回到第一步,再诊断自己有什么缺陷。

另外在脚手架harness上面,我们也有一些自进化。同时在脚手架和后训练因为它其实挺难解耦的,所以模型在后训练上进化之后,我们的脚手架也会进行一个新的进化。你可以把它想象成两只不同的脚,左脚会踩一下,右脚会踩一下,让这个模型往前跑。

我理解刚刚根据Beibin你说的,你们所有的三种方式:预训练、后训练包括整个Harness的环境全部会用到。

对的。因为我们公司其实就是把自我进化当作是主要的方法论。所以我们在每一个方面基本上都会用到自我进化的思想。

难怪你们可以把验证写到你们的整个的Slogan里面。

这个我稍微补充一下。一个是验证能力是非常重要的,验证能力里其实一个是像代码这些你可以去formally(形式化地)去这种验证;还有很多的时候是模型本身的,我们管它叫元能力或者叫meta能力,包括判断这个答案对不对,分析现在模型的问题,根据模型的一些output(输出),这些是一些这种元的能力,这个是需要特别去训练的。

还有一点我想强调一下是搜索能力,尤其对于后训练是非常重要的。因为后训练绝大部分的方法就是说,你发现你的模型有什么缺点,假设你的模型已经可以判断出来当前这个模型有什么缺点,那么你需要去针对性地造一些任务以及对应的答案去提高模型这个能力。造任务其实非常依赖于搜索能力。基本上你造任务还是需要去网上搜索对应的一些不管是语料还是代码,或者相关的资料,然后造出对应的题目。所以search搜索本身是一个非常重要的能力。这个也是我们为什么最开始先去做DeepResearch,因为DeepResearch是一个非常general(通用)的能力。其中搜索可能是一个非常本质的能力,因为它就代表了当你模型需要提高哪个能力的时候,它可以指引你或找到对应的这些数据去提高对应的能力。

搜索能力与 DeepResearch 的结合

对,你刚刚提到了DeepResearch,现在应该是你们现在Apodex放出来的这个版本中目前最强的一块,对不对?但这应该只是第一步。

是的。就像我最开始说的自进化,你最开始有一个先做DeepResearch,相当于你可以收集目前已有的信息以及当前模型的能力。你可以制定一个计划,你去写代码,去提高自己的模型。你得到一些反馈,再做DeepResearch,就可以这样Recursively(递归)的提高。所以DeepResearch是一个比较重要的一环。

我了解到Apodex你们的这个模型是在通义千问的基础上做后训练做出来的。Simon你要不要跟大家讲一下,DeepResearch它的训练范式它有发生一些什么样的变化?比如说通过预训练做出来的DeepResearch跟通过后训练做出来的DeepResearch,它有什么不一样?为什么你现在会先选择后者?

因为我们公司也是刚建立,所以我们先开始从一个开源的模型就是千问3.5上进行后训练,得到目前的一个模型。后训练上我们会有一些原子能力特别的提高,比如说模型最开始做计划,这个我们会生成特别多的对应的数据去专门提高模型这样的能力。另一个能力就是搜索能力,搜索能力也是我们造了很多对应的题目,针对性地去提高模型的这些能力。

还有就是说跟Agent Team结合。我们去造了一些题目,这是就像Beibin说的左脚踩右脚这样一种感觉。我们需要Agent Team和数据一起开发,达到最后的效果。这是我们主要后训练做的事情。

当然有了预训练之后,我们这个模型会越来越强,预训练我们也是正在开发之中。之后也会从预训练的角度去做DeepResearch包括去训模型。

是的,我们公司最后会有一个完整的链路,就是从预训练开始到最后成品、到产品都会有的。

我注意到你们现在是在好几个DeepResearch的榜单上都拿了第一名,对吧?

是的。

要不要讲一下这些包括BrowseComp,这是OpenAI的一个benchmark(基准测试),还有DeepSearchQA,Frontier Science,这些都是Frontier Lab出的benchmark(基准测试)。

BrowseComp其实它更关注的就是搜索能力。它就搜索特别刁钻的一些问题,比如说我要搜索一本书它是几几年之前出的,它的首字母是什么ZY,大概这样的一些问题。这方面我们是SOTA,SOTA就是最高水准的意思,就是比包括闭源模型都要好一些。

Frontier Science更多的是给你一个实际中的科研问题,你能不能制定一个计划一步一步地该怎么做,大概是这样一类的问题。这个它会用一个LLM-as-a-Judge(语言模型作为裁判)去判断一下你这个合理不合理。当然他的原来的benchmark(基准测试)里有很多具体的判别标准,去看你生成的合理不合理。

这两方面我们都是说深入了研究,而且造出了对应的题目去提高我们模型的能力。还有一方面就是我们之前讨论过的Agent Team整个的范式,包括verification验证,还有最后有一些冗余,通过更多的冗余去判断得到一个更全局的结果,去最后生成一个答案。这整个的系统是让我们拿到了SOTA的水平。

防作弊与真正的 AI 研究能力

我看见像这种一般是能上网的模型,它有的时候它那个答案不是AI推理出来的,可能是因为它是搜索到了,它就会有一些失真。所以我注意到你们自己在做评测的时候,还是专门把这种能搜到答案的网站给屏蔽了是吧?自己去做的。

是的。这还是一个现在,尤其搜索类问题的一个general(普遍)的问题。因为这个benchmark只要它公开了,那么它的答案大家也知道,你可能直接在GitHub上新生成一个页面上面把答案放上面。那我新的一个模型直接就可以搜到这个答案,那我就算做对了。但这样并不是真正benchmark的目的。这个Benchmark目的还是比如说去考验你一个叫深度搜索的这样的一个能力。

所以我们一般还是会看一下我们自己生成的答案是不是进行了一些作弊的行为。如果有这种作弊行为,我们会把比如说GitHub屏蔽掉。但有些榜单其实已经污染得比较厉害了,干脆后来也就不报了。

对。我注意到你们在DeepResearch的后训练环节,其实你们相当于是用一个整个的agent的团队去替代单个agent的验证的。然后你一个比如说复杂的任务,你能调动上百个子的agent。你会认为是一个聪明的AI反而干不过一个会相互check(检查)的团队吗?

对,我非常相信这一点。因为这是目前我认为是基于Self-attention(自注意力)结构的一个本质问题,而且我认为即使你用Linear Attention(线性注意力)这样一些新的结构,应该也解决不了超长上下文这样的问题。上下文越长,Attention的注意力效果就越差。所以你单个模型,至少在目前的技术范式下,它还是有上限的。

记忆力机制与多智能体系统

当然这个跟人类也很像,就是说人的脑子它还是有限的,所以你才需要纸笔,把一些信息记录下来,然后之后你再调用它。至少在近期,我其实不太相信你用一个agent能解决特别特别长的上下文的问题,所以这种时候你就需要多个agent以及记忆力机制,比如多个agent去解决不同的问题。包括记忆机制,把这些信息保存起来互相分享,整个的一个系统去解决一些超长程的问题。

工程能力与模型能力的互补关系

所以你觉得现在,我们说到DeepResearch它的能力的话,它的工程能力跟模型能力谁更重要呢?

我认为这两个属于1+1大于2的一个结果。你当然可以一直去强化模型能力,而且模型能力我认为现在还是可以继续提高的。但是当模型能力达到一定程度的时候,你稍微做一些agent上面的优化,你可能就一下子大幅提高这个能力。当然你agent这工程它总是有限的,或者说agent harness脚手架上的提高总是有限的,这个时候你还是需要一些模型能力的本质提高,进一步提高DeepResearch或generally(总体上)整个这个系统的能力。所以我觉得这两个基本上是一个1+1大于2的一个感觉。

我虽然知道你们主要是在做模型的,但是想替创业者问一个问题。我们说之前大家在创业的时候最担心的一个问题就是说,你的模型的基础能力一升级,基本上所有这些干agent的、干垂直方向领域的,它的能力很快就会被这个模型的基础能力给覆盖掉。如果按照我们刚刚讲的,一个聪明的AI,由于attention(注意力)的、Transformer(架构)的整个架构上的一些限制,它反而干不过一个相互check(检查)的能力。是不是说现在一个能把工程能力做到极致,把很多个子agent它用得非常好的团队,它也具备自己一个非常深的护城河,不太容易被模型智力的提升给覆盖掉?

我基本上是同意这一点的。Agent系统本身,我们也是经过大量实验才验证出来我们这个目前的系统是比较合理,而且是效果很好的。如果一个创业团队真的是证明了自己在用整个agent系统达到了一个非常好的效果,那肯定他们之前也是做了大量的实验去验证,这个确实是非常work的。但是怎么说,这个领域相对也比较卷,能做这种实验的团队可能也不少。因为这个并不是说训练一个模型,确实还是需要很多资源,但是去调或者做agent相关的实验还是相对来说需要的资源少一些,你基本上只要调API就可以了。当然有些垂直领域其实你可以越做越深了,包括金融、法律,确实还有些具体领域的知识经验其实还是挺有意义的。Beibin有补充的吗?

往后退一步想的话,如果一个模型或者说一个Single agent单智能体能做得很好,如果我们把它harness设计得更好的话,来多个智能体一起合作,可以把这个问题做得更深更好。所以我觉得在垂直领域做这种Agent Teams或者是做脚手架的公司,未来肯定还是有发展的,而且是有非常多的机会的。就是有一点要注意,因为现在模型的发布非常快,可能每个月都会有一两个比较强大的模型出来,所以有了新的模型,可能这个脚手架的设计也要微调一下。因为新的模型会有新的一些能力,有自己的一些品味,模型自己的一些行为都会不太一样,所以这个脚手架调一调,可能会做得比以前还要好。这个也是我们在之前做自我进化的时候发现的,为什么在后训练以及在做这个脚手架的时候很难解耦。如果你的模型能力或者是说训练数据稍微变一下的话,那它对新的脚手架的适应能力可能也会有一些微微的改变。你可能可以设计出更好的1+1大于2的效果,或者是说模型变强了,你的脚手架变得也很强,然后放在一起可以打出一个爆炸性的效果。

听起来现在还是一个行业很卷、很辛苦,要时刻跟着模型迭代去更新自己架构的这样的一个行业。

对的,我同意。AI行业一周可能相当于传统行业一个月甚至一个季度。

Apodex 的发现模型愿景与定位

接下来可能是聊到我最兴奋的一个板块了,就是Apodex,它是要做discovery model(发现模型)的。Simon,你要不要跟大家先介绍一下整个Apodex它是一个什么样的模型?它其实是大家很关注的,陈天桥先生创建的,他是说自己要去做一个让AI做发现、做科学这样的一个模型。

对,我们的长期愿景是Heavy Duty Solver,我们强调的是解决很难的问题,而不是比如说一个聊天机器人这样的大模型初期的一些应用。我们的手段是通过自我进化,这是我们一直在强调的,我们相信大模型最终是能解决人类之前解决不了的这些问题。从经济的角度来说,现在大部分的模型厂商都是在卖token,但我们相信真正通过大模型去解决了一些人类没有解决的问题,那么解决问题本身所创造的价值应该是远大于卖token的价值。所以我们陈天桥陈总这边的目标就是说我们直接去解决最难的问题。从经济上来说,我们可以得到直接解决最终问题的价值。从问题角度来说,我们现在考虑的领域包括生物、材料科学等等。我们这边也有一个专门的团队,我们叫Heavy Duty Discovery,就是专门去找到最难的问题的一个团队。我们会针对性地,比如说进行模型训练等等,去解决那些最难的问题。

比如说你刚刚提到的,你们内部有一个Heavy Duty Discovery的团队,他们现在具体是在找哪些问题?现在你们第一步想要切的是生物医药领域,对吗?

是的,第一步是生物医药,包括制药、靶点发现、老药新用,也包括疾病诊断。很多问题确实是非常具体领域的问题,所以我们需要一个专门的团队去找到什么样的问题是合适去解决的。

那很期待你们的下一步。我觉得我们可以说一下让这个模型解决问题。我发现其实你们也给自己的定位说,你们要做的是discovery model(发现模型),而不是generative model(生成模型),中文说就是你们要做的是发现的模型,而不是生成模型。Beibin你要不要跟大家解释一下,这两个模型它在根本上的区别是什么?

对,让模型提出一个假设其实并不是特别难的,但是难的就是提出的这个假设特别的Out of distribution(分布外),就是可能在Pretraining data(预训练数据)在网上比较难找到,或者说比较难想到的一个假设,这是第一。第二个更大的难点是说,我们要怎么样验证这个假设。当然这个跟怎么样做Verification,怎么样自我验证也是强相关的一个部分。所以如果我们把discovery切细来看的话,第一,需要非常有创新性,能提出新的假设;第二,需要能判断这个假设成不成立。当然这里也有很多不同的方法可以做,比如说可以用DeepResearch的方法收集已有的信息,找更好的假设,也有可以用写代码或者是Self verification(自我验证)的这些方法来跑一些实验。如果我们能在计算机上跑一些比如说模拟的话,也可以让我们对这个提出的新假设更加有信心。所以discovery的瓶颈第一就是未知领域其实很难有标准答案,也很难照这种Simulation environment(模拟环境)得到可信的验证。所以self-evolution(自我进化)是我们通向Heavy Duty Solver和discovery的一个主要方法。

培养模型的学术品味与提问能力

对,我们在说到Discovery model的时候,刚刚你提到了要做很多假设然后要去求证。其实这让我想到了科学领域最基础的一个方法就是八个字:大胆假设、小心求证。我觉得这其实也是我自己开始做记者、做报道的时候一直在贯彻的一个价值观,就是要大胆假设、提出傻的问题,然后再去求证思路跟这个问题是不是对的。但是同时,如果我们把这个交给模型的话,大家以前一直对这个模型的印象就是说一个模型它能从网上,从人类现有的知识库里面找到已知知识的答案,就已经很不错了。现在模型的智力怎么样才能够让它做到理解贯穿人类的知识,同时还能提出问题?因为我觉得这个已经不是说在让AI去做一个解题者了,这个更像是让AI去做一个科学家,它能够提出问题、发现问题,这个是很难的。

对,你刚刚提到的这些其实是现在的一个难点。因为怎么样训练一个Generative model(生成模型),其实市面上已经有非常多的可行性方法了,相关的recipe和训练配方其实也是特别成熟的。但是如何让这个模型进行一些假设和discovery,这个其实是大家还在调、没有完全调通的一件事情。回到刚刚你说的一点,怎么样像科学家一样在未知中提出问题。这里也可以再往下切细一点,比如说在写代码这个领域,比如说SWE-Verified这种类型的题目,其实我们都是在训练模型怎么样做一个解题家。但是会提问其实是一个我们叫做的Meta能力,更高维的一个能力。这个其实也涉及到了我刚刚说后训练的一个loop(循环),就是要自我诊断,然后再自我造题,然后再自我训练。你要怎么样在这个模型现在的回答里面,或者是所有收集的这些信息里面,怎么样诊断出哪里的能力有问题,或者是哪里的hypothesis(假设)需要往深入更看一下的话,这个是我们接下来会注重的一个领域和方向。

对,在学术界大家都知道有好的论文跟灌水论文,其实我们也想培养模型变成一个真正的好的科学家,那么你就需要培养一个非常好的taste,就是学术品味。你提出一个新的问题肯定是需要先做DeepResearch找到已有的知识,但是你提出什么样的问题其实是仁者见仁、智者见智的。你可以提出一个比较,我们叫Incremental(增量式)的问题,它可能比较容易,但是你可以发一个论文。但你也可以提一个比较本质的Fundamental(根本性)的问题,它可能不是那么容易解决,但解决了它,真的是能让科学有所突破。所以这个也是我们之后会进一步训练模型,就是说让它有更好的学术品味。其实训练方法上可能还是需要跟人类最顶级的科学家去对齐。这些陈天桥陈总这边其实也是经常会让我们和一些顶级的科学家一起去讨论,甚至他们提供一些insight(洞见)或者数据等等,去帮助我们模型有更好的品味。

避免模型拍马屁与对冲行为

我觉得其实两位也是顶级的科学家,大家觉得他们有什么样的共性?比如说我们从他们身上学到的特质,怎么把它转换成一种计算的方法,或者说是跟AI交互的方法,这块大家有什么样的思考吗?

我们一般说,什么样的是一个顶级科学家,一般不是看他有多少篇论文,一般是看他最好的论文质量有多高,所以我们一定要追求顶点,解答这些最本质的问题。所以这个甚至要写在模型宪法里。具体实操上、训练方法上可能还是目前已有的一些,比如说RLHF这种人类偏好、SFT监督学习或者RL(强化学习)。这里可能一个最简单的方法当然就是偏好了。比如说你问一个科学家两道题,他一般是能判断出来哪个是一个灌水题,哪个不是一个灌水题,你应该让模型去多提一提非灌水题。

AI现在能判断哪个是灌水题,哪个是非灌水题吗?

只要经过这方面的训练,我觉得还是没什么问题的。

Beibin你觉得在跟一些顶级科学家交互的过程中你有学到什么?以及你觉得这些思想怎么可以用到模型的训练中去?

我想来想去,可能还是品味这一个词。其实AI马上就能进行自我进化了,我对这一点非常坚信不疑。要么是接下来半年,要么是一年,反正在接下来两三年内,肯定自我进化就会成功了。在那个时候我们还需要顶级的AI科学家干嘛呢,或者是说我们还需要人类干嘛呢?想来想去就是品味这个词。因为训练这些不同的模型的时候,我发现了这个品味是真的,同样读完一篇论文之后,你可以想到一个非常小的改进,或者你可以想到一个Substantial improvement,就是一个非常长的、非常大的假设,但是要干非常多的活,要迈非常大的步子才能解决的问题。这是一个非常好的例子。其实我现在觉得,即使是市面上最好的模型,它的品味其实也是远低于一个普通的AI科学家的。这也是为什么现在AI写代码写得很好,但是还是不能把模型的训练全部自动化进行起来。所以我觉得接下来不管是作为一个人类AI顶尖的科学家,还是说作为一个researcher(研究员)、一个engineer(工程师),在训练这个模型,都是需要把控模型的品味的。

这个其实是非常难的一件事情,因为如果大家用过很多不同种类的模型,大家会发现,所有模型其实有一些通病。它们或多或少都挺喜欢拍马屁的。一个喜欢拍马屁的模型,其实很难提出一个大胆的假设。另外除了拍马屁这个缺点之外,它其实还是有一点我们叫做hedging behavior或者是一些对冲的行为,就说这也对那也对。对,用户你说得非常对,刚刚是我的疏忽,但是我说得也没有错,你说得更全面,你想要问其他的问题吗?就我们可以看到这些AI模型经常会用这样的方法来回答用户问题。所以我们在训练不管是说verifier(验证器),还是self-evolve(自我进化),还是discovery的时候,都会对模型的提出假设能力进行一个后训练。就比如说这个diagnosis(诊断)里面,但是这也是有另外一个缺点,就是我们怎么样能保证我们训练的新的模型不会出现鸡蛋里挑骨头的那种行为呢?这就是要品味来平衡,就是模型不要拍马屁,也不要鸡蛋里挑骨头,能真的是实打实地提出一个非常好的假设。然后再像您说的,就是小心验证,把它验证出来这个假设。

模型偏好数据与性格训练

你刚刚提到了模型拍马屁,用户说什么它什么就是对的。我确实发现我在用很多模型的过程中,这是我觉得最痛苦的一部分,就是它不会给你一个事实性的答案,它给你的永远是迎合你的那个答案。这一块是不是跟在训练模型的时候把这个模型的参数往哪边调,给它注入什么样的人格特质是有一定关系的?而且每一家模型其实我觉得大家的风格细微上都会有一些不一样。

对,当然我们Apodex因为不做聊天模型,所以可能会稍微好一点。就是因为我们不管是哪家公司在后训练的时候或多或少地会有一个RLHF(人类反馈强化学习)的一个阶段。RLHF它的来源数据基本上是用户投票的数据,就有点类似于LMSYS Arena那种形式,也有可能是模型训练公司自己让员工去标的一个Preference偏好数据。人不是完美的,所以人类作为本身就会可能有特殊的偏好。比如说偏好说好话拍马屁的模型答案,可能偏好写得非常强的答案,可能偏好格式上非常的结构化,像有非常多章节、非常多列表的一个Markdown的格式,即使这个Markdown它本身没有什么实际的意义。就是因为这种人为的一些偏差,才会让这个模型有不同的拍马屁的行为。Apodex因为想做Heavy Duty Solver,所以我们不会用网上大众的这些人类的偏好来训练这个模型,所以可以或多或少地避免些许这样的问题。未来我们在训练这个模型的时候,肯定是想要最顶尖的人类来标这些偏好数据,或者是说给不同的模型答案打分,确保公正公平,也可以从数据源头稍微解决这些问题。

我觉得这几个方向都还挺重要的。你刚刚提到了既不要拍马屁的模型,也不要鸡蛋里面挑骨头的模型,可能不做拍马屁的模型因为你们不做ToC的用户端,这个对你们来说是稍微简单一点的。不做鸡蛋里面挑骨头这一块,你会有经验吗?以及我们知道了两个不,那要做什么样的模型,要把什么样的人格注入到这个模型里面,大家有什么样的想法吗?

对的,刚刚我们其实是聊的品味。我把左和右两个不打出来,中间就是我们要的,就是要有品味的。不管是这个模型通过research找到了一些相关的信息,还是通过写代码得到了一些答案,有了这些所有的原始材料之后,这个模型要通过自己的思考、自己的推理,来给出一个相对比较合理的解释。Agent Team(智能体团队)的话,其实也能稍微把这个问题解决一点。拍马屁这个事情我们其实在做的就是说,用户让我们做的事情,但如果我们觉得不合理,那么我们应该告诉用户我们不应该去拍马屁。我们其实是有一整个系统去达到这样的目的的,包括我们的Constitution AI,就是说我们这个宪法概念,应该是Anthropic几年前就提出来了。这个给我们整个模型定义了一个性格,这个我们都是把这种性格训练在模型的权重里了,去实现它。当然还有很多,比如说我们注重真实性,比如说如果用户说错了,我们要去纠正他。那这样的里面的细节,就是通过验证verification或者Agent Team整个的形式或多或少会去验证用户说得对还是不对,然后我们会去反驳他。至于什么样的问题是好问题,就是不在鸡蛋里挑骨头,这个确实是一个品味问题,这可能你甚至让我们去写一个宪法,或者写一个文档,告诉你什么是好问题,什么是不好问题,也是很难写出来的。这方面更多的还是通过和顶级科学家去聊,以及顶级科学家提供的一些,比如说偏好数据等等去培养这样的品味。其实这个也是和平时我们在学校培养PhD是一样的,比如他们来问我们是什么样的一个题目值得做、什么不值得做,我们也会告诉他。确实我们公司有这种能接触到各行各业的顶级科学家的资源,这是非常重要的一点。所以这也是陈天桥陈总从一开始的一个愿景,就是说我们从一开始就要做Heavy Duty Solver,所以我们就需要和顶级科学家进行对齐,然后去培养这样的品味。

顶级科学家数据样本的扩展与转化

这点提得特别好。我确实知道陈天桥先生这边跟很多主流顶级科学家都保持着非常密切的联系。我在想,因为人类的顶级科学家这个数据量的样本是非常小的。我们说大模型,它大很重要,就有scaling law(规模化法则)。顶级科学家人工去判断的品味标注的数据跟用更大量的数据去训模型来比,在里面它能贡献的核心的比例是多少呢?因为它的数据样本还是很小。

是的,从数据这个角度来说,预训练方面确实需要大量的数据,所以才有scaling law。后训练相对来说需求会少一些,而且现在已经有更多的方法去把一个人类的品格或者性质总结出来。比如说Meta最近也是在蒸馏员工等等,其实也在蒸馏他们的性格或行为习惯,对吧?所以其实最近越来越多的还是说把人类的一些品格、性格去总结出来,还是慢慢地可以做到的。这也是一个比较新的方向,就是说一个个体他的能力、性格等等能不能用一些自然语言或者说一些方式,把它转化到让大模型可以去利用起来。

我记得在音乐模型刚刚兴起的时候,就是Suno的那一波。当时我有问做这个音乐模型的科学家,我说Suno做的歌太一般了,我觉得它就是一个大街上的口水歌,我说它能做出像周杰伦、Taylor Swift这些非常好的、有很好品位的歌曲吗?他当时给我的答案是,他说可以,但是这个事情它不是受限于技术,它是受限于版权。因为版权的因素,他们不敢拿顶级音乐人的歌曲去训练,所以他们用的就都是那种版权库里面一些简单配乐的歌。但是如果你真的用这些人类最精华、最好的歌曲去训的话,他觉得是完全可以训出来的。如果我们说用顶级科学家的品味去训模型,是不是也是同样的道理?

对的,我很同意这一点。我们人类也是从比如说一个婴儿开始,最后有的就成为了顶级科学家。尤其成为顶级科学家这条路,其实也是别人给他的这些反馈,告诉他什么是好的,什么是不好的。而且得到的数据也并没有那么多,我们还是相信通过顶级科学家给我们的这些指导,我们可以拥有顶级科学家的品味。

AI赋能科学的竞争格局与 Apodex 优势

对,然后我注意到,其实想让AI去做科学家,自己去做发现的模型,几乎也是所有的现在我们说顶级模型公司都在做的。比如说OpenAI它已经把能自己扛下一个大型研究课题的AI研究员定成了未来几年的头号目标;DeepMind它创立的那天起它也是为科学而生的,我们之前讲过DeepMind的创始人的历程,大家有兴趣的话可以回听一下我们那一期的播客,AlphaFold它还拿了诺奖;现在包括Gemini它也是说自己要去做多智能体的Co-scientist,就是共同合作开发的科学家;同时Anthropic它的Dario他也想要有一个国家级的科学家的天才。所以我听上去,现在所有的顶级模型公司都想去做科学家,都想让AI去做发现,去提出好的问题。你们觉得Apodex它的核心优势是什么呢?我觉得不做ToC类的模型应该也可以算是一个核心优势,因为它可以去调一个模型的权重,还有其他的吗?就这个战场是相当激烈的,你们进入了最激烈的战场。

这个我很同意,但这个战场的首先价值是很大的,因为它真正解决了一种难的科学问题,它是有很大意义的。另外科学问题其实还是一个非常广的,因为这个世界上有那么多学科,其实你解决其中几个问题就已经足够说是一个很大的突破了。所以我觉得不止一家公司可以成功了。Apodex这边的优势,我觉得就是我们比较专注,一是就像你说的,我们不是一个聊天机器人这样的模型,我们基本也不取悦用户的一些特别的偏好。其实到现在大模型的整个发展,比如说训练的各种方法,或者这些配方算法什么的,大家也都知道的大差不差,更多比拼的就是一种执行力以及整个组织架构。我觉得我们这边自上到下,从陈总那边开始,他自己也是一个非常非常卷,整天会和我们进行交流,整天会和AI进行交流,并且给我们不管从方向上还是一些其他方面,都是提供很多指导以及帮助。我们下面执行力都很强,因为我们还是一个非常小的Startup culture(初创文化),所以我们还是比较专注,就做好这一件事情,做一个Heavy Duty Solver。我觉得从组织形式上我们还是和大厂、大公司相比有很大优势,我们这边摩擦也比较小,交流成本也很低,这些或多或少都是很重要对于一个大模型公司能快速发展的关键。Beibin有补充吗?

我其实做所谓的AI for science(AI赋能科学)这个概念已经做了有十多年了,我在读博士之前就在做AI for science,当时主要是在医疗行业和自闭症用AI。其实刚刚你说的现在很多公司都开始往AI for science做,我其实觉得并不是一个竞争,反而我觉得看到的是希望的曙光。因为过去十几年来说,科学技术或者说IT技术For science(科学研究)其实是没有太多真实、非常scalable(可扩展)的成果的。但是因为LM(语言模型)、Generative model(生成模型)和discovery model(发现模型)的技术的提升,我觉得在未来,比如说5到10年,真的做出非常有科研价值和现实意义的成果是有非常大的希望的。这个世界上所有的科研问题是无限的,或者是说有价值的科研问题也是无限的。但是我们人的精力是有限的,整个世界的GPU也是有限的。要怎么样在有限的Resource和资源里面找到最有价值的问题去解决,这个才是最重要的一步。所以Apodex有一个HDD团队,叫做Heavy Duty Discovery。这个团队我们是有全职的员工,跟不同的顶级科学家交流,再从几千个科研问题里面找到最有价值的问题来做,这个可能是我们Apodex和市面上一些其他不同公司的一个比较大的区别吧。

Heavy Duty Solver 的通用元能力训练

我觉得你这一点讲得特别好,真的是我们说AI for Science科学问题它是无穷无尽的。刚刚我们提到了生物医药,我们之后还会有一期会专门聊DeepMind他们是怎么去做自己的生物医药大模型的。那DeepMind这条线也很有意思,它从最早去解决蛋白质怎么折叠到现在它是预测药物和蛋白怎么结合的,而且我觉得它也只解决了新药研发流程上偏上游,就是计算预测的这一段,它离真正把药做出来送进临床中间还是有一个巨大的空间的。但是光就这一段,它已经是撑起30亿美元的融资了。所以哪怕我们说都做生物医药,它这个里面的问题也是无穷大的。所以科学问题还是很广阔的,包括我们之后还说有什么物理问题、探索太空的问题、材料的问题。

对,无穷无尽。

对的,另外我再补充一点,就是我们Apodex不是做AI for Science,只不过AI for Science跟Heavy Duty Solver有非常大的重叠的地方,所以我们就会聚焦上,比如说医药领域和生物领域。

AI for Science跟Heavy Duty Solver,这两个你能不能简单解释一下你们做的方向上的区别是什么?

现在有很多模型,它们叫垂域模型,就他们真的是会用大量某一个具体领域数据去训练这个模型在这一个领域里的能力。但我们这边的Heavy Duty Solver我们还是一个比较通用的模型。我们会强调一些特别的元能力,包括验证能力verification,包括分析能力、搜索还有计划planning这样的能力。这些元能力我们相信是对真正的一些难题都是有意义的这些能力,这是我们会去着重训练的,但我们不太会针对某一个特别的领域,比如说生物我们会放50%的data,这个是我们不会去做的。

AI 自我进化的闭环与目标对齐挑战

刚刚Beibin你提到的有一个小细节我非常感兴趣,就是你说AI还有半年它就能完成自我的进化跟提升了,这句话我当时觉得很有意思,但是你能不能详细地解释一下它是什么意思?

我说的半年是说最快可能半年之内能开始把闭环跑通。闭环的话,我觉得难度最大的其实是Post training(后训练)。我觉得在半年之内它这个闭环能跑出一环,如果说RSI,这个R是recursive(递归),要跑很多很多环,但我觉得它跑完一环应该是半年到一年左右就能做完。就比如说我们这个模型可以在随便一个领域,比如说Coding for material science(材料科学编程),可以在这里面发现自己写的代码会有什么问题,会造很多这样的训练环境和训练数据,在此基础上自我验证是否这道题训练完之后是有提升,以此迭代。它这样迭代一个loop一次循环,我觉得半年之内应该是能成功的。因为Anthropic在这几个月也发过一篇博客文章,说大概80%的代码是(它)写的,但是现在有一些问题,这个问题即使是现在市面上最强的模型也没有完全解决,但是从我们最近的一些观察和训练的结果来看,我觉得很快就会有一些突破了。

他指的问题是什么?就是没有解决的问题。

当然这个问题有很多,但我觉得让我睡不着觉的一个问题就是,我们怎么知道这个模型在自我进化的时候它是满足人类的需求,它没有跑偏?这个跑偏可以是说在安全上面的跑偏,也可以是说在目标上的跑偏。如果我们只是简单地说,你给我造一个更好的做材料科学的一个模型或者是一套算法,它可能真的造出来了,但是它在你没有观测的一些点,就比如说成本,或者是说在一些其他的比如说疏水性这种性能上可能会有非常大的一些妥协,这个是我比较担心的。因为人和人交流的时候一般说需求会说得比较的模糊,但是特别是在训练模型的时候,如果你跟模型或者是说这个evolution(进化)说得比较模糊的话,它可能就会——

模型行为的监控与“员工蒸馏”

这个用户让我迭代写代码的能力,但我这边碰到了一个瓶颈。但是不管怎样,让我换一个方法来达到这个目标。我们要对模型这个行为进行一个监控,是让我觉得最大的一个问题。

你觉得现在某种程度上,这两个问题,一个是安全,一个是它达到目标不择手段的,这两个能力,这两个问题现在解决了吗?我个人看来还是没有解决。但我还是一个非常乐观的人,所以我觉得应该是很快就会有解决方法了。

你刚刚提到,这是一个让你睡不着觉的问题。从你的角度来说,有哪些方向的解决方案,会让你现在觉得稍微安心一点?我们当然能想到的,一个是穷举尽可能多的可能性,但是这个看起来是不是有点笨?对,这里也是为什么我们还没有完成全自动化。我其实现在做的最多的一件事情,就是在每天工作时间读这个模型的输出和读智能体的每一步的操作,确保它每一步的操作,或者是说整一个大概都在我可以理解、可以控制的范围之内。一旦我发现,比如说它这里有一些比较蠢的一些行为,或者是说我感觉有一点不太对的一些解决方法,我就会赶快停下这个智能体的循环,稍微手动地改一改、调一调,让它进行进一步的一个提升。这个就是刚刚我们说到的蠢方法,但是我现在是手调。未来能不能有一个智能体代替我帮我做手调?就是现在大家提的很火,也是很搞笑的一个概念,就是员工蒸馏,能不能把我每天做的事情蒸馏到这个智能体里面,或者是甚至蒸馏到这个模型的capability(能力)里面。我觉得这个想法,虽然说大家是说笑话,但我觉得是可行的。如果我们在三个月之内,能把我或者是说我的同事蒸馏到Apodex的模型里面,或者是我们的脚手架里面。其实有很多我们现在每天在做的事情,不管是读代码、改代码,还是读模型的输出、读智能体的输出,都是能加速自我进化、自我迭代的流程的。

面对AI蒸馏的失业担忧

我们假设真的把Beibin蒸馏了,你会担心自己失业吗?说不担心肯定是假的,但是即使我担心,我其实还是乐观的。当然了,不同的人有不同的例子,什么有汽车代替马车的例子,有什么AT&T自动转接机的例子。但其实我觉得这一次可能跟之前的工业革命有点不太一样。我确实有点担心自己会被代替。我记得非常非常清楚,2021年我就开始有这个担心了。当时是GPT-3年代,连GPT-3.5都没有,GPT-3被微软放到了GitHub Copilot里面。当时我打了一个函数的名字,它能把整一个函数给我补全。当时我还在读博士的最后一年,我就觉得我整个人就瘫在椅子上了,我觉得完蛋了,我毕业即失业。我整一个PhD、整一个博士学的东西,它都能一行帮我补全,那我以后是不是就没工作了。但是你看现在五年之后我还在这里,我还有工作。只不过我日常每天做的工作不一样了。我不再一个函数一个函数地写代码,而是我会在更高的一个维度、更高的一个层面,监控不同的智能体写代码。所以,对,这个模型会取代我今天做的事情,但它不一定能取代我五年之后会做的事情。

RSI闭环与模型漂移问题

对,你刚刚提到了,你每天在给模型去评判它的质量行不行,然后去再做验证的这些工作。如果未来有了一个假设Beibin的AI agent,它可以带你去做监督、校验、验证的环节以后,那其实相当于AI就开始自己变成了一个考官。它所有的行为,都是在模仿你的行为、你的品味、你的价值观去做类似的判断。那是不是说,当有了这样的一个AI以后,整个这一套就是让AI去验证的RSI,它的闭环就跑通了。这就是你说的,还有半年的时间可以做到RSI的SI(自我提升)就跑通了,R可能还要再多花个一年、两年?

R是什么?R是recursive(递归),就是把它这个迭代起来。因为现在即使我们跑通了,我们每一次迭代之后,或者说每几次迭代之后,我们其实还是要人为地去看有没有recursive drift(漂移)的问题。所以半年、一年我们可以解决这个循环,但是没有办法完全地解决漂移。但是我还是有信心几年之内,这个漂移的问题也可以把它完全解决。现在我们把这个漂移问题可以不停地缩小。假设现在普通的模型每一次可以漂移10%,如果我们能把这个漂移降到1%,那就会很好了。但是我们未来的目标,是把它降到0.1%甚至0.01%。这样我们可以非常有信心,这个模型自我迭代,比如说3个月、6个月之后再回来看,它有没有超过。相当于我们monitor(监控),我们监控的周期不需要这么频繁了。

谁在塑造AI的品味

了解了解。对,那这个应该是整个业界基本上是一个共识,大家都在往这个方向走。你觉得在整个走的过程中,其实我们刚刚提到了,现在AI自我进化最后的一道坎,一个是提出问题的品味,一个是判断结果可不可信。其实这两个方向你们都在押注,一个是发现,一个是验证。你觉得这个品味它是谁的品味?它是科学研究员的品味,还是说它是创始人的品味?这之间它是怎么互相体现的?

这是一个很好的问题。我觉得现在来说大部分是AI研究员的品味。但是研究员的品味是被,我们叫做indirectly(间接地)被创始人的品味影响的。因为陈天桥陈总他在选择研究员的时候,肯定会根据自己的品味选择研究员。但是这一些我其实都不担心,因为品味没有对或者是错的区别,也没有好或者坏的区别,就只有适合和不适合的区别,这是第一。第二是不管怎么样,这个模型虽然说现在是用我们的数据,或者是说我个人来监控这个模型的行为。但是未来我相信,我们把这个线放长一点,放到五年之后,可能我们的品味对这个AI模型的影响会越来越小。就像AlphaGo在最初训练的时候,是受到训练数据或者是说棋谱的影响很大。但到AlphaZero出来之后,它已经不是从人类的品味中学习这个技术了,而是会自我品味、自我回放、自我推理来学习,它有自己独特的一套品味。

所以AI会在它整个过程中再通过RSI这个R形成自己的品味。没错,我觉得我们的品味只是一个,我们如果放在训练这个语言里面叫做warm start(热启动),就只是给它热启动了一下,以后AI会有自己的品味。

创始人陈天桥的战略把控

你刚刚提到了陈天桥先生对Apodex的品味,具体他在工作上,主要是关注在哪些方向?他怎么样去保证大家研究的焦点,始终是在一些重要的问题上?

这也是一个很好的问题。陈总在战略方面有非常多的把控,也经常跟我们开会聊和研究,以及对齐我们的所有的战略方向。因为我们都有不同的背景,比如说我之前做过很多年的AI for Science,Simon之前做过很多年的强化学习。我们总会把之前在学校,或者是说学术界的一些习惯带到Apodex。这个时候陈总就可能会发现,我们的一些押注可能和公司的大战略方向不是特别对齐。这个时候陈总一般都会跳进来,跟我们开个会,指出我们的一些错误,或者是哪里偏离了公司的使命,会把我们掰正到正确的道路上。

能举一个具体的小例子吗?比如说,我们Heavy Duty Solver本身它应该有很强的推理能力。所以当你碰到一个问题的时候,你应该先去把这个问题分解,再去进行搜索、搜集相关的信息,再去总结这些信息,然后去给出答案。这是比较合理的一个Heavy Duty Solver,或者一个比较强的、注重推理能力模型的行为。但是我们之前很多的时候,为了注重它的搜索能力,所以我们放入了很多搜索的相关的数据。模型的行为会上来就去进行搜索,而不是上来先去仔细思考这样的问题,把它分解成一些子问题,然后再进行搜索。所以这从行为上,陈天桥陈总自己去用这个模型,他就能看出来,这个模型的行为并不是真正的Heavy Duty Solver的这样的一个行为。所以从这个时候,我们就要去改变这个方向。首先我们要去改行为,不管从数据还是从agent等等形式上。这里也涉及到我之前说过的,我们模型的宪法基本上也是陈总自己制定的,这个我们也是用到了比如说模型的训练、各种调优里面,都会用到陈总参与撰写的这个Constitution(宪法)。

陈天桥与马斯克的管理风格对比

了解,之前我知道两位,马斯克也是大家的老板。你们觉得马斯克的风格跟陈天桥先生的风格有什么不一样吗?

我觉得他们性格来说是比较类似的,但是陈总他的眼光,或者是说对看待问题的方法跟马斯克很不一样。比如说陈总非常注重AI for Science,或者是说Heavy Duty Solver。马斯克其实之前跟我们说过非常类似的话,当然他的原话不是heavy duty,他会用一些其他的术语说,但是说的话和做的事其实不太一样的。就比如说大家可以看到,马斯克特别喜欢在X和推特上发文,他经常用AI做一些小的,比如说画一些图,或者是回答一些问题,马斯克对这些非常上心。他甚至之前可能会每一周都会问一下Grok for X发展进步得怎么样了。所以他其实是非常注重Chat的这个功能的。但是陈总就是,他说的和做的其实是非常一样,他口上说非常看重Heavy Duty Solver,那他的重点就是Heavy Duty Solver。他对做聊天模型、视频生成、图片生成一点兴趣都没有。所以这个我觉得是非常对齐的地方,非常专注。

对,陈总这边基本上从头至尾一直就是强调做Heavy Duty Solver,也跟我们说像图片、视频生成和这个目标基本上是正交的,所以我们根本就不做这些方向。

关于AI价值观的哲学思考与尾声

谢谢大家,我觉得这期非常精彩。在聊完这集节目的时候,我始终在想品味的问题。Simon的那句,顶级科学家不是看发了多少论文,而是看最好的那篇论文的质量有多高,他其实点出了一个更大的问题。就是说如果现在AI的品味,它是从人类顶级科学家那里的热启动的,那么这个品味它本质上可以说还是被少数人去塑造的。那么未来这些面向更加普罗大众的,比如说这些ToC的AI,它们到底应该代表谁的价值观呢?关于AI的哲学思考,也是我们这个时代急需的讨论。大家有什么样的评论与想法,欢迎给我们留言。

播客的听众可以通过小宇宙、苹果播客、喜马拉雅、蜻蜓FM、Spotify来收听我们。视频的听众可以通过哔哩哔哩和YouTube搜索“硅谷101播客”来找到我们。我是泓君,感谢大家的收听。

📌 文中提及的人物和组织

关键字: recursive-self-improvement long-task-challenge model-evolution discovery-model verification-system