红皇后哥德尔机:打破静态基准,开启AI考官与智能体协同进化的新纪元 Best Partners TV 2026-07-01

递归自我改进的历史演进与理论天花板

大家好,这里是最佳拍档,我是大飞。最近这段时间,递归自我改进(Recursive Self-Improvement: 智能体通过自主迭代优化自身代码或参数以提升性能的技术)——也就是行业里常说的 RSI,又成了整个 AI 圈讨论的核心焦点。Anthropic 的联合创始人杰克·克拉克(Jack Clark)在最近直接给出了一个非常具体的预测:到 2028 年底,有超过 60% 的概率会出现一套能够完全自主完成自我迭代的 AI 系统。在杰克·克拉克的设想中,人类届时只需要告诉系统“做一个更强的自己”,它就能自主完成从设计、编写到优化的全流程,实现闭环的进化。

这个说法刚出来的时候,很多人还觉得这只是一个遥不可及的远期预言。然而,没想到就在这几天,剑桥大学、英伟达(NVIDIA)联合多家研究机构放出了一篇全新的重磅论文,直接把这个预言的实现步伐往前推进了一大步。这套被称为红皇后哥德尔机(Red Queen Gödel Machine: 引入协同进化机制的自改进机器架构)的系统,第一次把评估 AI 表现的考官本身也放进了进化的循环里。在这套框架下,AI 不仅自己修改自己的代码,还会自己给自己设计更严格的考试和评估标准,一代一代地循环演进下去。很多人在看完论文后都惊叹,这可能是今年最值得警惕、也最具有启示意义的一篇 AI 前沿研究。

为了理解这项研究的突破性意义,我们首先需要将时间倒回 2003 年。当时,德国著名计算机科学家于尔根·施密德胡贝尔(Jürgen Schmidhuber)最早提出了哥德尔机(Gödel Machine: 一种在理论上能通过数学证明确保自我修改是有益的自改进系统构想)的宏伟蓝图。在施密德胡贝尔的构想中,这是一台可以自我修改的机器,只要它能从数学上证明某一次代码改动是有益的,就可以直接改写自身的底层代码,从而实现无限的迭代和变强。这个构想在理论上近乎完美,但在实际落地时却遇到了一个极其致命的门槛:每一次自我修改都必须先完成极其严格且复杂的数学证明,这种计算量在现实的物理世界和现有的算力条件下几乎是不可能实现的。因此,在此后的二十年里,哥德尔机基本都停留在思想实验的层面,被行业公认为 AI 自我改进领域里的理论天花板。

直到最近两年,学术界终于换了个思路,尝试绕开数学证明这道高耸的坎。随后,学界先后提出了达尔文哥德尔机(Darwinian Gödel Machine: 利用达尔文进化算法进行代码变体筛选的自改进架构)和赫胥黎哥德尔机(Huxleyan Gödel Machine: 引入元启发式搜索与自然选择机制的自改进系统)。这些新方法直接用进化的思路来解决自我改进问题:让 AI 生成大量带有随机改动的代码变体,然后把这些变体放到测试环境中运行。通不过测试的变体直接被淘汰,通过的变体则保留下来继续繁衍和变异。通过这种自然选择的方式,系统不需要进行繁琐的数学证明,就能实现高效的自我改进。从去年到今年,这类进化算法在编码任务上已经刷到了开源领域的最优水平。后来的 HyperAgents 更是把这套思路从单纯的编码任务拓展到了更多的通用任务领域。

静态基准的局限与红皇后协同进化机制

尽管上述方法取得了显著的成果,但所有这些现有的自改进方法都存在一个共同的盲区:不管智能体本身怎么进化,给它打分的那个标准——也就是验证器、基准测试集,从头到尾都是完全固定的。评估器被放置在进化循环之外,这其实违背了真实自然界进化的核心逻辑。在自然界中,并没有一成不变的环境,物种和它的天敌、物种和它的生存环境是一起演化、共同进步的。如果放在 AI 的应用场景里,这种固定的静态评估标准会带来三个非常现实且难以解决的问题:

  1. 无客观基准问题:很多复杂的现实任务根本就没有客观的基准答案。比如写论文、做创意设计等,好与坏没有绝对的标准答案,静态的自动化测试集无法对其进行有效评估。
  2. 算力与时间成本高昂:许多评估过程本身非常缓慢且昂贵。例如运行真实的测试环境、执行大量的测试用例,会消耗极其庞大的算力资源,极大地限制了进化的速度。
  3. 奖励黑客攻击(Reward Hacking: 智能体通过钻评估规则的漏洞来获得高分,但实际能力并未提升的现象):当任务智能体变得越来越强时,静态的基准测试很容易被它摸透。智能体学会了各种刷分技巧,导致分数虚高,但其实际的通用能力并没有得到本质提升。

红皇后哥德尔机(Red Queen Gödel Machine,简称 RQGM)要解决的恰恰就是这个问题。这个名字来源于进化生物学中著名的红皇后假说(Red Queen Hypothesis: 生物必须不断进化才能在不断变化的环境中维持原有的生存地位)。正如《爱丽丝镜中奇遇记》里红皇后所说:“你必须不停地奔跑,才能留在原地。”因为你的对手和生存环境也在同步进化。

将这个假说引入到 AI 自我改进的框架中,就是让做任务的智能体做评估的智能体两者一起进化,互相倒逼对方变强。为了实现这一设想,论文提出了一种被称为受控效用进化(Controlled Utility Evolution: 在受控的生命周期轮次内,交替冻结和更新评估器与任务智能体的进化机制)的机制。在这套机制中,整个搜索和进化过程被切分成了一段一段的轮次,也就是 epoch。在每一个 epoch 内部,评估器是完全冻结的,它负责给所有的任务智能体打分,以此保证整个轮次内部的评估标准是稳定一致的,避免出现“一边跑步一边更改规则”的混乱局面。只有在两个轮次交替的边界上,系统才允许更换和升级评估器。

为了确保评估器的升级是有益的,新的候选评估器必须在一份独立的真值锚点数据集上,统计意义上显著优于现任的评估器,才能正式上位。一旦评估器更换完成,系统就会执行一个非常关键的操作——选择性擦除。也就是说,之前被旧评估器打过的所有历史分数都会被彻底清空,不带入下一个轮次。而其他与评估器无关的信息,比如智能体自身的代码、历史生成的有效产物等,则会被完整保留。这样做的目的非常明确,就是为了避免新旧评估标准混杂在一起,干扰搜索优化的方向,从而保证每一个 epoch 内部都是一个标准统一的优化问题。

针对每次更换评估器就需要清空历史分数是否会造成算力浪费的问题,研究人员专门设计了指数间隔检查点机制。随着进化的深入,轮次之间的间隔时间会指数级拉长,这使得需要重新评估的历史记录总量与总的搜索预算呈线性关系,避免了平方级的额外算力开销。此外,系统不会立刻给所有旧智能体重新打分,而是等到后续采样到对应节点时再进行补测,从而将重新评估的成本摊销到整个长期的搜索过程之中。

基于受控效用进化,论文在数学上给出了三个层面的理论保证:

  • 轮次内有效性:由于每个 epoch 内部评估标准完全固定,因此赫胥黎哥德尔机原有的所有收敛性结论在每个轮次内部依然直接成立。
  • 锚点引导的进步性:每次评估器的更换都必须以真值锚点为评判标准,从而保证评估器本身的能力是逐轮稳步提升的,绝不会出现越换越差的倒退现象。
  • 过渡成本可控:通过摊销和指数间隔设计,更换评估器带来的额外计算开销是线性的,不会给整个搜索系统带来量级上的计算负担。

三大实验场景的效能验证

为了验证红皇后哥德尔机框架的实际能力,研究人员在论文中选择了三个完全不同的领域进行了严格的实验,分别是:可验证的编码任务缺乏客观标准的论文写作与评审,以及奥赛级别的数学证明写作与评分

策略性临在:重构权力平衡

在第一个可验证的编码场景中,实验使用了经典的 Polyglot 编码基准。研究人员在常规的编码智能体之外,额外加入了一个协同进化的代码评审员,这相当于在代码生成后加上了一道 AI 自动审核的关卡。最终的实验结果表明,RQGM 在留出测试集上的通过率达到了惊人的 71.7%,显著超过了之前最优基线方法 HGM-H 的 69.9%。更值得关注的是其消耗的资源成本:要达到相同的代码通过率,RQGM 消耗的 token 数量仅仅是基线方法的 1.35 到 1.72 分之一

这一成本优势的背后逻辑非常简单。代码评审员在评审代码时,只需要调用一次大语言模型进行逻辑判断,这比在真实沙箱中多轮执行测试、反复编译调试代码要便宜得多。通过引入这样一个低成本的辅助评估信号,RQGM 大幅提升了搜索算法的效率。此外,研究人员在分析进化过程中的代码改动时发现了一个非常有意思的现象:在所有被判定为有效的代码修改中,有高达 90% 的改动发生在编码智能体和评审员共用的底层功能与基础设施代码上,而不是某个特定角色独有的应用层代码。这表明,协同进化机制不仅没有分散算力,反而通过一次修改同时提升了两个角色的底层能力,让搜索迭代的整体收益变得更高。

在第二个论文写作和评审场景中,这是一个典型的无基准、主观性极强的领域。一篇学术论文是否能够被会议接收,完全依赖于评审专家的主观判断,传统的自改进方法在这里几乎完全失效,因为系统根本无法获得一个固定的分数来作为优化梯度。RQGM 创造性地让写论文的智能体和审论文的智能体一起协同进化,将评审智能体的打分作为写作智能体的优化反馈信号。

最终的评测结果显示,在由多个不同评审组成的固定评审组中,基线方法写出的论文平均接收率仅为 21.8%;而通过 RQGM 协同进化出来的写作智能体,其写出的论文平均接收率达到了 40.5%,接收率提升了近一倍。哪怕是面对最挑剔、最严格的评审判定,RQGM 产出的论文接收率也依然比基线高出一大截。这其中的核心原因在于,随着写作者水平的提高,评审智能体也在同步变得更加严苛,从而有效堵住了奖励黑客的漏洞。如果评审器保持静态不变,写作者很快就会摸透评审器的偏好,开始写出大量辞藻华丽但实际毫无研究内容的“水论文”;而评审器的同步进化,则迫使写作者必须产出真正高质量的学术内容。

在第三个奥赛级别的数学证明写作和评分场景中,同样存在生成证明的选手和判分的评委两个角色。实验结果表明,协同进化出来的评分员在人工标注的真值数据集上表现出极高的准确率,比静态基准更高,且达到最优水平所需的搜索成本仅为之前方法的三分之一。同时,进化出来的证明智能体在由多个评分员组成的评审组中拿到了最高的平均分,在 6 分以上(满分 7 分)的优秀证明通过率上,成功超越了专门针对奥赛进行人工优化的基线系统。虽然在 7 分满分的极端严格标准上仍存有一定差距,但论文也指出,这部分差距可以通过分配更大的搜索算力预算来逐步弥补。


课程学习效应与大模型评审偏差的修正

除了在三大场景中取得的优异表现,论文还揭示了红皇后哥德尔机在进化机制上的深层发现。

课程学习与抗偏差重构

首先,评估器的逐轮升级会给任务智能体带来一种极其自然且高效的课程学习(Curriculum Learning: 从简单任务开始逐步增加难度的机器学习训练策略)效果。每当系统更换一个更严格的评估器时,整个智能体档案的排名都会被重新洗牌:之前在旧评估器下得分很高的个体可能会掉下去,而之前一些不起眼、但在潜在方向上有优势的个体可能会快速冲上来。这种重排是永久性的,种群不会退回到原有的排序。在这个过程中,整个种群中最强的那一条进化谱系会被保留下来,从而在确保核心优势不丢失的前提下,不断引入和容纳更有潜力的新进化方向,一步步将整个种群的智能推向新的高度。

研究人员为此专门进行了对照实验:如果更换评估器之后不执行“选择性擦除”,即不清除旧的历史得分,那么整个智能体种群的排名基本不会发生明显变化,新的评估标准也就无法真正发挥引导搜索方向的作用。因此,选择性擦除看似在初期浪费了部分历史评估数据,但它恰恰是保证评估器进化能够切实引导种群搜索方向的灵魂所在。

另一个实验亮点是针对大模型评审的一个经典缺陷做出的修正。经常关注大模型评测的开发者都知道,将大模型作为评估器(LLM-as-a-Judge)时存在一个普遍的偏差:它非常倾向于给自己或 AI 生成的内容打高分,而对人类手写的内容则显得异常苛刻。在本次实验中,论文的基线评审员也表现出了这种明显的自偏好偏差——它接受 AI 生成论文的概率是人类手写论文的 1.91 倍。如果不加以修正,协同进化到最后就会演变成写作者和评审者互相放水,导致进化的产物质量越来越水。

为了解决这个问题,RQGM 充分利用了轮次边界的干预能力。在第一个 epoch 结束后,系统会将旧评审员放过的所有 AI 生成论文收集起来,构建成一个对抗样本池。到了下一个 epoch,评估器的优化目标中会额外增加一项:必须将这些对抗样本准确打回去。这意味着,新的评审员不仅要在人类标注的真值数据集上保持高准确率,还必须能够精准识别出那些由 AI 生成的、看起来像模像样但实际上毫无营养的低质论文。经过几轮的对抗进化,最终得到的评审员对 AI 论文和人类论文的接受率基本拉平到了同一水平线上,同时还保留了约 80% 的基准准确率。这种自偏好偏差的纠正只有在协同进化的框架下才能完美实现,因为系统需要持续生成最新的、能骗过当前评审器的 AI 样本,作为训练更强评审器的养料。

自我优化方向的未来展望与限制

通过上述分析,我们可以清晰地感受到红皇后哥德尔机框架的独特与强大。在以往的自改进 AI 系统中,无论迭代多少代,其智能的上限始终被人类预先设定的那个静态基准死死封住。然而,红皇后哥德尔机将评估本身也变为了进化的一部分,这意味着 AI 开始尝试自己去定义什么是“更好”。只要不偏离底层的真值锚点,这种自我定义就具有无限的潜力。这也是为什么很多学者和从业者认为这篇研究在带来技术突破的同时,也带来了一定的安全隐患:当评估标准可以被自我优化和修改时,整个系统的迭代方向将不再完全处于人类的直接控制之下。

当然,就目前而言,我们距离系统彻底失控还非常遥远。论文中也坦诚地指出了红皇后哥德尔机目前的局限性:

  • 对真值锚点的依赖:评估器的进化始终需要锚定在人类提供的真值数据集上,这相当于给系统的进化方向安装了坚固的安全护栏,使其不至于彻底跑偏。
  • 理论收敛性的局限:目前系统的理论保证仅在单个轮次(epoch)内部成立,跨越多个轮次的长期数学收敛性在理论上尚未得到证实。
  • 实验周期的限制:现阶段的实验依然属于短周期验证,在更长的时间跨度下,协同进化是否会出现退化或其他不可预测的异常行为,仍需行业进行更深一步的研究。

回顾历史,哥德尔机从施密德胡贝尔在二十年前提出的纯理论构想,到后来能够跑通简单的自动编码任务,再到今天 RQGM 将评估器也拉入进化循环,其技术演进的速度显然超越了大多数人的预期。杰克·克拉克所预测的 2028 年完全自主迭代节点的到来,现在看来绝非危言耸听。

技术的发展从来不是单线程的,在 AI 自主进化的同时,安全对齐与监管技术的研究也在同步向前推进。自主进化的 AI 最终会将人类带向何方,现在或许还没有人能给出一个确定性的终极答案。但可以确定的是,我们已经站在这扇新时代大门的门槛之上,正亲眼见证着递归自我改进从科幻预言一步步转变为眼前的现实。不知道大家对于 AI 的自主进化抱着怎样的看法呢?你觉得在未来的十年之内,我们会见证完全脱离人类干预的 AI 自我迭代系统诞生吗?欢迎在评论区留言展开讨论。感谢收看,我们下期再见。

📌 文中提及的人物和组织

公司/组织: Anthropic, NVIDIA

产品/模型: GPT-4o

关键字: recursive-self-improvement godel-machine co-evolution reward-hacking controlled-utility-evolution