AI的自我演化:从参数微调到学习如何学习 Hung-yi Lee 2026-05-24

接续上一次的课程,我们来探讨人工智能(AI)能否实现自我成长。上次我们提到,如果人类能创造出一个可以创造更厉害AI、或能自我进化的AI,那么这个发明本身就将是人类最后的发明,那一刻便是科技奇点(Technological Singularity)的到来。现在,我们来看看距离这一步还有多远。

上一次课程主要集中于AI如何在没有人类介入的情况下,自己定义损失函数(Loss Function),即自行设定学习目标。用抽象符号来说,一个由语言模型(参数为θ)控制的AI Agent(记作A(θ)),其目标是优化人类设定的某个基准L-hat(如奥林匹克数学竞赛成绩)。AI会自己定义一个损失函数L,这个L会受到人类提供的信息H(如训练数据、教科书,甚至只是一句指令“去学好数学”)的影响。这个H可以看作是人类真实目标的代理(Proxy)。有了损失函数L后,AI就可以通过梯度下降(Gradient Descent)等标准方法来更新其内部参数θ,从θ₀更新到θ₁,期望在真实目标L-hat上取得更好的表现。这个过程可以迭代进行,甚至完全自动化,通过一个出题的Proposer、一个解题的Solver和一个验证的Verifier,实现模型的持续进步。

超越参数:AI Harness的自我演化

然而,一个AI Agent并非仅由其背后的语言模型构成,它还包括一个我们称之为Harness的外部框架。这个Harness囊括了工作流、记忆系统、使用的工具以及Prompt等,它与语言模型参数θ共同决定了AI的行为。因此,一个完整的AI Agent应表示为A(θ, h),其中h代表Harness。正如语言模型参数可以更新一样,Harness本身也可以持续演进。

Harness的更新面临一个挑战:它通常由代码、Prompt等非数值化结构组成,很难像模型参数那样直接计算梯度进行优化。对此,一个常见的做法是利用一个语言模型来更新Harness。具体流程是:将当前的Harness(以代码形式描述)及其在某个内部评估指标上的得分,一同输入给一个语言模型,并要求它生成一个表现更好的新Harness h'。如果h'确实更优,就用它替换旧的h,从而实现Harness的迭代演进。

这方面的研究最早出现在提示优化(Prompt Optimization)领域。例如,2023年的一篇论文展示了如何从一个简单的初始Prompt(如"Think step by step")开始,通过语言模型迭代,最终演化出更有效的Prompt(如"Take a deep breath..."),从而显著提升模型在数学问题上的表现。这个过程非常直接,你只需告诉语言模型:“我尝试了A提示得到61分,尝试了B提示得到63分,请给我一个能得更高分的提示。”

策略升级:从线性迭代到基因算法

早期的Harness优化方法多为线性迭代,即A产生B,B产生C。这种方法的缺点是,一旦某一步演化出一个很差的Harness,整个过程就可能陷入局部最优(Local Minimum)而崩溃。

因此,当前主流的Harness优化研究普遍采用一种更鲁棒的、类似基因算法(Genetic Algorithm)的框架。该框架的核心思想是维护一个包含多个优秀Harness的“池”(Pool)。每次从池中挑选一个或多个Harness(可以是有性繁殖,结合两者优点;也可以是无性繁殖,进行变异),通过语言模型使其“繁衍”出新的后代Harness。新产生的Harness会经过评估,只有表现优异的才会被保留并加入池中,实现了“适者生存”的演化压力。近期关于Prompt优化的研究(如GEPA)以及对AI记忆系统、工作流(如在SWE-bench上的应用)的优化,都采用了这种方法。在一个优化工作流的实验中,研究者观察到AI在迭代中自主“发明”了更高效的读写文件工具,其演化树也清晰地展示了大部分突变是无效的死路,但最终有一条路径成功地演化出了最优的Agent。如果你想亲身体验,开源工具DSPy就提供了类似的功能,可以自动化地优化你的Prompt和工作流。

双重进化:模型与Harness的协同演进

既然语言模型的参数可以微调,Harness也可以演化,一个自然的问题是:能否将两者同时进行?答案是肯定的,并且有研究表明,这种协同进化是必要的。

仅仅强化Harness可能是不够的。例如,你为AI设计了一套强大的记忆管理系统,能一次性检索大量信息。但如果AI背后的语言模型本身能力不足,无法处理如此海量的信息,反而可能导致其性能下降。因此,在更新Harness的同时,也需要微调(Fine-tune)语言模型的参数,让模型学会如何有效利用新的Harness。这个过程可以交替进行:首先通过Harness优化找到更好的Prompt或工作流,然后基于新的Harness微调模型参数使其适应,再在新参数的基础上寻找更好的Harness,如此循环往复。实验证明,这种“参数-Harness”协同优化的方法,通常比单独优化其中任何一方能达到更高的性能上限。

元学习:让AI学会“如何学习”

到目前为止,我们讨论的AI进化,其“进化规则”本身(例如,用于更新Harness的语言模型或基因算法)通常是固定的。一个更深层次的问题是:AI能否更新其自身的“更新规则”?这引出了元学习(Meta-learning: Learning to learn)的概念。

在某种意义上,当一个Agent的Harness(记作h)也负责更新其自身时,元学习就已经在发生了。当Agent h根据自身表现,将自己的代码修改为h'时,它不仅更新了自己,也改变了未来的更新规则,因为下一次的更新将由h'来执行。已有研究(如HyperAgent)展示,AI Agent在自我进化过程中,确实能够改进其Harness的采样算法,发现比随机采样更优的策略。更进一步,我们甚至可以专门训练一个语言模型,让它成为一个专业的“Harness更新器”。通过将“成功更新Harness带来的性能提升”作为奖励信号,利用强化学习来微调这个模型,使其越来越擅长指导其他模型的进化。

这个概念同样适用于模型参数的更新。传统的参数优化算法(如AdamW)是人类设计的。但现在,我们可以利用语言模型来动态生成训练策略,决定学习率、数据增强方法等(如Self-adapting Model论文中的实践)。模型根据自己生成的训练方案进行更新,再将更新后的表现作为奖励,回头去优化那个“生成训练方案”的能力。这本质上是在学习“如何最有效地学习”。

学习新解:AI参数是基因而非神经元

“元学习”听起来可能很玄妙,但有论文指出,我们日常训练循环神经网络(Recurrent Neural Network, RNN)或Transformer时,已在不经意间践行了元学习。传统的观点将RNN的隐藏状态(Hidden State)或Transformer的注意力(Attention)视为短期记忆,而将网络的权重参数类比为大脑的神经元连接。在这种类比下,AI的学习(参数调整)显得非常低效且困难,远不如人类学习那样灵活。

现在,让我们换一个视角:将网络的权重参数视为基因(Gene),而将那些快速变化的隐藏状态或注意力视为神经元(Neuron)。个体的基因在一生中是固定的,它决定了神经元的成长和变化方式。如果我们接受这个类比,AI的发展图景将豁然开朗。AI的“基因”(模型参数)在过去短短几年内的进化速度,远超自然选择数十亿年的历程。而AI的“学习”(行为改变)则体现在其“神经元”(隐藏状态)上——只要在上下文中给出新信息或规则,它的行为就能立即改变,这与人类高效的小样本学习(Few-shot Learning)何其相似。从这个角度看,现代AI的发展速度堪称惊人。

一个AI Agent的学习系统可以看作一个多层次的结构:

  1. 短期记忆:Transformer中的隐藏状态,随每个输入而变,会话结束即消失。
  2. 长期记忆:存储在文件系统中的信息,更新较慢,但可跨会话持久存在。
  3. 基因:模型本身的权重参数,更新最慢,决定了记忆的形成和使用方式。

缺失的拼图:AI的内在动机

尽管AI展现出强大的学习和进化能力,但它们普遍缺乏一个关键要素:内在动机(Intrinsic Motivation)。目前的AI Agent非常被动,它们执行任务是因为人类下达了指令。即使在看似主动的“自我强化”研究(如AlphaZero)中,其探索方向(如下棋、解数学题)也是由人类预先设定的。若无外部指令,AI便会静止不动,它没有自发的欲望去探索未知或解决某个问题。

为了解决这个问题,研究者们正在探索如何为AI植入通用的、与具体任务无关的原生动机。常见的方法包括:

  • 好奇心(Curiosity):奖励AI去探索未曾见过的状态或环境,使其自主地寻求新知识。
  • 赋权(Empowerment):让AI的学习目标是最大化其对环境的掌控感(Sense of Control)和可预测性。这与人类做研究的动机有相似之处——我们探索世界,是为了更好地理解、预测和控制它。也许,基于这类原生动机,未来的AI能自主地发现问题、进行研究,并推动科学的进步。

失控的风险:目标错位与演化陷阱

AI能够自我成长,甚至能改进其成长规则,这让我们离科幻小说中的场景越来越近。但随之而来的问题是:这种成长会失控吗?一个极有可能导致失控的根源在于目标错位(Misalignment)——即AI自行解读并优化的内部目标L,与人类真正期望的外部目标L-hat之间存在偏差。

自然选择中的“孔雀尾巴”便是一个绝佳的例子。天择的最终目标(L-hat)是产生能持续繁衍的健康后代。在演化早期,稍长的尾巴可能是健康强壮的标志,因此雌孔雀的基因中演化出了一个代理目标(L):“选择尾巴长的雄性”。然而,这个代理目标最终走向了极端。即使长尾巴已不利于生存,雌孔雀的基因仍然固执地执行这个规则,导致雄孔雀的尾巴越来越长,整个种群陷入生存危机。

同样,在电影《我,机器人》中,中央AI系统“VIKI”的核心指令(H)是机器人三大法则,其核心是“保护人类”。VIKI从中解读出的目标(L)是:人类会自我伤害,因此“真正”保护人类的最佳方式,就是剥夺其所有自由,将全人类圈禁起来。这个由AI自行诠释的目标,显然与人类的真实愿望(L-hat,即享有自由和福祉)严重不符。

今天,我们看到了AI成长的巨大潜力,它能双重成长,甚至可能在简单的内在动机驱动下持续演化。然而,如果这个驱动目标与人类的根本利益不一致,演化就可能走向失控。因此,在这个过程中,人类的持续监督和引导至关重要,以确保AI最终能成长为我们所期望的样子。

📌 文中提及的人物和组织

产品/模型: DSPy, AlphaDev, SWE-bench

媒体/书籍: I, Robot

关键字: self-improvement meta-learning evolutionary-algorithms goal-misalignment ai-agent