在过去十几年里,我们默认AI的学习离不开神经网络的权重更新,离不开梯度下降与反向传播。不管是深度学习、强化学习还是大语言模型的微调,核心都在于调整模型的参数。但有一个问题始终卡在整个AI领域的咽喉位置,那就是持续学习中的灾难性遗忘(Catastrophic Forgetting: 模型在学习新任务时,旧能力被覆盖或遗忘的现象)。这个难题困扰了学界和工业界数十年,无数算法试图解决,却始终没有找到完美的答案。
最近,OpenAI工程师翁家翌发布了一篇名为《超越梯度的学习(Learning Beyond Gradients)》的文章,用一系列惊艳的实验,提出了一种完全跳出梯度框架的全新学习范式:启发式学习(Heuristic Learning: 通过维护代码规则而非神经网络权重进行优化的学习范式)。他用编码Agent代替人工,不训练任何神经网络,不更新任何模型权重,仅仅通过修改代码规则和维护软件系统,就让AI在Atari游戏和机器人控制任务中达到了深度强化学习的水准,甚至在样本效率上实现了反超。
持续学习的本质困境
持续学习简单来说,就是让AI像人类一样,不断学习新任务、新技能,同时保留已经掌握的旧能力。但神经网络的特性决定了它很难做到这一点,因为神经网络的所有知识都被压缩在权重参数里。当我们用新数据训练模型的时候,梯度更新会强行调整参数,原本承载旧能力的参数被覆盖,旧能力就会瞬间消失。
为了解决这个问题,学界提出过正则化、记忆回放、动态架构等无数方法,但都只能缓解,无法根治。于是,所有人都把目光盯在神经网络的权重上,试图用更精巧的梯度优化方式解决问题。但翁家翌换了一个思路:如果我们不把所有注意力放在神经网络权重上,会不会有完全不同的解决方案呢?
这个思路的起源,来自翁家翌业余时间维护的一个开源项目EnvPool。在维护这个高效的强化学习环境并行库时,他遇到一个实际问题:测试环境是否正常运行,如果每次都跑神经网络策略,成本太高,尤其在持续集成(CI)流程中开销巨大。于是他尝试使用Codex和GPT-5.4编写完全基于规则的策略,全程不依赖任何神经网络。结果几轮迭代后,其实验表现超出了所有人的预期。
启发式学习的验证与定义
在Atari打砖块游戏中,Codex编写的程序式策略打到了理论最高分;在MuJoCo四足蚂蚁机器人(Ant)和半猎豹机器人(HalfCheetah)任务中,纯Python策略完全达到了深度强化学习算法的常见表现区间。这些实验数据最震撼的地方在于,Codex全程没有训练任何神经网络,它一直在做的事情是维护一套可以持续生长、持续迭代的软件系统,而不是优化模型参数。
基于这些迭代验证,翁家翌正式提出了启发式学习(HL)的概念,同时定义了启发式系统(Heuristic System: 包含规则、反馈、历史记录并可自主进化的代码体系,简称HS)作为其核心载体。
启发式学习与深度强化学习虽然都拥有状态、动作、反馈、更新的完整闭环,但两者本质区别在于:深度强化学习更新的是神经网络参数,而启发式学习更新的是软件结构。启发式学习的反馈来源非常多元,包括测试用例、运行日志、人类反馈等,编码Agent会直接修改策略代码、状态检测器、测试脚本、配置文件或记忆模块,完成一步到位的优化。
软件工程范式的转变
启发式学习相比深度强化学习,具备五个不可替代的核心优势:可解释性、样本效率、可回归测试性、有效约束过拟合,以及从根本上缓解灾难性遗忘。
为什么这种基于规则的学习方式以前没有成为主流?因为在编码Agent出现之前,人类手工维护这类系统的成本太高了。一旦规模扩大,稳定性维护就会陷入死循环,系统最终变成了一个臃肿、脆弱、无法迭代的“代码怪物”。编码Agent彻底改变了启发式系统的维护曲线,它就像一条持续输送智能的管道,让系统可以自主进化。
在自动化启发式学习流程中,环境反馈、测试失败、日志异常被编码Agent感知后,Agent读取上下文,直接修改策略、测试或记忆模块,重新运行程序,结果写回实验记录,然后继续下一轮迭代。
耦合复杂度与系统维护
持续学习的核心问题,从“如何更新神经网络参数”,变成了“如何维护一个持续吸收反馈的软件系统”。一个健康的启发式系统,必须同时完成两个核心操作:一是吸收反馈,把新的失败案例、日志数据和奖励信号写回系统;二是压缩历史,把零散的局部补丁整合简化,变成更简洁的架构。否则,系统最终一定会变成无法维护的“屎山代码”。
衡量系统能否稳定迭代的核心指标是耦合复杂度(Coupling Complexity: 一次更新必须同时兼顾的相互关联的状态、规则、测试、反馈信号以及历史约束的总数量)。好的模块化设计和完善的测试用例,能降低Agent需要处理的复杂度。同时,记忆和工具的使用能有效提升Agent的有效上下文长度,从而维持系统的迭代能力。
未来展望:融合发展
启发式学习并不意味着替代神经网络,而是两者深度融合。在复杂的感知、长程泛化任务中,纯代码策略依然无法替代神经网络。
最有希望的融合方向是,用启发式学习快速处理在线数据,把实时经验转化成可训练、可回归测试的高质量数据,然后周期性地更新神经网络。正如翁家翌所展示的,编码Agent改变了我们对“哪些代码值得长期维护”的判断标准。过去因为维护成本太高而被放弃的规则,现在终于有了合适的生长土壤。AI的学习从来不止一种方式,跳出固有的框架,往往能看到全新的答案。