持续学习:AI的下一代天花板与智能的关键 Best Partners TV 2026-05-10

大家好,这里是最佳拍档,我是大飞。

今天我们要聊的,是整个AI领域现在最被低估、但可能决定下一代模型天花板的核心方向——持续学习 (Continual Learning)。4月22日,a16z发布了一篇重磅长文,整合了全球顶尖研究者、博士团队与创业公司的一线思考,将持续学习从一个小众学术概念,拉到了AI基础设施变革的中心位置。

看完这篇万字长文,你可能会明白,为什么说现在的大模型再强,本质上还是一个“失忆患者”,而持续学习,才是让AI真正拥有智能的关键一步。

经典场景与模型困境

在正式进入技术细节之前,我想先带大家进入一个非常经典的场景,它能瞬间帮你理解今天所有内容的核心矛盾。

不知道你有没有看过克里斯托弗·诺兰(Christopher Nolan)的经典电影**《记忆碎片 (Memento)》?主角莱昂纳多·谢尔比 (Leonard Shelby)** 因为脑部创伤,患上了顺行性遗忘症 (Anterograde Amnesia)。他没办法形成新的长期记忆,每隔几分钟,他的世界就会重置。他记不住刚刚发生了什么,也无法把新的经历内化成自己的知识。

为了活下去,他只能通过把关键信息纹在身上、拍宝丽来照片、写便签,用这些外部道具来替代自己大脑无法保存的记忆。他能靠这些东西生存、推理、甚至完成复杂的任务,但是他永远无法真正学会新的东西,因为他的所有经验都是外置的,无法沉淀,无法复利,也无法真正成长。

你有没有发现,今天我们所有的大语言模型,几乎都活在和莱昂纳多一模一样的状态里。模型在预训练阶段,把海量知识冻结在参数里,这个过程就像人出生时自带的本能和基础认知。但是一旦部署上线,模型就失去了形成新记忆的能力。它没办法根据新的对话、新的数据、新的经验,直接更新自己的参数,更没办法把新的信息真正刻进脑子里。

我们为了弥补这个缺陷,给模型搭了一大堆的外部脚手架:比如让聊天记录充当短期的便利贴,让检索增强生成 (Retrieval-Augmented Generation, RAG) 充当外部的笔记本,让系统提示词充当身上的纹身。模型能靠这些东西给出看起来很智能的回答,但是模型本身从来没有真正内化过这些新信息,它只是在查阅,而不是在学习。

过去几年,整个行业都在疯狂优化这套外置的记忆系统。我们觉得只要上下文窗口足够大、检索足够准、提示词足够精妙,模型就足够强。但是越来越多顶尖研究者开始达成共识:这还远远不够。

上下文学习的局限与SSM

上下文学习 (In-Context Learning, ICL),对于那些答案已经存在于世界上的问题,比如查事实、做总结、按模板生成内容,确实足够好用。但是一旦遇到需要真正创新、真正发现、真正对抗性适应的场景,上下文学习就会彻底暴露短板。比如全新的数学定理证明、网络安全里不断变异的攻击手段,还有那些只可意会不可言传的隐性知识。这些东西根本无法用语言完整描述,自然也无法塞进上下文窗口里。

而这些场景,都要求模型在部署之后,还能把新的知识和经验,直接更新到自己的参数里,完成真正的、内化的学习。因此,上下文学习是短暂的、表面的,而真正的学习,核心是压缩。

预训练之所以让模型强大,就是因为模型把海量互联网数据压缩成了紧凑、可迁移的参数表征。在这个压缩过程中,模型提炼出了世界的规律、结构和泛化能力。如果我们不让模型在部署后继续压缩、继续学习,我们就会永远困在《记忆碎片》的永恒当下里,模型永远只能查阅,无法成长。

反过来,如果我们能让模型学会自己构建记忆架构,而不是一直依赖定制化的外部工具,我们就能打开AI缩放的全新维度。这,就是持续学习要解决的终极问题。

这个概念本身并不新鲜,早在1989年,麦克洛斯基 (McCloskey)科恩 (Cohen) 就已经提出了相关基础理论。但在今天,随着大模型能力爆发式增长,模型在“已知”和“能知”之间的鸿沟越来越明显,持续学习突然变成了AI领域最关键、最紧迫的研究方向。a16z这篇文章的目的,就是梳理清楚持续学习的不同技术路线、拆解行业现状,并且把这个话题推向创业生态。

接下来,我们就从最基础的上下文开始,一步步把整个体系讲清楚。

首先,我们必须客观承认,上下文学习确实有效,而且还在持续变强。在讨论参数化学习、也就是更新模型权重之前,我们不能否定上下文方案的价值。Transformer架构的本质,是基于序列的条件预测下一个token。只要你给它合适的序列,不用动任何权重,模型就能表现出惊人的丰富行为。这也是为什么上下文管理、提示词工程、指令微调、小样本学习,能在过去几年成为AI应用的核心手段。

模型的智能被冻结在静态参数里,而你输入上下文窗口的内容,直接决定了模型表现出什么样的能力。行业里有很多真实案例能证明这一点。比如Cursor最近的一篇深度分析就提到,系统的行为很大程度上取决于如何给智能体设计提示词。模型本体和外部框架固然重要,但是提示词的影响更大。在模型权重完全固定的情况下,真正让系统跑起来的,是对上下文的精细编排,其中该包含什么信息、什么时候做总结,以及如何在长达数小时的自主运行中保持连贯状态。

还有一个典型例子是OpenClaw。这个项目之所以脱颖而出,不是因为它用到了别人没有的特殊模型,而是它把上下文和工具高效转化成了可运行的状态。它可以跟踪当前任务、结构化中间产物、决定哪些信息重新注入提示词,以及持久保存之前的工作成果。OpenClaw直接把智能体外部框架设计,提升成了一门独立学科。

提示词刚出现的时候,很多研究者都觉得,这只是个投机取巧的小技巧罢了,上不了台面。但是事实证明,这种和Transformer架构原生兼容、不需要重新训练、能够随模型能力自动缩放的方案,反而笑到了最后。越底层、越原生的接口,往往越有生命力。

但是问题也随之而来。当行业主流的工作流,从简单的大模型调用,转向多步循环的智能体系统时,上下文学习的压力被瞬间拉满。以前,把上下文窗口完全占满是一件很罕见的情况,只有当模型处理一长串独立任务时才会发生,应用层只要简单修剪、压缩聊天记录就能解决。但是智能体不一样,一个任务就能消耗掉上下文窗口的很大一部分。智能体循环的每一步,都依赖上一步传递的上下文信息。通常在20到100步之后,智能体就会出现断片的情况,上下文里塞满了冗余的信息,连贯性崩溃、模型再也无法收敛到正确结果。

正是因为这个痛点,全球各大AI实验室都投入巨量资源研发超大上下文窗口模型。这是一个非常顺理成章的路线,既基于已经验证有效的上下文学习,又贴合行业向推理时计算转移的趋势。最主流的架构,是把固定记忆层和普通注意力头交替组合,也就是状态空间模型 (State Space Models, SSM) 以及各类线性注意力变体。SSM和传统Transformer的softmax注意力机制在核心指标上有本质区别:第一是记忆机制,Transformer的KV缓存会随序列长度线性增长,而SSM用的是固定大小的循环状态;第二是计算量,传统注意力是全序列两两配对,复杂度是O(n²),而SSM是线性缩放,复杂度O(n),长序列下效率差距极大;第三是召回效果,Transformer在完整上下文窗口内是无损召回,SSM是有损召回,更早的信息会被压缩或覆盖。

研发SSM的目标,是想让智能体在更长的循环里保持连贯,把步数从几十步提升到几万步,同时不丢失传统Transformer的技能广度和知识量。如果这条路走通,对长时运行智能体来说是将是巨大的突破,甚至你可以把它看作一种特殊的持续学习——虽然没有更新模型权重,但是引入了几乎不需要重置的外部记忆层。

所以我们必须明确,今天基于上下文的非参数化方案,是真实有效、且极具竞争力的。我们讨论持续学习,并不是要否定现有的系统,而是要追问:我们是不是已经摸到了上下文方案的天花板呢?有没有新的路线,能把AI带到更高的层次呢?

文件柜谬误与压缩本质

答案,就藏在这篇文章里的一个非常精彩的比喻——文件柜谬误 (The Filing Cabinet Fallacy)

伊利亚·苏茨克维尔 (Ilya Sutskever) 有一个观点非常透彻:AGI和预训练的发展,在某种意义上有点“过度瞄准”了。人类并不是AGI,我们确实有基础技能,但是我们天生缺少海量的具体知识。我们的核心能力是持续学习。

你想象一下,就算你造出了一个超级聪明的15岁少年,他一开始其实什么都不懂,但是你可以让他去做程序员、做医生。他在部署上岗之后,会经历一段学习、试错、成长的过程。人类的智能是一个过程,而不是一个出厂就完美的成品。

回到AI的语境,想象一个拥有无限存储的系统,一个全世界最大的文件柜,所有事实都被完美索引、瞬间可检索。它能查到任何东西,但它学会了吗?并没有,因为它从来没有被强迫进行压缩。这就是整个论证的核心:大语言模型的本质,就是压缩算法

预训练阶段,模型把整个互联网压缩进参数。这种压缩是有损的,而恰恰是这种有损压缩,才让模型变得强大。压缩迫使模型发现结构、实现泛化、构建能跨上下文迁移的表征。一个只会死记硬背训练样本的模型,远不如一个能提炼底层规律的模型。有损压缩,就是学习本身。

而非常讽刺的是,我们在预训练里让模型拼命压缩、拼命学习,在部署之后,却完全禁止模型做这件事。我们把压缩停在模型发布的那一刻,用外部记忆取而代之。绝大多数智能体框架,确实会用定制化的方式压缩上下文,但是The Bitter Lesson早就告诉我们,模型应该自己学会规模化压缩,而不是靠外部手工实现。

文章里用数学史上的经典案例,把这个争议讲得非常清楚。比如费马大定理 (Fermat's Last Theorem),350多年里无数数学家都无法证明,不是因为他们找不到相关文献,而是因为解法具有极强的创新性,现有数学知识和最终答案之间的概念距离太大。安德鲁·怀尔斯 (Andrew Wiles) 在90年代用七年时间几乎与世隔绝的研究,才发明出强大的新方法完成证明。他的工作成功连接了椭圆曲线和模形式两个完全不同的数学分支。在此之前,肯·里贝特 (Ken Ribet) 已经证明,只要建立这个连接就能解决费马大定理,但是直到怀尔斯出现,才有人拥有构建这个桥梁的理论工具。格里戈里·佩雷尔曼 (Grigori Perelman) 证明庞加莱猜想,也是完全一样的逻辑。

这里的核心问题是:这些案例是不是证明大模型缺少了一种关键的能力,比如更新先验知识、进行真正创造性思考的能力呢?还是说,这些案例反而证明所有人类知识都只是可供训练和重组的数据,怀尔斯和佩雷尔曼的成就,只是大模型在更大规模下就能做到的事情呢?这个问题目前还没有实证答案。但是我们已经清楚看到,有大量问题,上下文学习今天完全解决不了,而参数化学习很可能带来质变。

上下文学习的核心短板与内化需求

那么,上下文学习究竟有哪些核心短板呢?我给大家列一下:

  1. 推理时干扰 (Inference-time Interference):比如模型发现了一种新的越狱方法,像用Base64编码编写有害查询,就能绕过限制。就算你用系统提示词反复约束,也很难100%防御,因为模型已经深度学会了遵循指令。
  2. 强先验覆盖 (Strong Prior Override):模型在React 17上训练极多,突然遇到React 18的破坏性更新,某个旧组件X0被废弃、换成Y0。无论你怎么加提示词,都压不住模型已经深度内化的旧知识。全新语言、小样本框架,都会遇到同样问题。
  3. 反转诅咒 (Reversal Curse):你在上下文里告诉模型,奥拉夫·朔尔茨 (Olaf Scholz) 是德国第9任总理,模型能告诉你奥拉夫·朔尔茨是谁。但是你如果反问,“第9任德国总理是谁?”,模型却会经常答错。因为权重里的关联是单向的。

更关键的是,上下文学习被限制在语言能表达的范围内,而模型权重可以编码那些提示词无法传递的概念。有些模式维度太高、太隐性、太底层结构,根本无法放进上下文。比如医学扫描里区分良性假影和肿瘤的视觉纹理、语音里定义说话人独特节奏的微波动。这些模式都无法被精确的拆解成文字,语言只能近似描述。无论上下文窗口拉到多长,都有一类知识,只能存在于参数里,存在于学习表征的隐空间里。

这也能够解释,为什么ChatGPT记忆这类功能往往会让用户感到不适,而不是惊喜。因为用户真正想要的,不是机械式的回忆,而是能力的内化。一个内化了你的行为模式的模型,可以泛化到全新场景;一个只回忆历史的模型,做不到这一点。我把你上次回复这封邮件的内容原封不动给你,和我足够理解你的思考方式,能预判你需要什么——这就是检索和学习的本质区别。

持续学习的完整体系:三大方案

讲到这里,我们终于可以进入持续学习的完整入门体系。很多人对持续学习的误解是,把它分成“有记忆功能”和“没有记忆功能”。但是真正的划分标准只有一个:压缩发生在哪里

所有的持续学习方案,沿着“无压缩”到“完全内部压缩”形成了一个连续光谱,中间还有一个非常重要的过渡地带,也就是模块方案。文章用一张清晰的表格,把上下文、模块、权重更新三类方案做了完整对比:

  1. 上下文方案 (Contextual Solutions)

    • 机制:RAG、长上下文窗口、智能体框架设计、多智能体集群。
    • 压缩方式:完全没有,权重全程冻结。
    • 类比:开卷考试,只查书不记知识。
    • 遗忘风险:零。
    • 最适合:简单场景是事实查询和已知信息的获取。
  2. 模块方案 (Modular Solutions)

    • 机制:KV缓存、适配器、外部记忆模块、知识卡带等。
    • 压缩:在外部进行,和核心模型隔离。
    • 类比:桌子上的便利贴,随手记录但不进入大脑。
    • 遗忘风险:较低。
    • 最适合:个性化和企业。
  3. 权重更新方案 (Weight Update Solutions)

    • 机制:稀疏记忆层、测试时训练、持续微调、部署反馈强化学习。
    • 压缩:完全在内部进行,模型真的变聪明了。
    • 类比:人类大脑,可以把知识内化。
    • 遗忘风险:最高,会出现灾难性遗忘。
    • 最适合:高难度场景,比如创新发现、对抗性适应和能力的本质提升。

我们稍微来展开讲一下:

  • 上下文方案是目前最成熟的赛道,基础设施经过验证,部署流程清晰。唯一的局限就是深度和上下文长度。这里有一个值得关注的新兴方向,那就是用多智能体架构作为上下文本身的缩放策略。每个智能体在自己窗口内做上下文学习,系统层做聚合。虽然单个模型被128K token窗口限制,但是一组协同的智能体集群,每个智能体可以持有自己的上下文,专攻问题的一个切片,互相通信传递结果,整体就能近似无限的工作内存。卡帕西 (Karpathy) 的Auto Research项目、Cursor构建浏览器的案例,都是这种思路的早期尝试。这是纯非参数化的方案,不改变任何权重,但极大提升了上下文系统的上限。

  • 模块方案处在中间地带。团队构建可附加的知识模块,比如压缩KV缓存、适配器层、外部存储库,在不重新训练的情况下,让通用模型变得专用。一个80亿参数的模型,配上合适的模块,能在目标任务上达到上千亿参数模型的效果,而内存占用只有零头。它的优势是能兼容现有Transformer基础设施,部署和实验成本远低于全量微调。

  • 权重更新方案,是真正意义上的参数化学习,也是最深入、最难部署,但是能让模型真正内化新信息和新技能的路线。研究者正在探索的方向包括:只更新相关小部分参数的稀疏记忆层、从真实反馈中精炼模型的强化学习循环、在推理阶段把上下文压缩进权重的测试时训练 (Test-time Training, TTT)

文章里把参数化学习的主流方向整理成了一张清晰的研究路线图:

  1. 正则化方法 (Regularization Methods):核心思路是约束更新,保护旧的知识。对重要参数的变化施加惩罚,混合新旧权重。代表工作包括2017年的弹性权重巩固 (Elastic Weight Consolidation, EWC) 和2024年的权重插值。这类方法历史最久,但是大规模部署时比较脆弱。
  2. 测试时训练 (Test-time Training, TTT):推理阶段直接运行梯度下降,在信息最关键的时刻,把新内容压缩进参数。从2020年提出原始方案,目前已经进化出TTT层、端到端TTT、TTT-Discover等架构原语。
  3. 元学习 (Meta-Learning):也就是训练“学会如何学习”的模型。从2017年适合小样本的参数初始化方法MAML,到2025年的嵌套学习 (HOPE)。这条路线受生物记忆巩固的启发,用快慢更新模块组成层次化优化结构。
  4. 蒸馏方法 (Distillation Methods):通过输出匹配迁移知识,让学生模型对齐冻结的教师模型。2025年的LoRD方法通过剪枝模型和回放缓冲区,让蒸馏能连续高效运行。2026年的自蒸馏 (SDFT) 用模型自己的专家条件输出,作为训练信号,避免连续微调的灾难性遗忘。
  5. 自我改进 (Self-Improvement):从自我生成的理性中引导推理。比如2022年的STaR,2025年DeepMind的AlphaEvolve,还有西尔弗 (Silver)萨顿 (Sutton) 在2025年提出的“经验时代”框架,让智能体从无限连续的经验流中学习。

这些研究方向正在快速融合。比如TTT-Discover已经融合了测试时训练和强化学习驱动的探索;HOPE在单一架构里嵌套快慢学习循环;自蒸馏则变成自我改进的基础模块。不同路线的边界正在模糊。下一代持续学习系统,大概率会组合多种策略:用正则化保证稳定、用元学习加速学习、用自我改进实现复利。

创业生态与参数化路线

而在学术界之外,持续学习的创业生态已经悄然成型。a16z在文章里完整梳理了当前的格局,分成非参数化和参数化两条主线。看完这部分,我们就清楚了行业正在赌什么。

非参数化路线是大家最熟悉的,分为两层:

  • 一层是框架公司,比如Letta、mem0、Subconscious,它们通过构建编排层和脚手架来管理上下文窗口的内容。
  • 另一层是外部存储和RAG基础设施,比如Pinecone、Weaviate、xmemory、turbopuffer,提供检索骨干。

数据本身已经存在,核心挑战是在正确的时间,把正确的信息片段送到模型面前。随着上下文窗口扩大,这类公司的设计空间也在扩张,尤其是框架层,新一波创业公司正在管理越来越复杂的上下文策略。

参数化路线更早期和更多元,所有公司都在尝试某种形式的“部署后压缩”,让模型把新的信息内化到权重里。具体又分成四个不同的方向:

  1. 部分压缩,不重新训练:团队构建可附加的知识模块,但是不触碰核心权重,把学习隔离在局部,而不是分散到整个参数空间,从而平衡稳定性和可塑性。8B模型配模块能媲美更大的模型,而且可组合、可独立替换、可快速实验。
  2. 强化学习与反馈循环:认为部署后学习最丰富的信号,就在部署流程本身。核心思想是把每一次交互都当成训练信号,而不只是推理请求,就像人类在工作中成长一样——做事、得到反馈,然后内化有效的经验。工程挑战是把稀疏、噪声、甚至对抗性的反馈,转化成稳定的权重更新,同时不发生灾难性遗忘。但是真正能从部署中学习的模型,会随着时间复利增值,这是纯上下文系统永远做不到的。
  3. 以数据为中心:瓶颈不是学习算法,而是训练数据和配套系统。团队专注于生成或合成高质量的学习信号。高质量数据只需要很少梯度步骤,就能让模型显著提升。这条路线和反馈循环路线高度相关,但是更关注上游问题,比如模型能学什么、应该学到什么程度。
  4. 全新架构:这是最激进的路线,认为Transformer本身就是瓶颈,持续学习需要完全不同的计算基元,比如带连续时间动态和内置记忆机制的架构。核心论点是结构决定功能,想要持续学习系统,就必须把学习机制内建到底层的框架中。

全球各大AI实验室也在全线布局,有的优化上下文管理和思维链,有的实验外部记忆模块和休眠计算管道,还有多家隐身创业公司在研发全新架构。这个领域还处在极早期,没有任何一条路线一统天下,而且从应用场景的多样性来看,未来也不会有唯一解。

持续学习的残酷现实:失效模式与安全边界

讲完机会和前景,我们必须直面持续学习最残酷的现实:为什么朴素的权重更新,在大规模生产环境中完全行不通呢?因为直接更新模型参数,会引发一连串的连锁失效模式,这些问题至今没有在规模化场景下被完美解决。文章里也把这些失败模式整理了一下:

  1. 灾难性遗忘 (Catastrophic Forgetting):这是最有名的失效模式。新的学习会直接摧毁旧的表征,也就是稳定性和可塑性困境。比如你给一个多语言模型做代码微调,模型代码能力变强了,但是法语的流利度直接崩盘。
  2. 时序解耦 (Temporal Disentanglement):不变规则和可变状态被压缩进同一组权重。更新状态就会腐蚀规则。比如我们说,餐厅有5号桌是规则,5号桌的坚果会让人过敏是状态。更新状态可能会把规则一起改掉。
  3. 逻辑整合失败 (Logical Integration):事实更新不会自动传导到逻辑结论。更新只作用在token序列的局部,而不是语义概念的层面。比如你把现任总统更新成最新的人选,但是模型回答“谁住在白宫”时,依然是旧的答案。
  4. 无法学习 (Unlearning):指的是没有可微分的减法操作,无法精准移除错误或有毒知识。比如模型记住了侮辱性的词汇,但是没有任何梯度步骤能只删掉这部分信息。

这些工程问题已经足够棘手,但是还有第二类被严重忽视的问题,那就是当前训练和部署的分离。不只是工程便利,更是安全、审计、治理的边界。一旦打开持续更新的大门,这套边界会瞬间崩塌:

  • 安全对齐可能不可预测地退化:就算在良性数据上做窄域微调,也可能产生广泛的对齐失效行为。
  • 持续更新会制造数据投毒面:这是一种缓慢、持久的“提示词注入”,但这次是直接刻在权重里。
  • 审计能力会完全失效:持续更新的模型简直就是一个移动靶,无法做版本管理、回归测试和一次性认证。
  • 隐私风险被急剧放大:用户交互被压缩进参数,敏感信息进入表征,这比可检索的上下文要难过滤得多。

这些都是开放问题,不是本质上不可能解决的,但是解决这些问题,和解决架构上的挑战一样,都是持续学习要研究的核心议题。

走向真正经验:分层系统与模型演化

最后,我们回到文章开头那个《记忆碎片》的隐喻。莱昂纳多的悲剧,不是他无法行动。他在每一个场景里都足智多谋、甚至才华横溢。他的悲剧是,他永远无法复利成长。所有经历都是外置的——照片、纹身、别人写的便签。他能检索,但是他无法压缩新知识。他在自己构建的迷宫里行走,真相和信念的边界逐渐模糊。他的失忆不仅剥夺了记忆,还强迫他不断重构意义,让他同时是调查者和不可靠的叙述者。

今天的AI,就被困在同样的枷锁里。我们造出了极其强大的检索系统:越来越长的上下文窗口、越来越智能的框架、协同的多智能体集群。它们确实能用,但是检索不是学习。一个能查到任何事实的系统,从来没有被强迫发现结构,从来没有被强迫泛化。那个让预训练如此强大的有损压缩,那个把原始数据转化为可迁移表征的核心机制,我们在部署的那一刻,就亲手关掉了。

未来的道路,大概率不是单一的突破性技术,而是分层系统。上下文学习会继续作为第一适配层,它原生、验证有效、还在持续进步;模块机制会承担个性化和域专用的中间地带。但是对于真正的硬骨头——也就是创新发现、对抗性适应,还有那些无法用语言表达的隐性知识——我们最终需要模型在训练结束后,依然能把经验压缩进参数。

这意味着,我们需要在稀疏架构、元学习目标和自我改进循环上取得突破。我们甚至可能需要重新定义,模型到底是什么:它不再是一组固定权重,而是一个不断进化的系统,包含它的记忆、它的更新算法、它从自身经验中抽象的能力。

文件柜只会越做越大,但是再大的文件柜,也只是文件柜。真正的突破,是让模型在部署之后,重做那件让它在预训练中强大的事情:压缩、抽象、学习。我们正站在一个临界点上,从失忆的模型,走向拥有一丝真正经验的模型。

如果我们做不到这一点,我们就会永远困在自己的《记忆碎片》里。所以,持续学习,不是AI的一个可选加分项,而是AI从工具走向智能的必经之路。

感谢收看本期视频,我们下期再见。

📌 文中提及的人物和组织

公司/组织: a16z, OpenAI, DeepMind

产品/模型: GPT-4o

媒体/书籍: Memento, 记忆碎片

关键字: continual-learning large-language-models contextual-learning parameter-update compression-algorithm