长期记忆之后的拼图:为什么 AI 需要“短期精准记忆”?
在过去的研究中,我们已经通过 Memory Link DB Pro 等插件成功赋予了 OpenClaw(基于 Claude 模型的第三方客户端界面)长期记忆能力。然而,仅仅拥有长期记忆是不够的。如果你希望 AI 变得更加聪明,还必须解决其短期记忆能力(Short-term Memory: 在单一会话内处理多轮连续对话的能力)的短板。目前,OpenClaw 在处理超长会话时存在明显的缺陷:当 上下文窗口(Context Window: 模型一次性能够处理的最大文本范围)达到特定阈值后,系统往往会开始丢失会话早期的技术细节和核心要点。
这种情况在软件开发等复杂场景中尤为致命。例如,当你与 AI 针对某个项目进行了几十轮的深度讨论,积累了海量的上下文后,由于其原生的上下文管理(Context Management: 系统如何选择、截断或压缩历史消息以适应模型限制的过程)存在缺陷,AI 极易忘记最初讨论的项目架构或具体技术决策。为了彻底解决这一“掉链子”的痛点,我们需要引入一套无损的上下文管理方案,确保即使在百轮对话之后,AI 依然能精准回忆起第一轮对话的内容。
核心架构与无损压缩:lossless-claw-enhanced 的底层逻辑
为了增强短期记忆,我们采用了开源项目 lossless。这个项目的设计思路非常精妙:它并不直接删除旧消息,而是利用大模型将历史对话压缩成摘要,并构建一个有向无环图(Directed Acyclic Graph (DAG): 一种由节点和有向边组成的图结构,确保信息流向不形成回路)。原始消息会被完整地持久化存储在 SQLite(一种轻量级的、基于文件的关系型数据库)中。从理论上讲,这意味着 OpenClaw 永远不会真正“忘记”任何细节。
然而,原生项目主要是为英文用户设计的,在中文环境下存在严重适配问题。首先,它对中文内容的 Token(文本处理的基本单位)估算存在偏差;其次,它存在摘要丢失的致命 Bug。在我们的基准测试中,设计一个 40 个轮次的对话,并在前 8 轮埋入 16 个具体技术细节,随后用大量的代码讨论填满上下文。结果显示,原生项目的召回率(Recall Rate: 衡量系统从海量信息中准确提取目标信息能力的关键指标)仅为 56%。
针对这些问题,我进行了深度的二次开发,推出了 lossless-claw-enhanced 增强版。在这个版本中,我们不仅修复了中文 Token 估算的错误,还极大地提升了信息检索的稳定性。实测数据表明,不使用插件时召回率为 0%,使用原生项目为 56%,而使用我开发的增强版后,召回率成功达到了 100%。这意味着 OpenClaw 终于具备了处理复杂、长线任务的坚实基础。
全自动安装与实战验证:百轮对话下的召回率极限测试
部署该插件的过程非常简单。你只需将仓库链接复制到 OpenClaw 中,通过自然语言指令(例如:“请阅读该项目的 README,并选择最合适的方式为我安装和配置”)即可实现全自动安装。如果遇到环境限制导致安装失败,还可以配合 Codex 桌面版利用其高逻辑级别的模型(如 GPT-4.5 思考级别)进行全自动配置。安装完成后,只需运行 open-claw-gateway restart 重启网关,即可激活其“第二大脑”。
lossless-claw-enhanced 的工作流程可以分为三个触发阶段:
- 增量压缩: 当旧消息超过 20k Tokens 时,系统会在后台静默启动压缩,用户无感知。
- 阈值压缩: 当上下文占用率接近模型窗口的 75% 时,会触发更深度的管理机制。
- 按需回忆: 当用户问及早期细节时,OpenClaw 会调用检索工具,从层级摘要和数据库中精准提取信息。
在实战测试中,我们构建了一个名为 TaskFlow 的 Python CLI 任务管理工具。在会话最初,我们确定了使用 SQLite 存储、支持 CRUD 操作以及具体的分层架构方案。在经历了数十轮无关的代码干扰讨论后,我们再次询问 AI:“最初给出的分层思路是什么?”系统精准地回复了包含数据层、模型层、业务层和展示层的完整架构,并明确标注了这些信息提取自“第二轮 LLM 摘要”。
为了进一步验证其稳定性,我们使用 Cloud Code 自动向会话中注入了五个关于架构决策的复杂测试题。结果显示,OpenClaw 的回答与初始设计的技术方案保持了 100% 的一致性。这种精准的短期记忆能力,让 AI 不再仅仅是一个简单的聊天机器人,而是进化成了一个能够处理超长逻辑链条、越用越聪明的专业助手,能够胜任真正贴合实际生产环境的复杂开发任务。
📌 文中提及的人物和组织
产品/模型: OpenClaw, Claude, lossless-claw-enhanced, SQLite