命名澄清与微信原生集成
上期视频测试了 Hermes Agent 的安全性和 Skill 自主迭代能力。本期继续讲解其高级用法。视频发布后,评论区有粉丝留言说 Hermes 的 H 不发音。经过向 ChatGPT 确认,Hermes 的美式和英式发音中 H 都是发音的,音标分别对应两种发音标准。这个单词指希腊神话中的奥林匹斯神赫尔墨斯(Hermes),是众神的使者。维基百科上有赫尔墨斯的专属词条,整页内容详细介绍了这位希腊神话人物及其雕像。谷歌翻译的发音也确认为 Hermes。因此 Hermes Agent 的命名源于希腊神话,与爱马仕奢侈品毫无关系,大家提到时不要说"爱马仕智能体"。
当前 Hermes Agent 已原生支持个人微信。用户可通过微信扫码直接连接,支持私聊、群聊,以及图像、视频、文件、语音等多媒体内容。按照官方文档,先运行两条命令安装依赖,再将 Hermes 升级到最新版。执行第三条启动命令后,出现微信选项,选中后生成二维码。在浏览器中扫码登录微信,系统会提示有新的 Open Cloud 连接到微信。回到终端选择群聊权限(禁用、允许所有、或仅允许列表中的群聊),确认连接成功。手机上会输出配对命令,在终端输入该命令完成配对。随后可在微信中直接与 Hermes 交互:询问其模型(回复为 MiniMax),列出编程相关的 Skill 等。
LLM Wiki 的三层架构设计
在之前的视频中介绍过开源项目 Grapher,可在 Cloud Code 和 Codex 中复刻 Andrej Karpathy 的知识库工作流。但 Grapher 主要适合分析代码库,对日常笔记等文档处理效果有限。Hermes Agent 已内置复刻 Andrej Karpathy LLM Wiki 工作流的 Skill,允许用户通过 Skill 方式创建、管理和使用 LLM Wiki。
LLM Wiki 采用三层架构,将知识组织为清晰分离的层次。
第一层:不可变层(原始来源)。包含论文、文章、图像、数据文件、会议纪要等文档类型,访问策略为大模型只读不改。这些文件存储在指定路径,核心角色是事实的唯一源头。
第二层:Wiki 页面层(为 Agent 打造)。包含摘要、实体、概念、综述、综合分析等页面文件,还包含 Index 等导航文件、交叉引用及维护机制。这一层由大模型创建、更新,交叉引用保持一致。
第三层:协同进化层(Schema 配置)。定义结构和约束,核心作用是将大模型变为纪律严明的 Wiki 维护者。演进方式是人类与大模型共同维护和迭代。
有状态知识编辑 vs 传统 RAG
LLM Wiki 和传统 RAG 的最大区别是:从无状态的碎片检索到有状态的知识编辑。RAG 检索每次都从零开始,知识不积累不关联;Wiki 能实现知识复利增长,最终实现数据飞轮。
传统 RAG 是无状态检索模式。每次查询从零开始,流程包括文档分块、向量嵌入、相似度检索、临时生成、答案丢弃。这意味着每次查询都会重复发现相同的知识。例如,回答一个需要综合五篇文档的问题时,大模型必须每次都找到这五篇文档并拼凑内容。
LLM Wiki 是有状态的编译模式。知识编译一次后能够持续更新、复利增长。工作流包含四个关键步骤:
第一步:完整摄入。将论文链接发送给 Hermes Agent,它能完整读取原文档、理解全文语义、与用户讨论关键要点、提取结构化知识。摄入完成后,Wiki 会自动生成初始页面数(如十三页)。Agent 会建议摄入更多论文或积累到一定数量时建立对比页面,同时询问重点研究方向。
第二步:知识编译。摄入完整内容后,系统写入摘要页面,创建、更新实体和概念页面。每个文档都被编译成结构化知识,以便后续复用。
第三步:交叉引用。系统自动建立不同概念间的关联,维护一致性。
第四步:编译查询与知识归档。有价值的答案被归档回 Wiki 成为新页面。查询和探索让知识库实现复利增长,知识被编译一次后会持续更新。
这种模式实现了范式跃迁、复利效应、零维护成本(由大模型承担所有维护工作)。
防过拟合研究的完整工作流示例
在终端输入斜杠命令 /LLM Wiki 后,系统提示这是 Andrej Karpathy 的大模型知识库。输入任务"创建一个用于存储大模型微调论文的知识库"后,系统检测到已存在用于 AI 和大模型研究的 Wiki,询问是否继续使用或新建。选择新建后,系统提示指定路径,目录创建完毕后开始写入核心文件。
系统支持直接导入 PDF 或 Archive 链接,会自动提取内容保存、更新 Concepts 和 Entities 页面、更新 Index 文件。搜索并输入三篇微调相关论文的链接后,系统开始抓取。输入研究方向"防止过拟合"后,Agent 开始研究。
系统先检查 Wiki 中是否有相关页面。Schema 中存在该标签但无对应文件,需先创建。创建内容包括灾难性遗忘(包含定义和典型场景)、防止过拱合提高泛化能力(包含定义和微调方法)。随后更新 Index 和 Log 文件,将新内容整合到导航中。任务完成时,新增四个防过拟合相关页面,Wiki 总页数达到十七页。
输入"根据刚才的研究讲解如何防止过拟合"后,Agent 根据 Wiki 中整理的论文和概念讲解过拱合的本质和防止方法,给出具体的解决方案。整个流程完成了从论文摄入、Wiki 生成、到基于 Wiki 知识回答问题的闭环。
多 Wiki 管理与 Obsidian 可视化
系统支持创建多个独立的 Wiki。用户可输入提示词切换 Wiki,如"切换到与 Agent 记忆相关的 Wiki",系统会切换到指定 Wiki。在新的 Wiki 中可继续摄入论文。输入两篇 Agent 记忆相关的论文链接后,系统摄入这些论文,显示更新和创建了哪些内容,给出论文的核心贡献对比。用户还可进一步询问如"讲解这篇论文中的生物认知启发的认知压缩",系统会给出详细的概念解释。
打开 Obsidian,找到创建的 Wiki(如与微调相关的 Wiki),点击 Graph 查看知识网络。点击 Index 进入导航页面,可点击具体概念(如灾难性遗忘)查看对应页面,页面包含定义、典型场景、主流解决方案、相关概念等结构化信息。点击交叉引用的概念(如 QLORA 微调)可跳转到相关页面。Hermes Agent 生成的 Wiki 可在 Obsidian 中完整查看、编辑和查询,同时支持知识图谱可视化。
数据飞轮的实现:Wiki 合并与持续迭代
由于两个 Wiki(微调相关和 Agent 记忆相关)都涉及大模型或 Agent,用户可输入提示词"合并这两个 Wiki",让 Hermes 自动合并。合并结果显示所有内容都并入主 Wiki,总页数达到二十七页。打开 Obsidian 的主 Wiki,图谱比单个 Wiki 更加复杂。点击 Index 查看合并后的导航文件,可访问所有具体页面(如 Agent 相关的内容)。
通过这种方式,用户可在 Hermes 中构建自己的 Wiki,用学习笔记、各种文档等资料让 Hermes 使用 LLM Wiki Skill 生成对应的 Wiki。在不断积累和使用中,实现真正的数据飞轮:知识被编译一次后持续更新,查询推动新知识生成,新知识自动归档回 Wiki,形成正反馈循环。这样,大模型从被动的信息检索工具变成了主动的知识管理者,而用户则通过持续的研究和查询,不断丰富和优化自己的知识体系。
📌 文中提及的人物和组织
公司/组织: OpenAI
产品/模型: Hermes Agent, MiniMax, GPT