AI 范式已剧变:罗福莉深度访谈全解读——Agent 框架是新的操作系统 (DeepSeek V4 Pro写作测试) · 乔木博客 向阳乔木 2026-04-24

乔木博客

全部

AI工具

AI教程

AI生成

AI资讯

健脑房

播客解读

论文学习

AI 范式已剧变:罗福莉深度访谈全解读——Agent 框架是新的操作系统 (DeepSeek V4 Pro写作测试)

AI生成

·

2026年4月24日

·

463 次阅读

·

约 22 分钟

这是一期让我反复暂停记笔记的访谈。罗福莉,小米大模型负责人。去年底离开 DeepSeek 加入小米后,她一直保持着极度低调的姿态。但在这期一个多小时的访谈里,她把认知储备全倒出来了。核心结论一句话:AI 的范式已经发生了不可逆的底层切换。从 Chat 到 Agent,不是功能升级,是操作系统的更替。

一、她是谁?为什么她的话值得听?

罗福莉,现任小米大模型负责人。

之前在 DeepSeek 参与过早期大模型的训练(类似 DeepSeek V3 规模的探索),训练过 600B-700B 参数级别的模型。

但她身上有个标签让她很不舒服——"AI 天才少女"。

访谈里她明确表示讨厌这个称谓,因为她真正相信的不是个人英雄主义,而是群体智能。

她认为任何一个人的想象力都是极其有限的,真正能推动 AI 进步的是高密度、高浓度的群体协作。

这个信念不是嘴上说说,后来她用一场疯狂的春节实验证明了它。

二、三天,从拒绝到狂热——与 OpenClaw 的相遇

OpenClaw 是一个极度开放的 Agent 框架。

罗福莉第一次接触时,内心是拒绝的。

她以为这又是某个团队鼓捣出来的实验性玩具——毕竟 2023-2024 年市面上出现过太多"加了几层系统提示词就自称 Agent 框架"的东西,没有一个能达到工业级可用度。

但三天之内,她从"这什么东西"变成了"这他妈就是未来"。

转变的第一个关键瞬间:她把一个以往框架根本搞不定的复杂日常任务丢给 OpenClaw——"如何筛选团队里有好奇心的人"。

她和 AI 深入探讨了一个小时,发现 AI 给出的思考维度甚至超出了她自己的想象。

紧接着,她让 OpenClaw 帮她从人员筛选一路规划到整个组织架构的搭建。

聊完之后,AI 将她的想法总结成了一套极其体系化的方案。

她的原话是:"在这类事务上,OpenClaw 已经基本上变成了我的数字分身。现在遇到任何选人或管理问题,我都会习惯性地去问它。"

第二个关键瞬间是更硬核的。

接触 OpenClaw 的次日,她把一个真正复杂的科研任务丢了过去——构建一个多轮交互的 User Agent。

这东西以往需要大量的人力和时间。OpenClaw 在两小时内高标准完成了。

从这一刻起,她知道变天了。

三、Agent 框架不是工具的升级,是新的操作系统

整期访谈最核心的理论贡献,是这个论断:

Agent 框架是一个极度厚重的智能中间层,它将像当年的操作系统一样,成为新的基础设施。

罗福莉从四个维度拆解了这个论断:

3.1 主动弥补模型的能力短板

大模型本质上是被动的计算引擎——你给它 Prompt,它给你输出。

但真实世界的任务远不是一问一答能覆盖的。

OpenClaw 的做法是:框架主动去弥补模型"缺手少眼"的先天不足。

举个例子:当你给 OpenClaw 发一段视频,你完全不需要手动配置视频理解模型。

框架会自己判定主模型在视频理解上存在短板,然后自动寻找并调度一个视频理解能力强的模型来接管,甚至会自动选择更便宜高效的模型来优化成本。

这就是"多模型联合调度"——框架清楚知道不同模型的"长板"与"短板",能在最优环节调度最优模型。

3.2 分层分级的持久化记忆系统

这是 OpenClaw 跟传统框架最本质的差异之一。

传统框架的记忆管理非常死板:在单次会话快满的时候,被动地做一次压缩,然后勉强维持跨 session 的上下文共享。

这是一种纯软件工程思维——"内存不够了就 swap 一下"。

OpenClaw 则从底层设计了一套分层级、分粒度的持久化记忆底座。

结果是什么?近 100 个不同背景的人同时在大群里使用时,每个人的记忆流完全不串,画像把控极其精准。

更颠覆的是:用户可以直接用自然语言让 AI 去重写这套多智能体底层的记忆系统源码。

你在传统框架里见过这种事吗?

3.3 心跳任务与主动上下文获取

这是我觉得最有启发性的设计。

传统编程场景中,AI 只需要被动响应代码指令。

但真实生活不是这样的——Agent 需要保持持续的在线感知。

OpenClaw 引入了心跳任务(heartbeat tasks)和定时任务:系统在不依赖人类干预的情况下,自发唤醒模型去执行行动,然后主动收集模型自身无法获取的环境上下文,精准地输送给它。

罗福莉的逻辑很简单:模型缺的不是智力,是信息。只要你把这些缺失的上下文给足,模型就能做出极高质量的决策。

3.4 越级放大效应:3B 小模型的逆袭

这是最震撼的一个案例。

罗福莉的团队曾把一个刚训练出来的 3B 参数端侧模型接入 OpenClaw 的复杂 Agent 框架。

结果令人震惊——这个小模型完成了团队原本认为"小模型绝对不可能做到"的复杂任务。

极度厚重的 Agent 中间层,极大拉高了中低端模型的"能力天花板"。那些原本在 85% 任务上表现不错的"中层模型",在框架加持下,能在绝大多数场景中发挥出近乎顶尖大模型的水准。

她的判断是反直觉的:框架越厚,模型可以越小。

四、群体智能:一场疯狂的春节实验

理论说完了,罗福莉用一个极其大胆的实验来验证。

春节前,团队对新事物(OpenClaw)很抵触。她在群里下了一道"命令":

"如果第二天 OpenClaw 对话次数不超过 100 轮的人可以直接离职。"

她后来承认根本没打算真正考核,这只是一种强硬的表态——"不用就会落后"。

与此同时,她做了精心的环境准备:买了几台 Mac Mini 提前把框架部署好,把团队按不同方向拉进几个飞书大群集中使用和交流。

接下来发生的事情让她自己都震撼了:

群消息十分钟不看就 999 条。 团队氛围变得极度狂热。

原因在于:当大家同处一个大群时,看到别人竟然能用 OpenClaw 干成某件自己完全没想到的事,个人的想象力瞬间就被点燃了。

群体的创造力不是个体之和,而是个体的乘积。

近 100 个不同背景的人在疯狂修改框架源码。

结果呢?不仅没改坏,记忆系统反而被群体炼得越来越精准,对上下文中每个人画像的把控变得极其智能。

她的原话:

"如果单靠个人去修改 Agent 框架,进步速度极其缓慢。但利用一群人的智慧去改进,框架几个小时就能完成一轮迭代。"

最终结果:团队在三四周内完成了以前需要三四十周才能完成的研究任务。

这次实验让她彻底确信:利用群体智能去提升 Agent 框架,是非常核心的路径。

五、AI 科研已被彻底重构

5.1 从线性到并发的科研节奏

传统 AI 研究流程:产生想法 → 写代码 → 设计评估标准 → 排队验证。

即使一切顺利,一个周期也需要一两周。

在成熟 Agent 框架的辅助下?一两个小时内高标准完成原本几周的工作。

更关键的是验证方式的变化。

过去验证科研想法只能靠人力一个个排队测。现在?同时把 10 个不同的科研构想交给 10 个不同的 Agent 并发执行,短时间内完成交叉验证。

"只要评测标准设置得足够准,科研想法的验证效率就会发生根本性的跃升。"

5.2 算力分配比例的重构:3:1:1

最能说明范式转变的,是算力分配比例的变化。

过去(Chat 时代):Pre-train : Post-train = 3:1 甚至 5:1

预训练占据绝对大头。因为核心竞争力是"让模型知道更多知识"。

现在(Agent 时代):前沿研究 : Pre-train : Post-train = 3 : 1 : 1

为什么前沿研究占 3?

罗福莉的解释一针见血:"产生想法和写代码的速度已经非常快了,真正的研发瓶颈转移到了'验证想法'上。"

你需要保留大量算力冗余去并发跑无数个实验——前期探索架构,中后期验证算法。

为什么 Post-train 能和 Pre-train 平起平坐?

因为 Agent 范式下,你需要教会模型如何与复杂框架耦合、如何执行端到端的长程任务(如一兆 Context 的处理、多智能体协同)。

后训练的周期被大幅拉长,所需算力已经和预训练完全相当。

六、后训练时代的核心竞争力:代码与长程任务

罗福莉在这期访谈里提出了一个极其重要的技术洞见:

代码——尤其是软件工程开发——是保住大模型泛化能力下限的关键。

她的逻辑是这样的:

代码是一个极其典型的长程和多轮交互任务。

不同文件与代码块之间的逻辑关联极其紧密。当模型在高度依赖长程上下文的数据环境中训练时,它对长上下文的理解和建模能力自然会得到质的飞跃。

更关键的是:"只要模型能把复杂的软件开发任务做好,模型本身所具备的很多通用智能特质就已经被完善了。" 为严谨编程而不断迭代的 Agent 框架本身也具备了极强的泛化性,可以直接迁移应用到其他更困难的通用长程任务中。

所以她的策略是:先构造真实且多样的长程代码任务,融入大量 SFT 和 RL 训练中,把"上限"打透。然后再依靠群体智能挖掘出的广泛领域数据进行训练,将这种长程泛化能力外延到各个场景,以此保住模型在所有任务上的"下限"(稳定性)。

代码训练不是让模型变成程序员,而是让模型拥有处理复杂现实的能力基座。

七、MiMo-V2 的设计哲学:放弃主流,追求极致

7.1 为什么放弃 MoE?

MiMo-V2 Flash 做了一个大胆的选择:放弃主流的 MoE 架构,转而追求极致的混合注意力结构。

罗福莉的解释非常技术化但极其清晰:

MoE 确实能有效减少参数量,但它的设计初衷是为了在现有芯片上达到"访存与计算"的完美比例。

这意味着它的计算量已经被打满了(被计算 bound 住),没有发挥空间再叠加额外的推理加速技术。

而混合注意力结构(全局注意力 + 滑动窗口)将稀疏比拉到了 7:1 甚至更高,极大节省了 KV Cache,在计算上留出了大量"富余"。

7.2 MTP(多Token预测)的巧妙配合

省下来的算力干什么?MTP 完美地吃掉了这些"计算红利"。

MTP 的核心突破:

推理加速数倍:Flash 模型甚至能达到 100-150 TPS 的惊人速度

降低单 Token 成本:GPU 利用率被打得更高

零幻觉代价:MTP 的预测结果会被严格验证(verify),预测准确才会采纳

提升基座能力:在预训练阶段加入 MTP 本身就能有效提升模型的基础能力

7.3 为什么同时推出三个模型?

MiMo-V2 系列同时推出了 Pro、Omni 和 TTS 三个独立模型,而不是强行统一到一个多模态大模型中。

罗福莉的理由是极致的实用主义:

"Agent 革命的本质是生产力的提升,必须高度在意任务的端到端完成率和成本效率。"

如果把所有模态强行融合到一个庞大模型中,成本和速度都会被拖垮——"语音生成完全没必要动用沉重的基座模型,否则延迟将让人无法接受。"

三个模型在 Agent 的精密编排下各司其职:Pro 负责深层认知和复杂调度,Omni 负责多模态环境感知,TTS 负责声音表达。又因为它们在同一个生态下训练,共享底层背景知识,能形成极高的协同默契。

"不是技术上做不到统一,而是统一在工程上没有意义。"

7.4 "悄无声息的伏击"

MiMo-V2 的发布被形容为"悄无声息的伏击"。这不是营销策略,而是技术爆发的真实写照。

团队早在一年前就开始布局多模态,但当时并不清楚这些能力该如何组合。直到罗福莉接触到 OpenClaw框架——"脑海中瞬间打通了逻辑,立刻明白了语言、感知、语音模型可以如何在 Agent 的不同环节中被有效编排。"

基于这种顿悟,她迅速让所有研发方向全面转向适配新范式的后训练设计。内部的觉醒和爆发速度,甚至远超团队自己的预期。

八、开源 vs 闭源:一场关于进化速度的博弈

罗福莉对开源和闭源的思考超越了简单的意识形态之争,而是从进化速度的角度给出了底层逻辑:

8.1 群体智能只有开源能撬动

闭源 Agent 框架(如 Cloud Code)是一个黑盒——开发者无法洞察其内部设计,更无法修改底层的记忆系统或多智能体工作流。

"由开源社区共建带来的进步速度,是任何封闭系统都无法比拟的。"

这不仅仅是代码层面的贡献。当大量开发者在不同场景中高强度使用并修改框架时,框架本身就在被"群体炼化"——就像春节实验里那 100 个人做的一样。

8.2 隐私与安全的真相

"很多人认为闭源更安全,但开源与安全性并不冲突。"

极度开放的框架使得**"端云混合"**成为可能:涉及个人隐私的简单任务交给本地小尺寸端侧模型处理,需要高创造力的非隐私任务放到云端大模型推理。

但这种复杂的端云结合架构,需要大量开发者的共建——任何单一公司都无法独立完成。

8.3 生态位决定策略

她给了一个非常商业化的视角:一家模型厂商选择开源还是闭源,本质上取决于其"生态位"。

如果公司拥有别人短期内无法攻克的战略资源和护城河 → 敢于拥抱开源

如果仅仅把模型本身当作唯一的生存壁垒 → 只能选择闭源

"如果要实现全社会的生产力革命,底层的算力芯片、能源和框架资源注定是分散的,不可能由一家公司完全垄断。开源是加速全人类通往未来智能时代的核心引擎。"

九、OpenClaw 时刻 ≠ ChatGPT 时刻

罗福莉做了一个让人深思的对比:

ChatGPT 时刻的特征:

突然爆发的、极其清晰的时间节点

全世界瞬间震动

有明确统一的测试标准(数学能力、代码能力,一测便知)

模型具备了某项能力就是具备了,标尺极其清晰

OpenClaw 时刻的特征:

延续时间更长,渗透得更深

因为行业关于 Agent 的"前序章节"铺垫太久,人们一开始甚至察觉不到它是颠覆性事物

面对的绝大多数真实场景是"混沌的",缺乏明确统一的测试标准

价值不是单点爆发,而是在混杂场景中缓慢积累,直到某个临界点后突然向前迈进一大步

她说了一句我反复回味的话:

"ChatGPT 时刻带来的震撼是'它竟然能回答'。OpenClaw 时刻带来的震撼是'它竟然能完成'。这是两种完全不同量级的颠覆。"

十、1T 参数是入场券,但未来的主角是小模型

罗福莉在这个问题上异常辩证,两面都说得极其透彻:

10.1 为什么需要 1T?

"如果你要角逐顶尖 Agent 任务的'天花板',如果你想达到或接近 Cloud 4.6 Opus 的水准——1T 及以上总体参数规模是必须跨越的门槛。"

她的逻辑链:模型的智力上限由"参数量 + 上下文任务本身"共同决定。在团队成功训练过 600B-700B 规模模型的基础上,继续拓展到 1T 是突破当前智能瓶颈的必然选择。

10.2 为什么小模型不会死?

但硬币的另一面更精彩:

"极度厚重的 Agent 框架极大拉高了小模型的'能力天花板'。"

那个 3B 端侧模型在框架加持下完成复杂任务的案例,就是最好的证明。她的预测是:

"同等智能水平的基座体积会越来越小。可能未来一年内,十几 B 激活参数的小模型就能达到今天顶尖模型的水准。"

逻辑很简单:在真正的生产力革命中,成本和速度是极度关键的考量。灵敏、低成本的小模型,结合强大的 Agent 框架,将在绝大部分日常高频场景中爆发巨大潜能,成为替代传统工作的主力军。

框架越厚,模型可以越小。大模型负责天花板,小模型负责生产力。

十一、训练 1T 模型的真实挑战:连太阳黑子都要怀疑

罗福莉非常诚实地分享了训练超大模型的"暗面":

11.1 Loss Spike 与专家死亡

训练万亿参数模型时,频繁遭遇 Loss Spike(损失函数突然飙升)是家常便饭。更深层的问题是:某些 Expert(专家网络)的数据分布变得极端,负载极不均衡。如果不加干预,异常更新的极大数值会直接把某些参数或 Expert "打死",导致后续再也不会有 Token 被送入该节点。

11.2 玄学级 Bug 排查

问题表象是数值异常,根源却可能隐藏得极深。团队在排查完所有显卡发现没有硬件故障后,甚至会无奈地怀疑是不是"太阳黑子爆发"导致的。

这考验的不是单纯的算法能力,而是"从最表层到最底层的基础设施排查能力"——从底层通信算子是否正确,到混合注意力机制的稀疏比是否过高,到每一层参数的输入输出差异——需要全链路追踪。

11.3 零容忍:几千张卡停工两周也要查清

这是最体现她工程哲学的一点。

面对直接起飞且无法自行恢复的 Loss 异常,团队坚持绝对不将就。

"我们宁愿让几千张极其昂贵的显卡停工闲置——最长甚至停过两周——也必须彻底查清并解决问题,绝不带着隐患强行往前训。"

她认为很多团队对 Loss Spike 见怪不怪是致命错误:"忽视它会导致模型内部出现大面积不可逆的'死神经元',严重削弱模型的潜力上限。"

11.4 跨界联合 Debug 是终极竞争力

解决万亿规模模型的训练难题,极其考验Infra(基础设施)与算法联合 Debug 的能力。在未来的大模型竞争中,打破部门壁垒、让懂算法的人精通底层机制、在一个无层级约束的小团队中协同作战——其问题解决效率远超臃肿的大公司科层架构。

十二、对未来 1-3 年的五个核心预测

罗福莉的预判高度具体,不确定但方向清晰:

12.1 工作模式被颠覆(2 年内)

"两年内,大部分人的传统工作和生活模式将被彻底颠覆。" 2026 年的主旋律是生产力的加速变革。工作场景的颠覆会先于生活场景发生——因为工作直接与生产力价值挂钩。

12.2 "AI 训练 AI"的奇点

"大模型依靠自身去创造新研究、自我训练并产生更强智能的现象,肯定会在这一两年内发生。" 这标志着 Agent 自学习与自迭代达到巅峰——不再是人训练 AI,而是 AI 训练 AI。

12.3 多智能体协同成为现实

解决极其复杂的长程任务(如复杂软件工程),不可能仅靠单一模型。多智能体的协同合作不仅能极大节约成本和时间,更会在今年内成为落地的现实。

12.4 推理需求爆发式增长

随着 Agent 框架变强、模型能力提升、端侧成本降低,推理需求将出现几倍甚至几十倍的爆发。 算力资源的竞争核心从训练端向推理芯片和基础产能(存储等)转移。

12.5 小尺寸端侧模型成为主支线

未来十年内,同等智能水平的模型体积持续缩小。这些灵敏、低成本的小模型在优秀 Agent 框架加持下,将具有极高的爆发空间。

十三、给创业者和开发者的五条行动建议

13.1 一人成军不是口号

"一个人都可以成为一家公司。" 在 Multi-Agent 架构下,一个人充当管理者,调度和"养"无数个 AI 数字员工完成复杂业务流——这不是科幻,今年就会落地。

13.2 敢于推翻所有既往认知

"面对如此剧烈的范式转变,必须思考'原来所有的做法是不是都是错的'。" 不要再用庞大的人力团队解决问题,思考如何用 Agent 带来的生产力价值替代传统人力。

13.3 寻找独特的"生态位"

创业公司在巨头夹击下留在牌桌上的关键:让 Agent 框架高度耦合你手里的独家战略资源——特定操作系统、硬件、私域社交流量。 这不是技术竞争,是生态位竞争。

13.4 底层前瞻性与后段敏捷性并重

做预训练和基础设施:提前半年到一年做战略预判(算力分配、底层架构如何适应未来 Agent)。 做后训练和 Agent 开发:保持极高的敏捷性和试错包容度,适应几乎每周都在进化的框架生态。

13.5 招人看"热爱"不看过往经验

"过去的'大模型经验'不重要。好奇心、纯粹的热爱和未被禁锢的思想更重要。"

她极力推荐招募优秀的本科生——思想极其灵活、敢想敢干。只需要提供高浓度的"群体互相蒸馏"环境,技能几个月内就能极速习得。

写在最后

这期访谈信息密度极高,我记了十几页笔记,写了七千多字才勉强覆盖核心内容。

但如果你只要带走一个念头,我希望是这个:

AI 范式已经发生了不可逆的底层切换。从"对话"到"行动",从单模型到多智能体协同,从静态框架到自进化系统。Agent 框架不再是模型的附属品——它是新的操作系统。

操作系统的更替,一代人只能遇到一次。

而上一次操作系统级别的机会,造就了微软、苹果和整个 PC 互联网时代。

参考来源:YouTube - 罗福莉: OpenClaw, Agent框架 — AI范式已剧变

写作时间:2026-04-24

标签:#Agent框架 #AI范式转变 #OpenClaw #罗福莉 #群体智能 #开源 #大模型训练

© 2026

·

向阳乔木

📌 文中提及的人物和组织

人物: Luo Fuli

公司/组织: Xiaomi, DeepSeek

产品/模型: OpenClaw, MiMo-V2

关键字: agent-framework ai-paradigm-shift multi-agent-systems open-source-ai ai-development-workflow