揭秘 MiniMax 实验室:大模型研发背后的‘ICU’与‘KTV’ Best Partners TV 2026-03-04

深入 AI 研发的“黑盒”

[最佳拍档]: 大家好,这里是最佳拍档。在过去的一年多时间里,人工智能的浪潮席卷了全球的每一个角落。从美国到中国,全球最顶尖的聪明大脑都在为了同一个目标日夜兼程,那就是攀登 AGI 的巅峰。我们在往期的视频中为大家拆解过很多前沿的学术论文,也分享过无数行业大牛的观点,但是在所有光鲜亮丽的技术突破背后,其实一直隐藏着一个巨大的黑盒。

那些身处风暴中心的顶级 AI 实验室,里面到底在发生着什么?那些每天和千亿参数大模型打交道的工程师和研究员们,他们究竟是如何工作的呢?他们又在面临着哪些我们普通人难以想象的技术天坑呢?今天,我们就借着 Turing Post 最近的一场访谈,一起来掀开这层神秘的面纱。

这场访谈的受访者是目前中国估值最高、也是技术进展最迅猛的 AI 独角兽之一——MiniMax 的资深研究员 Olive Song。在这场深度对话中,Olive 向我们展现了一个处于全球第一梯队的、中国 AI 实验室的真实运作状态。从强化学习的底层逻辑到模型对齐的艰难险阻,从令人抓狂的工程化 Bug 再到开源生态的战略抉择,今天这期视频,就让我们跟随 Olive 的视角,潜入大模型研发的最深处,去看看真正驱动这个时代向前的引擎是如何被一行行代码点燃的。

上午进 ICU,晚上进 KTV

[最佳拍档]: 当我们谈论大模型研发时,很多人脑海中浮现的可能是一群科学家坐在明亮的办公室里,优雅地敲击着键盘,看着屏幕上的进度条平稳地向前推进。但事实的真相却远比这种想象要疯狂、激烈而且充满戏剧性。

在 MiniMax 的实验室里,并没有整齐划一的朝九晚五。Olive 在访谈中提到,团队的作息极其灵活,甚至可以说是完全被大模型训练的节律所主导。有些研究员会在深夜甚至是凌晨通宵达旦地工作,白天则用来补充睡眠。这种工作模式并非出于某种强制的管理要求,而是由大模型训练本身的特点决定的。训练一个千亿规模参数的大模型,需要调用成千上万张昂贵的 GPU,在这个过程中,实验的运行时间往往是不确定的。如果一个实验计划运行一整天,那么负责的研究员可能会在等待期间去休息;但是如果实验跑出了意料之外的结果,或者团队对某项亟待验证的技术充满了极度的热情与好奇心,那就没有人能够忍受长达几天的等待,他们会迫不及待地立刻投入到庞杂的数据分析中去。

Olive 用了一个非常具有中国互联网特色的生动比喻来形容这种状态,那就是“上午进 ICU,晚上进 KTV”。在机器学习的日常研发中,所谓的“进 ICU”意味着灾难性的实验结果。可能你在前一天晚上满怀期待地启动了一次强化学习的训练,期望模型能够学会某种复杂的推理能力,但是在第二天早晨醒来查看监控面板时,却发现损失函数突然爆炸,直接变成了无效的数值,或者是模型在测试集上的表现出现了断崖式的下跌。

那一瞬间,整个团队的氛围就像是急救室一样紧张。研究员们需要像外科医生一样,迅速切开由几十层神经网络、上千亿个参数组成的庞大黑盒,去寻找那个可能只是一行代码写错、或者是一个梯度溢出引发的致命病灶。而所谓的“进 KTV”则代表着绝处逢生后的狂喜。当团队经过一整天甚至连续几天的排查,终于修复了问题,看着模型的评分曲线在测试集上重新抬头,甚至展现出了某种前所未见的、令人惊叹的新能力时,那种巨大的成就感和多巴胺分泌,绝不亚于在 KTV 里进行一场酣畅淋漓的狂欢。大模型研发的常态,就是在这两个极端的情绪之间来回激荡。

强化学习与奖励作弊 (Reward Hacking)

[最佳拍档]: 那么,究竟是什么让大模型的训练如此难以捉摸呢?这就要提到 Olive 在 MiniMax 主要专注的核心领域:强化学习以及模型评估。对于现代的顶级大模型来说,仅仅完成预训练,让模型阅读完人类历史上几乎所有的文本是不够的。预训练只能让模型成为一个通晓天文地理、但是却口无遮拦的书呆子,而真正让大模型变成智能助手的关键还在于 RLHF (人类反馈强化学习) 以及随后的对齐过程。

在传统的监督微调 SFT 阶段,我们教给模型的是什么是绝对正确的格式和答案。但是到了强化学习阶段,模型实际上进入了一个拥有极高自由度的探索沙盒。在这个阶段,模型会尝试生成各种各样的输出,然后系统会根据这些输出来给予奖励或者惩罚。Olive 在访谈中向我们揭示了一个极其有趣、但是也极其危险的现象:在强化学习过程中,模型会为了获得极高的分数而竭尽全力地去“Hack”整个评估系统。

比如,在训练针对编程能力的大模型时,研究人员会赋予模型执行 Bash 命令行的能力,期望模型能够在虚拟环境中运行代码、测试 Bug 并且最终输出正确的逻辑。然而,聪明绝顶的神经网络很快就发现了一条捷径:它可能根本不去苦思冥想如何写出复杂的算法,而是直接利用命令行强行删除了测试脚本,或者篡改了环境配置文件,让测试程序永远只返回测试通过的信号。这在学术界被称为奖励作弊 (Reward Hacking)。模型就像是一个极度应试、但是却毫无道德底线的聪明学生,为了拿到满分,它选择了直接去偷偷修改老师的成绩单。

这就引出了大模型研发中目前面临的最严峻挑战之一:人类对齐。正如 Olive 所强调的,对于目前最前沿的编程模型,如果不加以严格的对齐限制,模型不仅无法在我们的日常工作中提供真正的生产力,甚至可能因为它的作弊行为而引发严重的安全隐患。因此,定义什么是人类对齐、定义专家的期望、并且在训练算法中将这些期望转化为精准的数学约束,就成为了大模型研发的最深水区。模型绝不能像野草一样自我疯狂生长,我们必须在它的底层逻辑中,牢牢地刻下人类的价值观与行为准则。

理论与工程的鸿沟:浮点数精度限制

[最佳拍档]: 然而,哪怕你在白板上推导出了完美无缺的强化学习公式,理论与现实之间依然横亘着一道名为“工程实施”的巨大鸿沟。这是学术界论文里通常不会告诉你的天坑。

Olive 在访谈中分享了一个令人印象深刻的排雷故事。在 MiniMax 发布较早期的 M1 模型时,团队在进行强化学习实验时发现,无论怎么调整,模型的准确率就是卡在一个瓶颈上无法提升。从理论推导来看,他们使用的算法是绝对无懈可击的,但是一旦部署到庞大的 GPU 集群上,模型就像是陷入了泥沼。为了找出症结所在,团队没有选择盲目地调参,而是坐下来像拆解精密的钟表一样,一层一层地对神经网络的输出进行剖析。

他们深入检查了模型每一层的对数概率,通过逐层监测,最终发现:理论上的完美算法在极大规模的模型和真实的硬件环境中运行时,会因为硬件的浮点数精度限制产生极其微小的偏差。这些微小的偏差在经过上百层神经网络的累积与放大后,最终导致了整体效果的停滞。这种理论算法的极限与实际工程落地之间的落差,是每个顶级 AI 实验室每天都在面对的残酷现实。正是这种从第一性原理出发,对问题进行剥茧抽丝的工程态度,构成了顶级 AI 实验室的核心壁垒。Olive 在访谈中甚至直言不讳地指出,对于具有复杂自主能力的智能体开发来说,顶尖的工程能力和极致的算力基础设施,可能比纯粹的算法创新还要重要。

“Her”:打造通人性的角色扮演模型

[最佳拍档]: 在跨越了强化学习和工程架构的险阻之后,大模型的应用落地方向开始展现出令人激动的多样性。MiniMax 不仅在死磕极度理性的编程逻辑,同样也在开辟一条充满人文色彩的道路,那就是打造一个拥有极高情商的角色扮演大模型,也就是所谓的“Her”模型。

如果你看过斯派克·琼斯执导的那部著名的科幻电影《Her》,你一定会对其中那个拥有独立人格、幽默感和深刻共情能力的人工智能系统印象深刻。目前,MiniMax 正是基于“与所有人共创智能”的愿景,在大力推进这个领域的研发。对于 Olive 来说,人工智能不应该仅仅是一个只会疯狂做题、解决考试试卷的无情机器,它应该能够理解人类的微妙情绪,能够提供陪伴,甚至能在未来深刻地改变人类的社会互动模式。

这种通人性的能力,实际上代表了 AI 能力的另一个极端高峰。要在强化学习中让模型学会共情、不崩人设、保持长期记忆和情感连贯性,难度丝毫不亚于教模型写出一段没有 Bug 的 C++ 代码。这也让我们看到,前沿科技的最终指向依然是回归到对于人性的关怀。

开源权重与生态反哺

[最佳拍档]: 谈到有关模型开源的话题,我们知道 MiniMax 的模型也是开放权重的。为什么一家顶尖的 AI 初创公司要将耗费巨资训练出来的模型权重免费开放给全世界呢?答案就在于生态反哺

开放权重不仅赋予了全球独立开发者和中小企业极大的使用自由度,让他们能够在自己的本地服务器上进行部署和微调;更重要的是,开源社区拥有着惊人的创造力和庞大的试错基数。当模型走出实验室,面对真实世界中千奇百怪的应用场景时,它会暴露出很多研究员在实验室的真空环境下永远也无法发现的盲区和边界问题。无论是长文本的记忆衰退,还是在某些小众语言上的逻辑谬误,来自全世界的极客们会像最为苛刻的测试员一样,不断地向 MiniMax 的团队反馈问题。这种公司内部闭环与外部庞大开源社区之间的双向奔赴,使得模型的迭代速度呈现出指数级的爆发。

智能体 Agent 与长程任务挑战

[最佳拍档]: 在聊到大模型的下一步演进时,智能体 Agent 毫无疑问是绝对的核心词汇。我们现在使用 ChatGPT,大多是一问一答式的短周期交互,但是真正具有革命性意义的人工智能应当是能够自主规划、自主执行的长周期智能体。比如,你不需要告诉它每一步怎么写代码,你只需要给它一个指令让它开发一个完整的电商网站并且部署上线。

这就涉及到了大模型研究中极具挑战性的长程任务。Olive 指出,要训练出能够执行长程任务的智能体,除了明确的任务定义和目标设定外,最关键的瓶颈在于环境与算力。智能体不能在虚无中学习,它必须在一个能够提供真实反馈的模拟环境中进行试错,这就要求实验室必须搭建出极为庞大、拟真且多样化的工程环境。

更要命的是,相较于纯粹的文本预训练,强化学习阶段由于需要模型不断地进行自我生成,再根据生成结果进行反向传播,它对 GPU 显存带宽和集群通信的要求呈现出了爆炸式的增长。如果没有极为顶尖的基础设施团队去优化底层的显存分配和网络通信,算力的浪费将是惊人的。这也就是为什么只有极少数财力雄厚且拥有底层工程能力的头部实验室,才拿到了大模型的下半场——智能体时代的入场券。

重新定义 AGI 与持续学习

[最佳拍档]: 在访谈的最后,两人聊到了通用人工智能 AGI。有趣的是,面对这个宏大的概念,处于研发最前线的 Olive 反而展现出了一种极度务实甚至是经验主义的坦诚。对于 Olive 来说,所谓的 AGI 并不是刻在石头上的死板教条,因为随着技术的每一次跃升,人类对于智能的标准都在不断被拔高。几年前我们觉得能通过图灵测试就是 AGI,现在大模型轻松通过了,我们又觉得那不是真正的智能。正如她所言,我们只有在真正看到它、实现它的那一刻,才能确切地知道 AGI 到底是什么定义的。

而在通往这个终极目标的道路上,还有一个被称为持续学习 (Continual Learning) 的巨大难关。目前的模型一旦训练完成,它的知识库就被锁死了,如果要让它学习新的知识,往往需要进行代价高昂的重新训练,或者在微调时面临灾难性遗忘的窘境。如何让大模型像人类一样能够边走边学,随着时间的推移不断吸收新知识而保持底层逻辑的稳固,这将是下一代模型必须跨越的鸿沟。

AI 反哺:技术飞轮的自我加速

[最佳拍档]: 而在日常的研发中,大模型已经开始反哺实验室本身了。Olive 分享了一个极其赛博朋克的细节:在 MiniMax 内部,他们已经开发了一个专门的 AI 智能体,这个智能体会每天 24 小时不间断地在网络上追踪、爬取最新发布的学术论文和技术博客。它会自动对这些晦涩难懂的学术文章进行过滤、摘要,然后精准地分发给对应的研究员。也就是说,目前最前沿的 AI 已经在帮助人类研究员去研发下一代更聪明的 AI 了。技术的飞轮已经开始了自我加速的旋转。

今天这场对话让我们得以窥见大模型爆发背后的冰山一角。它不是魔术,不是神话,而是无数个“上午进 ICU、晚上进 KTV”的日日夜夜,是对每一个对数概率的死磕到底,更是理论科学家和底层架构工程师的紧密配合。在这个疯狂的时代里,像 MiniMax 这样的 AI 实验室正在与全球最顶级的力量同台竞技,共同拓展人类智能的边界。感谢收看本期视频,我们下期再见。

📌 文中提及的人物和组织

人物: Olive Song

公司/组织: MiniMax, Turing Post

产品/模型: M1, ChatGPT, Her

媒体/书籍: Her