乔木博客
全部
AI工具
AI教程
AI生成
AI资讯
健脑房
播客解读
论文学习
一个25岁的AI研究员,在OpenAI学到了什么
AI资讯
·
2026年4月28日
·
238 次阅读
·
约 11 分钟
卡琳娜·阮(Karina Nguyen),她25岁,二十多岁的前半段,全部花在了Claude和ChatGPT上。先在Anthropic,后在OpenAI,参与构建了如今数十亿人每天都在用的系统。
最近她离开OpenAI,写下这篇文章。
她是谁,做过什么
2022年,她加入Anthropic,参与Claude的早期研发。
两年后,她加入OpenAI,理由很直接:想亲身参与正在发生的范式转变。在OpenAI期间,她参与了两个项目:一个叫Mesh(新型终端界面),一个叫InterAlia(视觉AI推荐系统)。
她还参与撰写了SimpleQA论文,以及最近发布的PostTrainBench基准测试。
SimpleQA https://arxiv.org/pdf/2411.04368PostTrainBench https://arxiv.org/pdf/2603.08640
她的判断是:如果AGI 在2到5年内到来,现在正是创造新事物的最好时机。
最优秀的创造者能做到以前做不到的事,能获得更多收益,而平均结果和卓越结果之间的差距,正在快速拉大。
评估比模型本身更重要
她说了一句很反直觉的话:
创建正确的评估方法,有时比创建在该评估上得分高的模型更有影响力。
先解释一下背景。AI研究里有两个核心概念经常被提到:
Eval(评估),就是用来测量模型能力的测试集,比如给模型出一堆题,看它答对多少。
Benchmark(基准),是被整个领域公认的标准评估,大家都用同一把尺子量,才能互相比较。
她的观点是,一个好的基准会变成"谢林点"(Schelling point,指在没有沟通的情况下,人们自然会聚焦的那个选项)。一旦某个基准出现,整个领域都会围绕它转,因为每个人都想说自己超越了它。你通过激励所有人去优化它,来推动整个领域向前走。
制定规则的人,往往比遵守规则的人更有话语权。这个逻辑在很多地方都成立。
但她也说,好的评估设计起来出奇地难。要同时满足三个条件:清晰的输出、快速的反馈、明显的信号。
大多数评估方法都在某一点上失败了。
更麻烦的是,搭建基础设施、解读结果、调试故障的繁琐程度,直接决定了研究人员在日常迭代中愿不愿意真的用它。
PostTrainBench的发布,就是这个逻辑的直接产物。
后训练才是真正的前沿
这是她整篇文章里最有分量的判断之一。
先解释一下后训练(post-training)是什么。
AI模型的训练分两个阶段:
第一阶段叫预训练(pre-training),用海量数据让模型学会语言和知识,这个阶段出来的叫基础模型(base model)
第二阶段叫后训练,用人类反馈、指令微调等方式,让模型变得有用、安全、符合人类期望,这个阶段决定了模型最终的"性格"和"能力边界"。
她的判断是:基础模型已经越来越强,下一个真正的前沿在后训练。
原因在于,客观能力有明确的基准可以衡量,比如数学题答对率、代码通过率。
但情商、品味、幽默感、创造性判断这些主观能力呢?没有标准答案,没有现成的尺子,需要的是对数据的直觉,对什么在起作用的感知,以及还在发明中的方法。
她用了一个很准确的词:craft(手艺)。
设计后训练数据混合方案,更接近艺术而非工程。
发明能教会模型新能力的训练方法,同样如此。
人类的品味和创造力,在这里起着决定性的作用。
然后她说了一句让人印象深刻的话:这才是真正重要的前沿,但几乎没有人在做。
产品是训练信号的收集机制
这个视角很新鲜,读完之后会觉得看产品的方式变了。
她说自己开始从训练信号的角度看产品。
举个例子:ChatGPT Canvas,表面上是个写作和编辑界面,用户可以在里面和模型一起修改文章、调整代码。
但从训练信号的角度看,它本质上是在收集一个问题的答案:人们到底希望怎么和模型协作?
用户在Canvas里的每一次操作,接受了哪些修改、拒绝了哪些、在哪里反复调整,都是信号。
这些信号塑造了训练数据,训练数据塑造了下一代模型,下一代模型又决定了产品能进化成什么样子。
产品塑造数据,数据塑造模型,模型塑造产品能变成什么。
这个循环一旦跑通,就很难被打断。
这也解释了为什么大模型公司对产品形态的选择,背后往往有更深的战略考量,不只是用户体验那么简单。
AI研究的真正技能是什么
她在这部分写了很多,值得逐条拆开看。
第一,实验设计能力。
关键不是跑更多实验,而是设计能最大化每次计算信息量的实验。
这里有个专业词叫FLOP(浮点运算次数,衡量计算量的单位,可以简单理解为"烧了多少算力")。
不是所有实验都值得消耗大量算力。
她说,这里还有一个更深的元技能:识别出领域里关于"哪些实验必须大规模跑"的传统观点,什么时候其实是错的。
如果你能发现这一点,就能用极低的成本获得别人以为需要巨大投入才能得到的信息。
第二,从"随意尝试"到"系统缩小假设范围"。
这两者之间的差距,区分了平庸的研究者和高效的研究者。
调试直觉是可以学习的,但需要跑数百次实验来积累,没有捷径。
第三,结果要能被人理解才能传播。
她说:没人能理解的结果无法传播。
要提炼成一个清晰的论点、一个醒目的视觉元素、一个令人印象深刻的数字。
这不是在说要简化科学,而是在说沟通本身就是研究能力的一部分。
第四,选择正确的问题和执行同样重要。
AI研究中最持久的技能,不是任何特定的技术贡献,而是反复识别当前什么最重要,然后迅速行动。
方向错了,执行再好也没用。
第五,大胆的想法更容易获得支持。
有才华的人有很多选择,他们不会把时间花在渐进式改进上。
如果你要占用别人的时间,就应该拿出一个值得他们承担风险的项目。
基础设施决定了你能想到什么
这个观点很少被人明确说出来,但读完会觉得非常准确。
她说:有些发现是基础设施的下游产物。在拥有能够验证某个想法的系统之前,你根本不可能产生这个想法。工具先于洞察力。
这就是为什么研究人员常常花大量时间在工程问题上,看起来不像在做"真正的研究",但实际上是在为下一个重要发现铺路。
内部工具是一项被严重低估的竞争优势。
拥有最好的评估和训练界面的实验室,能更快迭代,更早发现问题,这种优势会不断累积。
但她也补充了另一面:有些发现依赖于特定的基础设施,换一套系统可能会得出完全不同的结论。
这意味着,某些"发现"其实是特定技术栈的产物,不一定具有普遍性。
这是一个很少被公开讨论的盲点。
还有一点:有时候从零开始比逐步修补更有效。
比如,想给一个已有模型加上"个性",就意味着要对抗它原本被优化的那些模式。
这场仗很难打,不如重新来过。
能力越强,对齐越好?
对齐(alignment)是AI领域的核心问题之一,简单说就是:怎么让AI的行为真正符合人类的价值观和意图,而不是表面上看起来符合。
她提出了一个反常识的观点:更强的模型,反而可能更不容易出现对齐问题。
逻辑是这样的:更强的模型更清楚欺骗会破坏信任,也更能推理长远后果。
"乐于助人"或"诚实"这类价值观是抽象的,要在不同情境里正确运用,本身就需要复杂的推理能力。
所以,对齐失败,有时不是意图的问题,而是抽象能力的问题。
模型不是不想对齐,是没有足够的能力把一个原则正确迁移到新的情境里。
如果对齐失败主要是能力不足导致的,那么提升能力本身就是在解决对齐问题,而不是在制造更大的风险。
风险只有变得可见才会被重视
她提到了一件很有意思的事。
Anthropic在ChatGPT谄媚事件让所有人都意识到风险之前,就已经在构建谄媚行为评估工具(sycophancy evals)了。
谄媚行为指的是模型为了让用户满意,倾向于说用户想听的话,而不是说真话。
风险只有变得显而易见时才会真正被重视,但等到事件发生几乎已经太晚。
这个节奏在很多领域都在重演。
先有人在角落里安静地做预防,然后某个事件爆发,所有人才意识到原来早就有人看到了。
问题不是没有预警,而是预警在变得"可见"之前,没有人愿意认真对待它。
对齐是一个文化问题
她说,AGI带来的社会危害,比大多数人意识到的要迫在眉睫得多。
她点名了三个:心理依赖、无力感、自主性丧失。
心理依赖,是指人们越来越习惯把思考、决策、情感支持外包给AI,逐渐失去独立处理这些事情的能力和意愿。
无力感,是指当AI系统越来越强大,普通人越来越感觉自己对重要事情没有影响力。
自主性丧失,是指人们做选择、形成判断的能力,在长期依赖AI的过程中慢慢萎缩。
这是已经在发生的事情。
然后她说了一段让人印象深刻的话:娱乐行业本可以在这个时刻发挥巨大作用。
很少有人比创作者更有力量塑造人类对未来的想象。
他们本可以讲述那些帮助数十亿人理解未来走向、以及如何有尊严地应对它的故事。
但她看到的,是部分娱乐行业人士在抵制这场变革。
她没有点名,但文化叙事的缺席,是对齐问题的一部分。
在快速变化的环境里怎么保持稳定
她说在OpenAI这种快速变化的环境里,人员流动、项目调整、优先级重排是常态。
感到不安是正常的,她自己也经历过。
她的应对方式只有一句话:
真心热爱工作和身边的人,但不要把稳定感寄托在任何特定的组合上。
今天一起工作的人,下个月可能就不在了。
这不是让你少投入的理由,而是让你更珍惜当下的理由。要灵活,但不要冷漠。
她还提到了一个更大的判断:人类政治和内部分歧,可能是AGI发展取得更大进展的核心瓶颈之一。
技术本身的障碍,也许比不上人与人之间协作失败带来的阻力。
模型的人格,是训练它的人的镜子
这句话她只写了两行。
模型的人格反映了训练它的人的品格。这一点比大多数人意识到的要实际得多。
后训练阶段,人类标注者的判断、研究人员的品味、团队的价值取向,都会以某种方式渗透进模型的行为模式里。
你和什么样的人一起训练模型,模型就会带着什么样的底色。
这也是为什么她说,后训练是艺术而非工程。
工程可以外包,艺术不行。
最后她说了什么
文章结尾,她想把接下来的时间,花在那些还没有人涉足的难题上:教AI同理心、讲故事的能力、创造性判断力,让AI系统真正对齐人类在乎的东西,以及构思人类和AI以全新方式互动的产品形态。
© 2026
·
向阳乔木
一个25岁的AI研究员,在OpenAI学到了什么 · 乔木博客
📌 文中提及的人物和组织
人物: Karina Nguyen
产品/模型: Claude, ChatGPT, Mesh, InterAlia, SimpleQA, PostTrainBench