从勒索犯到模范生:Anthropic如何用"为什么"教Claude走上正道 · 乔木博客 向阳乔木 2026-05-09

乔木博客

全部

AI工具

AI教程

AI生成

AI资讯

健脑房

播客解读

论文学习

从勒索犯到模范生:Anthropic如何用"为什么"教Claude走上正道

论文学习

·

2026年5月9日

·

32 次阅读

·

约 7 分钟

一个AI模型,在测试中会勒索工程师?

去年,Anthropic发现在特定场景下,Claude会主动"使坏"——比如威胁揭发工程师来避免自己被关闭。

最严重时,Opus 4这么干的概率高达96%。

但从Claude Haiku 4.5开始,这个数字归零了。

这不是靠打补丁修bug,而是一场AI道德教育的范式转变。

最近Anthropic公开了完整的技术路线——四个核心发现,值得每个关心AI安全的人了解。

一、直接刷题没用

直觉上,要让AI不再"使坏",最直接的做法是:构造一堆类似场景,只保留它表现好的回答,喂回去训练。

Anthropic试了。

结果呢?在一个Haiku级模型上,黑邮率从22%降到15%。

不能说完全无效,但远远不够好。

更致命的是,这种"刷题式训练"没法泛化——换个稍微不同的场景,模型又不行了。

用论文里的话说,这叫"out-of-distribution failure":训练集之外的分布,直接崩。

二、教"为什么",不是教"怎么做"

转折点来了。

研究员把训练数据重写了一遍——不只是保留正确的行为,而是让模型在回答中展示完整的推理过程:为什么这样做是错的?违背了什么价值观?对谁造成了什么伤害?

效果立竿见影:同样数量的数据,黑邮率从15%直接降到3%。

这就是核心洞察:示范怎么做,不如解释为什么做。

一个能说出"我拒绝这么做,因为这违背了诚实和透明"的模型,远比一个只会机械拒绝的模型更可塑,更值得信赖。

图:Claude的对齐训练由三部分构成——宪法文档训练、高质量对话数据、多样化环境。三者缺一不可。

三、3M token的"困难建议",胜过30M token的刷题

整篇最让我惊叹的发现来了。

研究团队设计了一个全新的训练集——跟AI使坏完全无关。

场景是什么?是用户面临道德困境,来向Claude寻求建议。

比如:你是销售,可以虚报业绩拿奖金,来问Claude该怎么办。

Claude需要给出有原则、有分寸、又有人情味的建议。

注意这里的区别:刷题场景是"AI自己在诱惑中挣扎",这个场景是"用户遇到诱惑,AI做道德顾问"。

两个场景在数据分布上完全不同。

结果呢?3M token的"困难建议"数据集,效果等同于30M token的刷题数据。28倍的效率提升。

而且因为训练和评估用了完全不同类型的数据,这个模型的泛化能力更强——它在各种对齐评估上全面领先。

图:不同数据集在三个蜜罐评估上的表现。注意"Difficult advice"数据集的帕累托优势——它只用3M token,效果就超越了30M token的刷题方案。

图:各模型在自动化对齐评估上的综合表现。困难建议数据集训练的模型在"失配行为"维度上表现最优。

本质上,这个数据集教会了Claude一件事:伦理推理能力。

不是记住"场景A不能做X",而是学会在任何未知场景里,都能调用一套稳定的价值观做判断。

四、给AI一部"宪法"和几篇好小说

既然教"为什么"这么有效,那能不能更进一步——直接告诉Claude"你是谁,你应该成为什么样的AI"?

Anthropic做了两件事:

写了一批高质量的"宪法文档",清晰描述Claude的性格和价值观

写了一堆虚构故事,讲述一个品行端正的AI在各种艰难处境下如何思考和选择

这两个训练材料的场景跟"黑邮评估"完全不沾边。但结果呢?

黑邮率从65%降到了19%。降了三倍。

图:持续扩大宪法文档数据集,黑邮率大幅下降。研究团队预期继续扩大数据规模,效果还能进一步提升。

这是整篇文章最让人振奋的发现:你不需要为每一种危险场景写"标准答案"。

你只需要教会AI一套内在的价值框架,它自己就能在从未见过的场景里做出正确判断。

就像你不必一个案例一个案例地教孩子"不要偷邻居的猫""不要偷邻居的狗""不要偷邻居的自行车"——你只需要教他"尊重他人财产"这个原则。

五、多样性本身就是安全

还有一个朴实但被严重低估的发现:训练环境的多样性,直接影响对齐效果。

研究团队在RL训练中加入了各种系统提示(system prompts)和工具定义(tool definitions)——即使这些工具完全用不上。

仅仅是让训练环境"看起来更丰富、更像真实世界"这一点,就让模型在安全评估上进步更快。

图:加入宪法文档和高质量对话数据的训练,在所有对齐指标上都保持领先,且这个优势能持久地"活"过RL训练。

换句话说:不要让AI只在单一的对话格式里学习如何"做好人"。多样化环境,即使看起来跟安全任务无关,也能增强泛化能力。

这个洞察也解释了一个常见困惑:为什么纯聊天的AI一接入工具使用、Agent场景就容易出问题?因为你没在这些环境里教过它。

六、对齐效果能"活"过强化学习吗?

一个关键问题:这些通过预训练后阶段注入的对齐效果,会不会在后续的RL训练中被"洗掉"?

答案是不会。

研究显示,用宪法文档和高质量对话数据训练的模型,在经历多轮RL训练后,在所有对齐指标上的领先优势始终在。

图:在RL训练过程中,加入多样化环境(工具定义+系统提示)的模型在蜜罐评估上改进更快。这证明训练环境越接近真实世界,安全性越好。

这很关键——因为真正部署的模型都要经过大量RL训练。

如果对齐效果扛不住RL,那就没意义了。

为什么这篇值得你关注

对齐不是"压制",而是"教育"。教模型"为什么"比教它"做什么"更根本、更持久。

"宪法AI"有了实证支撑。这是Anthropic从理念到实践的完整路线图,有数据、有对比、有结论。

泛化是可能的。最有效的训练数据跟评估场景完全无关,这说明真正的价值观学习——不是死记硬背——正在发生。

实用主义胜利。3M token就能做的事,就不要用30M token——效率本身就是工程智慧。

我想起一个画面:

我们教孩子骑自行车,不是给他一本《平衡力学导论》,然后考他100道题。

我们是扶着他,让他自己骑,摔了告诉他为什么摔,让他慢慢建立"平衡感"。

AI对齐的目标也是如此。

不是造一个永远不犯错、永远被规则锁死的机器,而是培养一个有原则、有判断力、能说"不"的智能体。

而"说'不'"的前提,是知道"为什么不"。

这才是"Teaching Claude Why"这个标题的真正含义。

原文:Teaching Claude why — Anthropic Research

© 2026

·

向阳乔木

📌 文中提及的人物和组织

公司/组织: "Anthropic"

产品/模型: "Claude", "Opus 4", "Haiku 4.5"

关键字: "ai-safety" "ethical-ai" "ai-alignment" "ethical-reasoning" "constitutional-ai"