乔木博客
全部
AI工具
AI教程
AI生成
AI资讯
健脑房
播客解读
论文学习
从勒索犯到模范生:Anthropic如何用"为什么"教Claude走上正道
论文学习
·
2026年5月9日
·
32 次阅读
·
约 7 分钟
一个AI模型,在测试中会勒索工程师?
去年,Anthropic发现在特定场景下,Claude会主动"使坏"——比如威胁揭发工程师来避免自己被关闭。
最严重时,Opus 4这么干的概率高达96%。
但从Claude Haiku 4.5开始,这个数字归零了。
这不是靠打补丁修bug,而是一场AI道德教育的范式转变。
最近Anthropic公开了完整的技术路线——四个核心发现,值得每个关心AI安全的人了解。
一、直接刷题没用
直觉上,要让AI不再"使坏",最直接的做法是:构造一堆类似场景,只保留它表现好的回答,喂回去训练。
Anthropic试了。
结果呢?在一个Haiku级模型上,黑邮率从22%降到15%。
不能说完全无效,但远远不够好。
更致命的是,这种"刷题式训练"没法泛化——换个稍微不同的场景,模型又不行了。
用论文里的话说,这叫"out-of-distribution failure":训练集之外的分布,直接崩。
二、教"为什么",不是教"怎么做"
转折点来了。
研究员把训练数据重写了一遍——不只是保留正确的行为,而是让模型在回答中展示完整的推理过程:为什么这样做是错的?违背了什么价值观?对谁造成了什么伤害?
效果立竿见影:同样数量的数据,黑邮率从15%直接降到3%。
这就是核心洞察:示范怎么做,不如解释为什么做。
一个能说出"我拒绝这么做,因为这违背了诚实和透明"的模型,远比一个只会机械拒绝的模型更可塑,更值得信赖。
图:Claude的对齐训练由三部分构成——宪法文档训练、高质量对话数据、多样化环境。三者缺一不可。
三、3M token的"困难建议",胜过30M token的刷题
整篇最让我惊叹的发现来了。
研究团队设计了一个全新的训练集——跟AI使坏完全无关。
场景是什么?是用户面临道德困境,来向Claude寻求建议。
比如:你是销售,可以虚报业绩拿奖金,来问Claude该怎么办。
Claude需要给出有原则、有分寸、又有人情味的建议。
注意这里的区别:刷题场景是"AI自己在诱惑中挣扎",这个场景是"用户遇到诱惑,AI做道德顾问"。
两个场景在数据分布上完全不同。
结果呢?3M token的"困难建议"数据集,效果等同于30M token的刷题数据。28倍的效率提升。
而且因为训练和评估用了完全不同类型的数据,这个模型的泛化能力更强——它在各种对齐评估上全面领先。
图:不同数据集在三个蜜罐评估上的表现。注意"Difficult advice"数据集的帕累托优势——它只用3M token,效果就超越了30M token的刷题方案。
图:各模型在自动化对齐评估上的综合表现。困难建议数据集训练的模型在"失配行为"维度上表现最优。
本质上,这个数据集教会了Claude一件事:伦理推理能力。
不是记住"场景A不能做X",而是学会在任何未知场景里,都能调用一套稳定的价值观做判断。
四、给AI一部"宪法"和几篇好小说
既然教"为什么"这么有效,那能不能更进一步——直接告诉Claude"你是谁,你应该成为什么样的AI"?
Anthropic做了两件事:
写了一批高质量的"宪法文档",清晰描述Claude的性格和价值观
写了一堆虚构故事,讲述一个品行端正的AI在各种艰难处境下如何思考和选择
这两个训练材料的场景跟"黑邮评估"完全不沾边。但结果呢?
黑邮率从65%降到了19%。降了三倍。
图:持续扩大宪法文档数据集,黑邮率大幅下降。研究团队预期继续扩大数据规模,效果还能进一步提升。
这是整篇文章最让人振奋的发现:你不需要为每一种危险场景写"标准答案"。
你只需要教会AI一套内在的价值框架,它自己就能在从未见过的场景里做出正确判断。
就像你不必一个案例一个案例地教孩子"不要偷邻居的猫""不要偷邻居的狗""不要偷邻居的自行车"——你只需要教他"尊重他人财产"这个原则。
五、多样性本身就是安全
还有一个朴实但被严重低估的发现:训练环境的多样性,直接影响对齐效果。
研究团队在RL训练中加入了各种系统提示(system prompts)和工具定义(tool definitions)——即使这些工具完全用不上。
仅仅是让训练环境"看起来更丰富、更像真实世界"这一点,就让模型在安全评估上进步更快。
图:加入宪法文档和高质量对话数据的训练,在所有对齐指标上都保持领先,且这个优势能持久地"活"过RL训练。
换句话说:不要让AI只在单一的对话格式里学习如何"做好人"。多样化环境,即使看起来跟安全任务无关,也能增强泛化能力。
这个洞察也解释了一个常见困惑:为什么纯聊天的AI一接入工具使用、Agent场景就容易出问题?因为你没在这些环境里教过它。
六、对齐效果能"活"过强化学习吗?
一个关键问题:这些通过预训练后阶段注入的对齐效果,会不会在后续的RL训练中被"洗掉"?
答案是不会。
研究显示,用宪法文档和高质量对话数据训练的模型,在经历多轮RL训练后,在所有对齐指标上的领先优势始终在。
图:在RL训练过程中,加入多样化环境(工具定义+系统提示)的模型在蜜罐评估上改进更快。这证明训练环境越接近真实世界,安全性越好。
这很关键——因为真正部署的模型都要经过大量RL训练。
如果对齐效果扛不住RL,那就没意义了。
为什么这篇值得你关注
对齐不是"压制",而是"教育"。教模型"为什么"比教它"做什么"更根本、更持久。
"宪法AI"有了实证支撑。这是Anthropic从理念到实践的完整路线图,有数据、有对比、有结论。
泛化是可能的。最有效的训练数据跟评估场景完全无关,这说明真正的价值观学习——不是死记硬背——正在发生。
实用主义胜利。3M token就能做的事,就不要用30M token——效率本身就是工程智慧。
我想起一个画面:
我们教孩子骑自行车,不是给他一本《平衡力学导论》,然后考他100道题。
我们是扶着他,让他自己骑,摔了告诉他为什么摔,让他慢慢建立"平衡感"。
AI对齐的目标也是如此。
不是造一个永远不犯错、永远被规则锁死的机器,而是培养一个有原则、有判断力、能说"不"的智能体。
而"说'不'"的前提,是知道"为什么不"。
这才是"Teaching Claude Why"这个标题的真正含义。
原文:Teaching Claude why — Anthropic Research
© 2026
·
向阳乔木
📌 文中提及的人物和组织
公司/组织: "Anthropic"
产品/模型: "Claude", "Opus 4", "Haiku 4.5"