乔木博客
全部
AI工具
AI教程
AI生成
AI资讯
健脑房
播客解读
论文学习
Claude 托管智能体上新:梦境机制、成果评估与多智能体协作
AI资讯
·
2026年5月7日
·
3 次阅读
·
约 6 分钟
原文: New in Claude Managed Agents: dreaming, outcomes, and multiagent orchestration | Claude
Anthropic 今天发布了 Claude 托管智能体的一波重要更新。
其中最值得关注的是 梦境(Dreaming)功能,目前以研究预览的形式开放。
简单来说,梦境是记忆能力的升级版,它会回顾智能体过去的会话记录,从中找规律,帮智能体变得越来越聪明。
同时开放的还有 成果评估(Outcomes)、多智能体协作(Multiagent Orchestration)和 Webhooks。
这几个功能组合在一起,让智能体处理复杂任务时更靠谱,人工干预也更少了。
梦境:让智能体在"睡觉"时也在进步
梦境的工作方式很像人类的睡眠整理记忆。
它是一个定时运行的后台流程,会翻阅智能体的历史会话和记忆库,提炼出有价值的模式,再把记忆重新整理归档。
开发者可以选择让它全自动运行,也可以设成"先审后改"模式。
这个功能有意思的地方在于,它能看到单个智能体看不到的东西。
一个智能体埋头干活时,很难意识到自己反复犯同一个错误,也不知道隔壁的智能体早就找到了更好的工作流程。
梦境就像一个站在更高处的观察者,能发现这些跨会话、跨智能体的规律,比如反复出现的错误、团队成员共享的偏好、逐渐趋同的最佳实践。
更关键的是,它还会主动给记忆"瘦身"。
随着时间推移,智能体积累的记忆越来越多,信噪比会下降。
梦境会重新组织记忆结构,淘汰过时信息,确保留下来的都是高价值内容。
记忆和梦境其实是一套组合拳:记忆负责"工作时学习",梦境负责"下班后复盘"。
前者在实时会话中捕获经验,后者在会话间隙做跨智能体的知识提炼和更新。
这对长期运行的任务和多智能体场景特别有价值。
梦境功能已在 Claude 平台的托管智能体中上线,开发者可在此申请访问权限。
成果评估:给智能体一把"尺子"
过去让智能体干活,最头疼的问题之一是它不知道"好"长什么样。
成果评估解决的就是这个问题。
开发者可以写一份评分标准(rubric),明确描述什么算成功。
智能体完成任务后,一个独立的评分器会在自己的上下文窗口里对输出打分。
这里有个设计细节值得注意:评分器和执行智能体是完全隔离的。
评分器看不到智能体的推理过程,只看最终输出,这就避免了"自己给自己打高分"的问题。
如果评分不达标,评分器会精确指出哪里需要改,智能体再来一轮。
这个功能适用范围很广。
结构化的需求好说,比如"报告必须包含这五个章节"。
但成果评估真正厉害的地方是它也能处理主观质量判断,比如文案是否符合品牌调性,设计是否遵循视觉规范。
实测数据也很能说明问题:
相比标准提示循环,任务成功率最高提升了 10 个百分点,最难的任务提升幅度最大
docx 文件生成质量提升 +8.4%
pptx 文件生成质量提升 +10.1%
另外,现在还可以定义好成果目标后让智能体自己跑,完成时通过 Webhook 推送通知。
真正的"设定目标,然后放手"。
多智能体协作:一个人干不完,就组个团队
有些任务,单个智能体确实搞不定。
信息量太大,涉及的工具太多,或者需要不同的专业能力。
多智能体协作的思路很直接:让一个主导智能体当项目经理,把任务拆成子任务,分配给各个专业智能体去执行。
每个子智能体可以有自己独立的模型、提示词和工具集。
举个例子,排查一个线上故障时,主导智能体负责统筹全局,同时派出四个子智能体分别去翻部署历史、错误日志、监控指标和用户工单。
它们在共享文件系统上并行工作,各自的发现会汇总到主导智能体的上下文中。
因为所有事件都是持久化存储的,每个智能体都记得自己做过什么,所以主导智能体可以在流程中间随时和子智能体沟通协调。
在 Claude 控制台里,每一步操作都可以追溯:哪个智能体做了什么,按什么顺序,出于什么原因。
实际案例:团队们在用这些功能做什么
几个早期用户的案例很能说明这些功能的实际价值:
Harvey(法律 AI)用托管智能体协调复杂的法律工作,包括长文本起草和文档生成。
梦境功能让智能体在会话间保留了文件类型的变通方案和工具使用技巧。
测试中,任务完成率提升了约 6 倍。
Netflix 平台团队构建了一个分析智能体,处理来自不同来源的数百次构建日志。
当一个变更影响数千个应用时,关键不是列出所有问题,是找出跨应用反复出现的模式。
多智能体协作让它能并行分析批量数据,只呈现真正值得关注的问题。
Spiral(Every 旗下写作工具)的架构很有意思。
主导智能体跑在 Haiku 上,负责接收请求和简短追问;实际起草工作则委派给跑在 Opus 上的子智能体。
用户要多个草稿时,子智能体并行运作。
写作质量是 Spiral 的命脉,所以每篇草稿都要通过成果评估,按照 Every 的编辑原则和用户个人风格(从记忆中提取)打分,不达标的草稿直接不返回。
Wisedocs(文档处理)在托管智能体上搭建了文档质量审查流程,用成果评估按内部指南给每次审查打分。
审查速度提升了 50%,质量标准没有打折扣。
怎么开始用
目前的状态是这样的:
梦境:研究预览阶段,需要申请访问权限
成果评估、多智能体协作、记忆:公开测试阶段,托管智能体用户可直接使用
更多细节可以查阅官方文档,或者直接去 Claude 控制台动手试试。
© 2026
·
向阳乔木