导入:主动协作的AI智能体
大飞: 大家好,这里是最佳拍档,我是大飞。不知道大家有没有过这样的体验,在Slack或者钉钉里@了一下AI助手,等它回完一句话,会话就结束了,下次有事还得重新@它。它根本不记得你们之前聊过什么,更不知道你团队里其他人在做什么。但是如果我告诉你,现在你给它下一个指令,它可以自己去开沙盒、跑代码、做验证、提PR请求,几个小时之后主动回来找你汇报结果,而且它同时在跟你整个团队的人协作,知道每一个频道里在讨论什么,理解你们团队工作的全貌,你会不会觉得有些神奇呢?
今年7月7号,Anthropic应用AI团队的研发人员拉米斯·穆克塔(Lamis Mukta)做客了AI Native Dev播客,详细拆解了他们刚刚发布的团队协作型AI智能体产品Claude Tag。这次访谈除了聊到了产品本身的细节,还聊到了Claude Code在企业内外部的落地实践、AI智能体自主运行时长的指数级增长趋势,以及Dreaming的记忆优化机制。今天这期视频,我们就顺着这次访谈的脉络,给大家梳理一下这些信息。
拉米斯所在的Anthropic应用AI团队,这个团队的定位其实有点特殊,它是产品、研究和商业化推广之间的纽带,既要直接对接客户,也要跟内部的产品和研究部门配合推进项目。拉米斯对Claude Tag的定义非常直接,说这是你积极主动的协作伙伴,目前直接集成在Slack工作区里。它不仅包含了你在Claude Code里习惯的所有连接器、工具和上下文,关键是它具备了更高程度的主动性和持久性,可以长时间独立推进工作任务,而且能够同时跟你和你的团队成员协同配合。
Claude Tag与传统@Claude的区别
主持人: Slack里面本来就有@Claude的功能,这跟Claude Tag到底有什么区别呢?
拉米斯: 表面上看这俩确实很像,都是在Slack里跟Claude对话,但是底层的机制差异非常大。我特意强调三点:
第一是主动性。Claude Tag可以长时间执行工作流,任务完成的时候主动反馈结果,可以说是真正把目前AI智能体长时间自主执行任务的能力发挥了出来。你平时在Slack里@Claude,基本上是你问一句它答一句,你不触发它,它就安静地待在那里,但Claude Tag不一样,它有时候会主动找你,提醒你有事项需要处理。
第二点是记忆和上下文范围。Claude Tag拥有跨频道的记忆和上下文管理能力,它同时在跟你所有的团队成员沟通,而且这种理解是随着时间推移不断积累的,所以它能理解整个团队的工作全貌。
第三点,它打破了单次会话和独立交互的限制,不再是一次对话结束之后,上下文就清零。
跨频道记忆与端到端工作流
主持人: 团队通常先在Slack里讨论需求或者Bug,关联Linear提工单,再召唤Claude实现,最后提交PR提示审查。Claude Tag是不是不仅知道Slack内的历史互动,还知道更多呢?
拉米斯: 是的,我们为Claude Tag设计了一套基于频道级别隔离的完整权限系统。如果某个频道专门讨论功能需求,它就会积累大量历史需求和处理流程的上下文,端到端跟进。配置得当的话,它还能搜索其他的公开频道,比如客服频道里有更多Bug源头的上下文,只要授予相应的权限,Claude Tag就能访问这些你原本可能根本看不到的信息,并且呈现给你。
更核心的区别在于工作流的执行方式。以前你处理完Linear工单,可能要打开Claude Code去指挥它执行任务,但是现在整个端到端工作流可以完全在Slack一个消息线程里完成。假设收到一条反馈,Claude Tag可以率先捕捉到,自动@应该参与处理的人,然后自动在Linear中创建工单。最关键的一点是,你不再需要打开Claude Code,它能自行理解接下来需要进行代码开发,自己启动沙盒,在获得权限的情况下在代码库里运行代码,进行代码验证,确保功能满足工单需求,等到PR请求准备就绪时再通知你。你可以选择让它自动运行整个流程,也可以在执行代码前设置人工审批节点。
拉米斯还特别提到了跨部门协同的能力,这是以前仅仅依靠Claude Code或者Cowork很难实现的。比如一个客服工单生成的时候,可能需要@负责该客户的主管让他们了解进展,当Tag带着方案反馈回来时,可以拉入工程师或产品经理对产品实现进行评估,之后需要代码审查和部署上线时,再让工程师介入。这种多人协作的能力,正是效果呈指数级放大的地方。
从单人IDE到Slack异步协作
主持人: 当工作流从IDE或者独立会话逐渐转移到Slack聊天环境时,这种工作流发生了怎样的改变呢?
拉米斯: 我们产品工程团队有65%的PR请求是由Claude Tag创建的,现在Claude Tag已经成为了启动工作流的首选入口。
用Claude Code开发的时候,整个体验非常偏向单人独立模式。你通常要在本地运行代码,进入Claude Code实例,开启一个个独立的会话,在会话中陈述目标,管理上下文,然后运行结果或者循环。但有了Claude Tag之后,界限开始变得模糊,不再局限于会话和单人模式。当你用Claude Tag启动AI智能体的编程流程时,你会发现它从一开始就是多人协作的。Tag可以主动向流程中需要参与的人征求意见,作为开发者,你不再需要亲自去找产品或销售人员沟通,可以让这一切直接融入核心的Tag工作流中。最终所有这些工作都是公开透明的,相关人员从一开始就能清楚看到工作流的进展,确切知道工程师正在提供什么样的产品规格,可以随时补充背景信息,Claude Tag也会把相关信息推送给他们。
另一个显著差异是异步性。Claude Tag的异步性远强于Claude Code。如果你希望密切监控AI智能体的每一个操作回合,了解它的确切操作、需要的跟进事项以及进度更新,Claude Code会非常出色;但是在Claude Tag这里,更多看到的是长期运行的异步任务模式。当你给Claude Tag发送指令后,它可能在几个小时后,带着完整构建好的功能回来找你。你可以放心地把任务交给它,完成后它会主动通知你。这和Claude Code’的体验截然不同,虽然它受到了Claude Code中一些功能的启发,但是确实代表了工作方式的根本改变。
AI自主运行时长的指数级增长
主持人: 从终端IDE到聊天环境的迁移,是不是意味着人类对AI决策可靠性的信任在不断提升呢?Slack和聊天环境真的会成为新的IDE吗?
拉米斯: 我不认为两者是完全相互替代的关系,各有各的定位和用途。但是,我非常认同交互方式正在发生转变这个趋势。这里我提到一个研究:来自METR的研究图表清晰显示,AI智能体能够自主运行的时间,大约每四个月就会翻一番。
主持人: 这种现象究竟是模型本身能力的提升,还是也包含了人类干预因素呢?
拉米斯: METR的研究涵盖了多个不同领域和时间跨度。AI智能体能够成功完成特定时长任务的能力,只是衡量其水平的一个通用指标,虽然并不完美,但是它真实反映了与这些模型交互时的直观感受。它们能执行任务的时间越长,通常意味着在处理更复杂的工作,能执行多步骤任务,在不同阶段验证自身工作成果,最终成功交付。这种指数级增长已经持续了近十年,每当你觉得它无法持续时,它总能打破常规。
随着时间推移,许多以前需要在Harness中处理的行为,现在正在被嵌入模型内部。模型在验证自身工作方面表现得越来越好,在汇报任务完成前会自我检查,无论是前端测试、运行测试还是创建自身评估,表现都越来越出色。
当今开发领域的另一个趋势是,开发者的行为正在转变,更多取决于能否在特定场景下清晰定义成功的标准。这不仅适用于编程,几乎适用于所有领域。你是否对理想的结果有清晰的认知?如果有,把它交给模型,它可以循环执行,或者让另一个AI智能体审查工作,直到审查者认为任务圆满完成。在AI智能体和模型端,它们越来越擅长执行任务;而在人类端,我们的行为正在向能否清晰定义好结果转变。至于Slack是否会成为新的IDE,我认为它提供了一个平台,让AI智能体更靠近你日常工作的地方,需要更多上下文或者想委派任务时,只需将AI智能体拉入对话即可,无需在与AI协作和与团队协作之间频繁地切换上下文。
Claude Code与团队的成熟度
主持人: 从AI智能体编程和开发角度看,目前行业在使用Claude Code方面处于什么成熟度阶段呢?
拉米斯: 我们看到了各种形式和规模的应用。个人层面,人们能更快、更高质量地完成独立任务;扩展到团队和整个组织时,则看到了一些相当惊人的成果。比如Stripe完成了整个代码库的重写,原本需要几周甚至几个月的时间,现在只需几天或几个小时。当真正大规模部署这些工具,并让每个人都参与进来时,就能达到这样的规模效应。那些过去因资源短缺被搁置几个月或者几年的宏大项目,现在终于变得可行了。
产品方面也出现了一个现象,团队基本上能够对某些想法进行多种原型设计,通过AI智能体在内部进行大量测试,然后全力投入效果最好的那一个。这让产品开发方式有了更多实验空间,也带来了更多的勇气和胆识。
主持人: 像Claude这样的工具大大降低了快速构建的成本,人类是否已经成了适应速度最慢的一环,人们还能跟上交付的节奏吗?
拉米斯: 我最近在欧洲几个城市巡回交流,我喜欢问在场所有人一个问题:谁有错失恐惧症,觉得自己日常对AI的使用还不够?结果往往是全场举手,Anthropic的员工也是如此。连安德烈·卡帕西(Andrej Karpathy)都说过类似的话:事物发展的规模和速度,已经超出了单个人的认知和跟进能力,有时她自己都会发现一些不知道已经具备的功能。
但是她同时提醒,还有一个更难回答的问题,就是这一切在多大程度上会转化为实际的客户价值。我们可以拥有所有这些原始智能,但是有将它转化为实际价值的基础设施吗?这涵盖了Harness如何管理上下文和记忆、如何管理工具、安全性和权限管理,以及如何托管部署模型。尽管有很多耀眼的创新,但是这些基础设施和安全问题,才是每个人都应该高度关注的焦点。纸面上的价值就在那里,但要确保人们真正的感受到,需要付出更多的艰苦努力。
Claude Code与Tag的诞生历程
主持人: 那么这两个产品最初是如何诞生的?
拉米斯: Claude Code很大程度上是鲍里斯(Boris)业余时间做的一个副业项目。Anthropic有一种非常强烈的实验文化,大家总喜欢构建自己的工具。一开始Boris在Slack上分享这个项目时,大概只收到了六个回复,这说明当时并没有一套绝对完美的流程来判断什么才是好产品。但是有几个人看到后非常兴奋并继续参与,很短时间内就有大约一半的员工每周在使用它。
这里有一个很重要的产品原则是:当模型能力进一步提升,使得AI智能体能够真正执行长时间编程任务时,产品的采用率才迎来了真正的爆发。早期版本的自主性弱得多,更像是分块返回代码,后期才真正开始能访问各类工具,高效处理整个代码库,掌控大量上下文并且保持目标导向。所以,要为模型未来的能力构建产品,而不是为今天的能力构建,因为这些技术发展得太快了。
当Anthropic决定广泛发布Claude Code时,内部已经有一半人每周在使用,这种内部产品市场契合度让发布成为了一件水到渠成的事。Claude Tag走的是同样路径,发布之前65%的代码PR请求都是由它提交的。
我还可以讲一个很有意思的例子,营销团队有一名成员,一天开始时还在谷歌搜索“什么是终端以及如何使用”,到一天结束时,他已经将一个原本需要30分钟的工作流,自动化为只需30秒就能完成。非编程领域的验证和上下文问题确实更难解决,它们没有整洁的文件系统、GitHub版本控制和单元测试这类基础设施,所以必须更具创造力。但是方向是明确的:人们正在改变创建和存储数据的方式,以便AI智能体更容易访问。
Anthropic有一种非常强大的文化,就是在Slack公共频道公开工作。之所以刻意这样做,是因为AI智能体可以用任何人都不可能具备的全局视野,将所有信息连接起来。我自己在公开频道与Claude Tag交流的程度,几乎达到了用它处理所有工作的地步,除非涉及高度机密的内容。
企业级安全、权限与AI独立身份
主持人: 这种公开透明的模式在企业落地时会遇到安全挑战吗?
拉米斯: 确实,内部反馈非常重要,但是AI智能体时代的产品开发还有一个特殊挑战,有些功能作为单人体验感觉非常棒,但是扩展到企业级应用时,面临的问题形态会截然不同。
Anthropic内部非常乐于共享信息,也有严格的安全防护机制。Slack工作区在权限管理方面有完善机制,在这些确信安全可信的信息共享空间内,人们可以非常开放,这也是AI智能体能表现出色的原因。设计Claude Tag时的一个原则就是精心设计每个频道的权限分配。每个频道和工作区都有各自的权限范围,包括可以访问哪些工具、对不同服务拥有什么API密钥、允许访问哪些其他频道。之所以这样做,是因为我们一方面希望分享公开工作这样的协作文化实践,另一方面必须确保产品内置安全防护机制,用真正可扩展至企业级的方式来实现这种工作模式。
为此,Anthropic还引入了一个非常关键的设计概念,叫做AI智能体身份。Claude Tag与Claude Code或Cowork的最大区别在于:使用Code或Cowork时,它们会继承你个人的权限,使用你的API密钥或者权限系统来操作,由你来授予访问权;而使用Claude Tag时,实际上赋予了这个AI智能体独立的权限和专属密钥,让它能够自主执行任务。它不再代表个人,而是代表团队运作。这让审计工作变得容易得多,因为它不是以你的身份,而是以自己的身份在执行任务。这是为实现多人协作模式做出的关键架构调整。
大道至简的记忆系统与Harness
主持人: 在这期间你们积累了哪些教训?
拉米斯: 我们有两个深刻的教训。在开发方面,每当推出新模型时,都要探讨模型在哪些维度变得更强大,定期重新审视Harness应该是什么样。团队很乐意随着时间推移从Harness中删减内容,让它变得更简单和轻量,直接让模型承担核心工作。渐渐地,Harness确实变得更精简了,因为在某些能力上可以更信任模型。新模型并不意味着要盲目堆砌更多的提示词和更复杂的架构,有时候大道至简。
另一个教训来自于记忆系统。很多初创公司会专门询问记忆与上下文基础设施的问题,这方面没有放之四海而皆准的解决方案。我们在Managed Agents API中的解决方案,是一个非常简单的记忆文件系统,仅仅依靠AI智能体读写记忆的能力。过去我们尝试了很多的复杂方案,比如索引记忆存储或者专门读写记忆的工具,但是随着时间推移发现,预设太多的限制反而会带来问题,其实最好别去干预。AI智能体非常擅长直接使用文件系统以及bash和grep工具。所以,我的建议是可以直接移除一些抽象层,放下对记忆结构设定的固有偏好,构建索引并不总是要按照最佳实践,有时候一个简单的文件系统反而更好。
非工程用例与主动性调节
主持人: 听说Anthropic内部有很多非工程用例?
拉米斯: 方式太多了,可以说整个公司都依托Claude运行。过去一年里,全公司各团队放心交由Claude处理的工作量翻了一番,依赖程度从30%上升到了60%。
营销团队建立了广告和文案生成流水线;大量事件响应基础设施,某种程度上也依赖Claude对事件进行优先级排序,并且拉入合适人员,在力所能及范围内还能开始诊断代码问题。针对销售团队的周报机制,Claude会汇总每个人当周工作,提供数据统计和仪表盘更新,让大家做好开会准备,没人需要辛苦做幻灯片了,这是基于日程表运行的任务,能节省大量时间。
还有更具响应性的场景,比如事件响应,Claude知道何时介入,也知道该表现出多强的主动性。他在开发产品时,会通过接口把反馈输入原型,然后让Claude Code在后台处理,相当于每个人都在打造属于自己的工具。
我们还特意提到了主动性调节这个设计维度,这是构思Tag时融入的一个重要思考。主动性是可以灵活调节的:你可以设置让Claude仅在被@时回应,或者让它建立时间表执行任务,又或者当它认为有相关上下文需要分享时,主动加入讨论。最糟糕的体验就是,有一个总是带着冗长上下文来回应每句话的机器人。所以他们将主动性视为一个渐变范围,在实践中不断地微调,判断什么是合适的、何时应该介入、何时应该保持沉默、何时应该按程序设定执行任务。如果Claude做出了不符合偏好的行为,只需要告诉它,它就会更新记忆,让未来更贴近预期。
自动化故障响应:凌晨三点的PR
主持人: 事件响应的具体工作模式是怎样的?
拉米斯: 事件响应AI智能体是我们认为极其行之有效的一个模式。作为曾经需要值班的工程师,她深知凌晨三点听到PagerDuty报警电话的恐惧感。想让AI智能体胜任这项工作,首先需要赋予它访问各种数据源的权限,比如数据仓库、日志、指标甚至代码仓库,这样它们才能开始诊断问题。但另一个重要考量是门关卡设置在哪里,这完全取决于团队决定。大规模部署需要经历建立信任的过程。刚开始也许只是让Claude试一试,同时保留传统流程,随着时间推移变得更加自信,将越来越多的工作委托给它。也许最开始只是将诊断修复方案转交给工程团队,只有问题极其严重时才唤醒工程师;再进一步可能可以提交草稿PR,直到放开你想要的任何权限关卡。
主持人: 以前总说我睡觉时AI在工作,现在即将变成我睡觉时AI在修复生产环境的问题。
拉米斯: 确实。拉米斯回应说,她宁愿被这样一个电话叫醒,告诉她出现了一个故障,这是修复它的PR,这是验证过修复有效的测试,这是故障影响范围。比起只说请你来看看这个故障的AI,她更愿意看到前者,更乐意在凌晨三点批准那个PR。
Dreaming:AI智能体的睡眠与持续学习
主持人: 刚才提到了Dreaming,能详细介绍一下吗?
拉米斯: Dreaming是Managed Agents服务上的一项研究预览功能,这款产品本质上能让你在生产环境中,更迅速地构建和部署AI智能体。Anthropic承担了Harness管理、基础设施和可观测性等繁杂工作,将积累的经验教训转化为AI智能体、环境和会话等具体原语,让用户能快速的组合部署。
由于上下文在AI智能体开发中是如此的重要,所以缺少记忆功能是不完整的。记忆功能让AI智能体能读写不同的记忆库,权限控制极其严格。比如组织级别的上下文只能读取,暂存区允许存放与当前工作相关的上下文。但是系统长时间运行后,内部积攒陈旧信息的风险会增加,部分内容可能过时、缺失甚至混乱。
Dreaming的运作方式顾名思义:你可以按喜欢的频率运行这些任务,输入记忆库数据和会话记录(也就是AI智能体执行任务的轨迹),把这些交给另一个AI智能体去审查,寻找偏差。它可能会发现缺失的、误导性的信息,或者找到新的信息重组方式,使AI智能体更容易检索调用。它会提供附带证据的修改建议,由你来决定实施哪些更改。拉米斯认为关键在于,它开启了持续学习之路。今天运行了AI智能体,明天就能基于优化点再次运行,真切地看到能力提升。
总结与展望
大飞: 访谈接近尾声时,拉米斯鼓励听众去配置和体验Claude Tag,只需要让Slack管理员开启功能,做些基础配置即可。
她分享了自己设置的第一个功能:每日简报。得益于Tag能访问的连接器和上下文,它能告诉她过去24小时内发生的事情,尤其是针对跨国团队的协作,比如旧金山团队做了什么,一觉醒来不必面对满屏邮件和Slack消息,只需要阅读一份精炼的简报。它还能掌握当前工作流的上下文,能提醒她正在处理的事情,比如准备演讲前需要先复习的相关文档。另一个功能是让Tag知道哪些频道对她重要,实时提醒紧急事务。还有团队层面的Tag会制作周报,汇总团队本周学到的新事物,鼓励大家持续分享上下文。这些都是很好的实践切入点。
进阶玩法是让Tag编写自定义软件,部署到Claude Code Artifacts中,当作个人仪表盘或团队小工具。拉米斯个人很喜欢的一个用法是,让AI智能体告诉她这周哪里做得好,让它列出三个小成就,再给几个优化建议。她还会把年度总结发给它,输入年度反馈和管理层期望,获得改进建议。说到这里拉米斯开了个小玩笑,说她现在唯一需要的,就是一个能替她打工的AI智能体,然后就可以完全放手去享受阳光了。
这期访谈听下来,我最大的感受是,我们正在见证AI工具从被召唤的助手,向主动协作的团队成员的身份转变。以前我们用AI,本质上还是人在驱动每一步,但是当一个AI智能体能拥有独立身份、跨频道记忆和长时间自主执行,知道主动找人汇报,甚至在你睡觉的时候自己修复生产环境问题,人机协作的边界确实在发生根本性的变化。
拉米斯反复提到一个词是信任,这种信任不是凭空建立的,而是随着模型自主运行时长,每四个月翻一番这样的能力曲线逐步建立起来的。对开发者和团队管理者来说,现在可能需要思考的是,你的团队工作流中,有哪些环节是可以清晰定义成功标准的,这些环节或许就是AI智能体最先介入的地方。
那么大家是怎么看AI智能体深度融入到团队协作这件事的呢?如果你的Slack或者钉钉里有这样一个能主动干活、主动汇报的AI同事,你最想把什么工作交给它呢?欢迎在评论区留言讨论。感谢收看,我们下期再见!
📌 文中提及的人物和组织
公司/组织: Anthropic
产品/模型: Claude Tag, Claude Code