乔木博客
全部
AI工具
AI教程
AI生成
AI资讯
健脑房
播客解读
论文学习
算力就是命脉:Anthropic CFO 谈计算资源、模型智能与企业增长
AI资讯
·
2026年5月18日
·
579 次阅读
·
约 12 分钟
今年第一季度,Anthropic 的年化营收从 90 亿美元涨到了 300 亿美元出头。
不是同比,是单季度内,翻了三倍多。
这个数字值得停下来想一想:是什么在驱动这种增长?背后的资源调度逻辑是什么?企业客户为什么愿意为更新的模型持续加码?
Anthropic CFO Krishna Rao 在一次深度对谈中,把这些问题从内部视角讲了个清楚。以下是核心内容的整理和解读。
算力不是成本,是画布
Krishna 用了一个比喻:算力是公司的"画布",其他所有东西都画在上面。
这不是修辞,是字面意思。
Anthropic 的算力同时服务三件事:训练新模型、加速内部研发、服务外部客户。
同一块芯片,早上跑推理,下午做强化学习,晚上切回训练。
这种灵活性不是天生的,是花了好几年时间刻意建出来的。
Anthropic 同时使用三套芯片平台:亚马逊的 Trainium、谷歌的 TPU、英伟达的 GPU。
要让它们互相可替换,需要从编译器层面往上全部自己做,还要和芯片厂商深度协作,直接影响芯片的研发路线图。
当年他们开始用 TPU 的时候,外界觉得这很奇怪,"大家都用 GPU,你们搞什么?"但正是这种多平台能力,让 Anthropic 在算力调度上拥有了别人没有的弹性。
Krishna 说,他现在仍然把 30% 到 40% 的时间花在算力相关的决策上。
"不确定性锥形":指数增长下的规划难题
买多了算力,公司会撑死;买少了,服务不了客户,也跟不上前沿。
这就是 Krishna 反复提到的"不确定性锥形":在指数增长的业务里,月度或周度增长率的微小差异,会在复利效应下产生天壤之别的结果。
往前看一两年,可能的结果范围极宽。
他承认,人类天生是线性思维,他自己加入公司两年,花了很长时间才把这个思维定势打破。
应对方法是:不做点估计,做情景规划。
同时把灵活性直接写进采购合同里,让算力可以在不同用途之间动态调配。
最近的动作可以印证这个逻辑:上个月,Anthropic 与谷歌和 Broadcom 签了 5 吉瓦的 TPU 协议(从 2027 年开始),同时与亚马逊签了另一个 5 吉瓦的 Trainium 协议,总承诺金额超过 1000 亿美元。
此外还宣布了与 SpaceX 在孟菲斯 Colossus 设施的合作,用于扩展消费者和专业用户侧的服务能力。
这是一层层叠加的算力蛋糕,不同时间点、不同能力的资源依次上线,持续比较性价比,动态分配用途。
效率提升不是副产品,是核心竞争力
很多人理解模型迭代,就像换车:从普通轿车换成跑车,性能更强,但油耗更高。
Krishna 说 Anthropic 的情况不是这样。
每一代新模型,不只是能力更强,处理 token 的效率也更高。
从 Opus 4 到 Opus 4.5、4.6、4.7,每一跳都有效率乘数。
这个乘数不只是让客户受益,也让内部研发受益,因为强化学习本质上是在沙盒里做推理,模型推理效率高了,RL 训练也更快。
这形成了一个正向循环:更好的模型让内部研发更快,更快的研发产出更好的模型,同时对外服务的成本也在下降。
Opus 系列降价就是这个逻辑的体现。
他们发现 Opus 级别的模型相对于其能力是被低估使用的,很多人明明有 Opus 级别的需求,却硬塞进 Sonnet 的预算里。
降价之后,消费量的增长远超预期,这正是 Jevons (杰文斯)悖论的教科书案例:价格下降,需求爆发,总收入反而上升。
前沿智能的回报,在企业端尤其高
"用六个月前的旧模型就够了",这个论断在实际中被反复证伪。
Krishna 的解释是:模型智能不是一个 IQ 分数,是多维度的。
新一代模型带来的不只是"更聪明",还有长任务处理能力、工具调用能力、智能体任务的执行速度。
他用了一个类比:两个能力相当的员工,一个做一周,一个做一天,后者的产出效率是前者的七倍。
速度本身就是能力的一部分。
更重要的是,每一代新模型都会解锁新的市场空间。
原来做不了的用例,现在能做了;原来只是试点的客户,现在开始大规模部署。
Anthropic 现在服务财富 10 强中的 9 家,净收入留存率超过 500%。
这两个数字放在一起,说明客户不只是在续约,是在持续加码。
Krishna 提到,对谈前 20 分钟的车程里,他在手机上签了两笔金额超千万美元的合同。
90% 的代码由 Claude 写,包括 Claude 自己
目前 Anthropic 内部超过 90% 的代码由 Claude Code 完成,而 Claude Code 本身的代码也大量由 Claude 写。
模型在帮助构建下一代模型。
这也是为什么他们愿意把一部分本可以用来服务客户的算力留给内部使用,因为这些内部工作负载在加速研发,而研发的加速最终会体现在更好的模型上,进而体现在更大的市场空间上。
他们的财务团队也在用同样的逻辑工作。
70 多个 Claude 技能组成的技能库,自动生成月度财务报告,准确率达到 90% 到 95%。
团队的讨论不再是"这个数字对不对",而是"这说明什么,我们该怎么做"。
以前要花几小时的周报,现在 30 分钟出来。
有意思的是,财务团队里 token 使用量最高的,不是刚入职的年轻人,而是税务主管,他在用 Claude 构建税务政策引擎,把大量重复性工作自动化。
Mythos:第一个让人感到不安的模型
今年发布的 Mythos 是 Anthropic 第一次以分阶段方式发布模型,而不是直接公开上线。
原因是:这个模型在网络安全能力上出现了明显的"尖刺"。
同一个开源代码库,之前的模型发现了 22 个安全漏洞,Mythos 发现了 250 个。
这个数字本身说明了问题。Anthropic 的选择不是不发布,而是先向可信的合作方开放,专注于如何把这种能力用于防御性场景,比如主动修补代码库漏洞,而不是攻击。
Krishna 把这个描述为一个可以复用的模板:当模型在某个敏感维度上能力跃升时,发布方式本身需要相应调整。
投资者最难理解的事:算力不是可变成本
Krishna 说,他和投资者沟通时,最难解释的一件事是:算力不是传统意义上的可变成本。
传统软件公司,R&D(研发) 费用就是 R&D 费用,不能变成 COGS(Cost of Goods Sold,营业成本)。
但 Anthropic 的算力可以在早上跑推理、下午做训练,同一块资源在不同时间段支持不同的业务目标。
这意味着,用"每 token 边际成本"来衡量 Anthropic 的盈利能力,是用错了框架。
正确的衡量标准是:整体算力投入的回报率是多少?
Krishna 说,目前这个回报是"robust",他用了两次这个词。
这个逻辑也解释了为什么 Anthropic 要持续大规模融资。
自 Krishna 加入以来,公司已融资 750 亿美元,与亚马逊和谷歌的协议还将带来另外 500 亿美元。
他的说法是:融这么多钱,主要不是为了填补亏损,而是为了覆盖不确定性锥形的上端,确保在最好的情景下也有足够的算力支撑增长。
融资路上的两个戏剧性时刻
Krishna 加入 Anthropic 时,公司正在完成 D 轮融资。
那次融资并不顺利,Anthropic 当时才刚刚有了真正意义上的前沿模型,而融资尾声恰好撞上了 FTX 崩盘,大量 Anthropic 股份被迫抛售,市场一片混乱。
E 轮的时机同样微妙。融资首日收盘,DeepSeek 的消息炸了出来,整个市场开始重新评估 AI 的投资逻辑。
Krishna 说,他们还是完成了那次融资,但过程中的波动可想而知。
这两个时间节点放在一起,倒是意外地说明了一件事:外部噪音再大,只要业务本身在兑现,资本最终还是会跟上来。
AI 安全研究,意外变成了销售优势
Anthropic 在可解释性研究(interpretability)和对齐研究上的投入,最初完全是出于安全使命,不是商业考量。
但这件事产生了两个意外的副产品。
第一,能看进模型内部,就能更好地构建它。
可解释性研究让 Anthropic 对自己模型的理解比其他人更深,这直接反馈到了模型能力的提升上。
第二,企业客户需要信任。
Anthropic 现在服务财富 10 强中的 9 家,这些公司把最敏感的工作流,包括员工数据、客户信息、核心业务流程,都交给了 Claude 来处理。
他们愿意这样做,很大程度上是因为 Anthropic 在安全和对齐上的公开投入给了他们信心。
这个逻辑链,Krishna 说,早期投资者几乎没有人真正理解。
文化:七个联合创始人,全部还在
Anthropic 有七位联合创始人,七个人全部还在公司。
最早的 20 到 30 名员工,绝大多数也还在。
Meta 大规模高薪挖人的那段时间,Anthropic 只走了两个人,而其他实验室走了几十个。
Krishna 把这归结于文化密度。
他们有一套真实的文化面试,不是走过场,候选人在其他方面再优秀,文化关过不了就不录用。
核心特质是:协作而不是抢功劳,谦逊而不是自大,有话直说但决策之后真正对齐,不搞内部政治。
Dario 每两周在全公司面前做一次分享,讲三四个话题,然后接受员工的真实提问,没有托儿,没有预设答案。
Krishna 说,这种透明度是很多人留下来的原因之一。
那次两个半小时的散步
Krishna 正式加入 Anthropic 之前,首席计算官 Tom Brown 带他在旧金山 Mission 区走了两个半小时,边走边讲他对公司未来的判断。
Krishna 说,那些话听起来像科幻小说。
他走回家,跟妻子说:"如果这里面有 10% 是真的,这件事就会打破我见过的所有范式。"
结果,Tom 说的大部分都实现了。
还有一些,按 Krishna 的说法,"大概还在我们今天所处位置的前方"。
如果你在做 AI 相关的决策
这次对谈里有几个判断,对从业者有直接参考价值。
关于模型选择: 不要只看 benchmark 分数,那些指标很多已经饱和。真正重要的是客户在实际工作负载里的体验,尤其是长任务、工具调用、智能体场景下的表现。
关于算力思维: 如果你在企业里负责 AI 基础设施,把算力当成单一用途的固定资产来管理,会错失大量效率空间。多平台、多用途、动态调配,是 Anthropic 花了几年时间建立的核心优势。
关于采用节奏: 企业端的用例正在追赶模型能力,而不是反过来。这意味着,现在部署的产品,在六个月后模型升级时会自动获得能力提升。提前建好基础设施,比等模型"足够好"再动手,回报要高得多。
© 2026
·
向阳乔木