Token经济学:AI时代的新货币战争与中国模型的全球崛起 硅谷101 2026-05-13

Token-maxxing:硅谷AI原生的新炫富与成本焦虑

在硅谷,一种新的炫富方式正在兴起,那就是攀比每天消耗了多少Token(Token: 大语言模型处理文本的基本单位)。这种现象被称为Token-maxxing(Token-maxxing: 把token用量拉到极限),意指将Token用量推向极限。它已成为公司内外衡量一个人“有多AI原生”的新指标,包括每天消耗的Token数量、同时调度的Agent(Agent: 能够自主规划、执行复杂任务的AI实体)数量以及Token吞吐量(Token Throughput)。

全球AI圈的巨头们正围绕Token的使用展开激烈辩论:公司是否应无限制地鼓励员工使用Token?例如,Meta内部就有一个名为“Claudeonomics”的排行榜,统计了超过85000名员工的AI使用数据,列出了Token消耗量最高的“超级用户”。在最近一个月,该排行榜上的总使用量突破了60万亿Token,若按Anthropic Opus 4.6的定价粗略估算,价值高达约9亿美元。其中,排名第一的员工消耗的Token价值高达数百万美元。

这一消息引发了硅谷的广泛讨论。AI创业公司Writer的CEO May Habib直言这是“生死存亡级别的问题”,她本人也密切关注公司内部的Token消耗排行榜,认为不全力拥抱AI就会被淘汰。Uber也表现出极强的进取心,其后端系统11%的新代码更新已由Agent完成,而三个月前这一比例还不到1%。Uber CTO的愿景是“把软件工程转型为Agent软件工程”。

然而,反对Token-maxxing的声音同样尖锐。HubSpot的CEO Yamini Rangan提出“Outcome maxxing大于Token maxxing”,强调产出结果的重要性而非单纯的Token消耗量。AI软件工程公司Jellyfish的CEO Andrew Lau也指出,盲目刷Token可能无法得到期望的结果。尽管存在争议,但多数中间派形成共识:不充分利用AI的公司将被竞争对手超越。在这种信念驱动下,即使排行榜和激励制度不完美,甚至一些AI使用被证明是浪费的,大厂高层仍认为必须这样做才能使公司转型为更AI-native(AI-native: AI原生)的企业。

OpenClaw这类Agent工具爆火以来,Agent任务消耗的Token量直线上升。对于科技巨头而言,不计成本地烧Token尚可接受,但对于创业公司和个人开发者来说,Token成本带来了巨大的焦虑。例如,运行一个稍微复杂的OpenClaw任务,几千万的Token量非常常见,如果使用最贵的Claude模型,一个简单任务可能就要花费十几二十美元。Uber CTO透露,公司2026年的AI预算在年初几个月内就已耗尽,主要原因是工程师对Claude Code的使用量暴增。知名投资人Chamath Palihapitiya也抱怨,他投资的软件公司在使用AI编程工具后,运营成本在几个月内翻了三倍多,年化AI支出将达千万美元级别。

这表明,对于企业,特别是软件SaaS行业,AI时代的成本结构与过去截然不同。传统SaaS产品研发投入是一次性的,用户越多边际成本越低。而现在,每个用户的每一次操作背后都有Token账单,用户用得越深、功能越智能,产品方反而要向模型厂商支付更多费用,这种成本是随用量线性增长的。因此,Token正成为AI创业公司最核心的“弹药”,甚至有风投基金开始直接向被投企业提供Token额度作为投资的一部分,这进一步印证了Token正在演变为一种新的货币。

Token定价机制与“越贵越便宜”的悖论

Token的定价并非简单的“单价乘以数量”,它涉及多种不同价格的Token类型。以一次最简单的对话交互为例,账单上至少有三种Token在运转:

  • Input token(输入token: 用户发送给模型的内容)
  • Cached input token(被缓存的输入token: 之前已被模型系统缓存的prompt、上下文或文件内容,价格更便宜)
  • Output token(输出token: 模型生成回答时产生的Token)

研究芯片与Token Efficiency(Token Efficiency: Token利用率)的专家肖志斌指出,在对话任务中,这三者的价格比大致为1:0.1:6。例如,OpenAIGPT-5 API定价,Input token每百万1.25美元,Cached input token每百万0.125美元,Output token每百万10美元。而最新模型GPT-5.5则根据上下文长短分为两档,长上下文价格是短上下文的两倍,短上下文的Input token每百万5美元,Cached input token每百万0.5美元,Output token每百万30美元。

虽然表面上Token价格在上涨,但这里存在一个反直觉的悖论:越贵的模型,可能反而总体成本越低。因为强大的模型往往能一次性准确完成任务,而较弱的模型可能需要反复重试,甚至需要人工介入修正错误,这会增加综合成本。因此,尽管Token单价更高,但每个有效结论的成本实际上在下降。例如,最贵的GPT-5.5-proGPT-5.4-pro在复杂任务和场景中,由于其强大的能力和准确性,反而能降低开发者的总成本,尤其是在Agent场景下。

Agent任务并非简单的一问一答,它会反复调用模型,每一步可能调用不同的工具,工具又会产生新的日志和上下文,返回给Agent继续循环调用。因此,Agent循环(Agent loop)的Token成本非常复杂,除了单次模型调用的输入和输出成本,还包括持续产生的日志和调用工具的成本。一个高质量的模型可能一次Agent循环就能生成所需答案,而便宜模型可能需要多次迭代,甚至出错,导致总成本更高。

模型公司的定价策略,一方面取决于模型的推理成本和研发费用,但更关键的是基于模型质量和任务完成度。推理成本是基础,大模型研发费用也需摊平。然而,最重要的应是根据模型是否具备Reasoning(Reasoning: 推理)能力、上下文窗口(Context Window)大小以及完成任务的效率来定价。许多公司目前仍按推理成本定价,但这并非最优解,按模型质量和任务完成度定价才能体现更大价值。

此外,云厂商如微软Azure亚马逊AWS阿里云火山引擎也是Token定价链条中的重要一环。企业通过云厂商调用模型时,Token账单会包含模型Token费用、云服务封装费以及企业级基础设施溢价。云厂商会根据模型在机器上每秒能跑多少Token来反向推算GPU成本,并加上溢价。但有时为了抢占市场或提供企业折扣,云厂商也会降低价格。

中国模型的崛起与Token套利新范式

OpenClaw爆火、硅谷掀起Token-maxxing热潮后,高昂的账单促使开发者们寻找性价比更高的解决方案。来自中国的开源模型因此在国际开发者社区中大受欢迎。例如,KimiInput token价格不到55美分,Output token约2.6美分。MiniMax甚至受到了OpenClaw官方的推荐。虽然中国模型在顶级能力上可能略逊一筹,但在许多不需要极高推理能力的任务中,它们表现出色,指令遵循(Instruction following)好,速度快,最重要的是价格便宜。

在某些任务上,中美模型的价差可高达50到70倍。这解释了为何当OpenClaw这类Agent工具将Token消耗从万级推向百万级时,全球开发者几乎本能地转向了中国的便宜模型。OpenClaw的爆发式增长,也带动了中国模型厂商如智谱AIMiniMax的股价上涨。与此同时,国内云厂商如腾讯云阿里云百度智能云在2026年3月掀起了一波集体涨价潮,AI算力产品价格在10天内上涨了约30%。

开源模型Token消耗量的上升,是因为其能力已跨越了某个门槛。例如,智谱Kimi模型在编程(Coding)方面的提升显著,而编程正是大模型Token消耗最大的赛道之一。当程序员发现开源模型与几个月前的Anthropic模型一样好用,但价格极其便宜时,自然会切换。对于个人开发者和创业公司而言,处理不那么复杂的任务时,转向开源模型是明智之举。例如,MiniMax M2.5Claude Opus 4.6SWE-Bench Verified软件工程基准测试中得分分别为80.2%和80.8%,实际使用中差距微乎其微。但价格上,MiniMax M2.5的输入价格是每百万Token 0.3美元,而Claude Opus 4.6是5美元,前者仅为后者的1/17。对于每天消耗几千万Token的OpenClaw用户来说,这能将账单从几百美元直接降到几十美元。

中国模型之所以能做到如此便宜,主要有几方面原因:

  • 技术层面:国内大模型广泛采用深度MoE(Mixture of Experts: 混合专家模型)架构,通过缩小专家规模和减少每次活跃的专家数量来节省成本。
  • 生态问题:通过补贴用户抢占市场生态。
  • 云厂商优势:部分中国公司本身就是云厂商(如阿里云),其内部成本定价可以低于外部计价,拥有更高的利润率(Margin)来压低模型价格。

不同的模型为开发者提供了混合使用的选择:复杂任务交给高性能模型,简单或重复性高的任务则交给便宜模型。这种混合使用成为了Agent时代新的Token模式。黄仁勋在2026年的GTC大会上提出了一个更宏观的Token定价框架,将Token分为免费层、中级层、高级层、高速层和超高速层,价格从每百万Token 3美元到150美元不等。他明确指出,Token不再是同质商品,其价格应由交互速度和使用场景决定,就像电力有峰谷电价一样。

Token效率与智能调度:套利空间的挖掘

然而,Token需求暴增的背后,也存在大量Token消耗未产生实际价值的问题。业内人士批评,当前全球企业AI应用中,近一半的Token可能被浪费。Agent不像人类那样懂得“适可而止”,它在执行任务时会反复读取对话历史、重新扫描已处理文件,并一遍又一遍地“喂”给模型早已过期的上下文,导致冗余信息像滚雪球一样越滚越大,而真正与当前任务相关的可能只占一小部分。如何让Agent少烧冤枉钱,正在成为新的技术和商业赛道,Token Efficiency(Token Efficiency: Token利用率)成为下一阶段的关键词。

OpenRouter这家公司就是其中一个值得关注的例子。它已成为观察全球模型使用趋势的一面镜子,许多关于中国模型调用和排名的数据图都出自该平台。OpenRouter的创始人Alex Atallah曾是全球最大NFT交易所OpenSea的联合创始人兼CTO。2023年,他创立OpenRouter,其商业逻辑很简单:市面上模型越来越多,开发者不希望为每家模型单独注册、充值和对接API格式,OpenRouter提供一个统一入口,所有模型一个接口搞定,平台从中抽取约5%的费用。A16z在2025年对OpenRouter领投了4000万美元,估值已接近13亿美元。

OpenClaw的爆发让OpenRouter的生意真正起飞。当全球开发者疯狂调用各种模型驱动Agent工作流时,他们需要一个能快速切换模型的中间层,OpenRouter恰好满足了这一需求。AtallahOpenRouter与他上一次创业类比,都是将分散的供给整合到一个平台上,他认为供给越分散,中间商的价值越大。OpenRouter提供了一个与OpenAI API兼容的调用层,用户可以自动切换不同模型,统一API和定价,这对于AI初创公司快速上线、试错和找到匹配模型至关重要。此外,它还提供模型故障或延迟时的快速切换备用方案。

尽管OpenRouter的数据更像是创业公司和独立开发者群体的风向标,而非整个AI行业的全景图,但正是这个对价格最敏感、最愿意尝鲜新模型、迁移成本最低的群体,构成了中国模型出海的第一波“自来水”用户。

如果Token是AI时代的“电”,那么总得有人给这些电装电表。Metronome公司就是做这件事的,其客户名单包括OpenAINVIDIAAnthropicDatabricks等巨头。Metronome的两位创始人来自Dropbox,亲身经历了SaaS行业“改定价”的痛点。在AI时代,收费单位从“人头月费”变为Token数、API调用次数、GPU时长等颗粒度极细的指标,且每个客户的合同条款、折扣结构和用量阶梯可能各不相同。SaaS成本相对稳定,而Token公司的计费则复杂得多,与卡、电、请求量以及峰值拥堵都有关。

Metronome的核心业务是清晰记录谁在何时调用了什么、消耗了多少Token。其设计理念是将“发生了什么”与“该如何收费”彻底分离。工程团队只负责上报用量数据,产品和销售团队自行配置价格和合同条款,中间的换算、出账、对账全部自动化。这种分层设计,从事件流记录、事件定价、到订阅制/API购买/限制加溢价等计费方式,再到折扣策略,都使得计费系统更加灵活和健壮。Metronome发展迅速,累计融资1.28亿美元,并于今年1月被Stripe收购,其估值甚至追上了许多模型公司,这说明在Token经济中,如何精确算钱变得越来越重要。

在这样的产业中,“套利”机会也随之出现,业内称之为Token Arbitrage(Token Arbitrage: Token套利)。开发者将不同模型混用,复杂任务用ClaudeGPT等昂贵模型,简单任务用MiniMaxKimi等性价比模型。本质上,只要用户感知不到便宜模型与昂贵模型在体感上的显著差异,中间商就有套利空间。这类似于税务审计师通过专业优化帮助客户节省税费,然后与客户分成。

更进阶的套利方式是搭建一个“智能路由器”。用户需求进来后,先用一个模型判断任务复杂程度,简单任务分配给便宜模型,只有真正复杂的任务才交给ClaudeGPT。对用户而言是黑盒操作,但中间商不断优化成本结构。作为一个模型提供商,通常都会有自己的“路由模型”,用于判断任务难易度,并将其分配给合适的模型以最小化成本(Minimize cost)。此外,通过Agent产品(如GensparkManus),内部也会基于基准测试和经验,对不同任务进行灵活分发。

例如,嘉宾知县作为典型的“混合调度”用户,每天与AI互动数百次,将Opus视为产品经理,利用其发散性思维进行设计;将GPT视为技术负责人,用于把关和复盘;而中间的执行环节,则交给国产的便宜模型,因为执行需要智能、快速且便宜,且输出成本最高。Agent开发者王浩从工程化角度解释了如何实现:初期用简单模型检测用户意图,通过指标和阈值区分任务。后期可利用用户数据,通过强化学习(RL)或微调(Fine-tune)优化路由模型,使其更高效地区分复杂和便捷场景,最终让用户在支付高价值Token价格的同时,实际消耗的是低价值Token。

这种“套利”模式短期内具备可持续性。尽管大模型厂商如Anthropic已将类似能力内置到其Coding Agent的“Advisor(顾问)”模式中,但跨模型的调度空间远未被穷尽。因为每家大模型公司只优化自己的模型,而市场上的模型数量庞大,跨模型的智能调度并非短期机会,而是具备创业空间。这不仅关乎模型定价,更涉及任务与模型的精准匹配、模型的吞吐量(Throughput)、延迟(Latency)判断、模型质量和任务完成度的判断。目前OpenRouter主要做了API聚合和定价策略,但尚未深入到模型质量与任务、甚至模型与硬件的匹配。最终,最会调度Token的系统将胜出,但这种系统需要比OpenRouter更深入,例如整合Prompt压缩等功能。

Token出海:中国的新结构性产业机会

将视角拉大,当一个伦敦的程序员用MiniMax的API运行OpenClaw时,物理层面上,他的请求从英国穿过海底光缆,落在贵州的数据中心,GPU开始工作,几秒钟后结果原路返回。整个过程中,没有一度电离开中国的电网,但电的价值已通过API账单以Token的形式完成了跨境结算。这是一种全新形态的“出口”——中国过去出口日用品、衬衫、家电、电动车等实物商品,需要过海关。而Token出海无需集装箱,甚至无需任何实体商品离开国境,电力在本地消耗,算力在本地运转,但创造的价值通过互联网瞬间交付到全球任何一个开发者手上。有人称之为“电力出海”,即电的价值出去了。

那么,中国Token为何能卖得如此便宜,这种状态会持续下去吗?实际情况较为复杂。GMI Cloud创始人Alex在GTC现场指出,美国其实不缺电,缺的是运送能力(Distribution power)。高压电虽然充裕,但将其传输到数据中心需要漫长的审批和变电站建设过程。中美工业用电成本的绝对值差异并不大,中国工业用电约0.4到0.6元/度,美国约0.8到1.2元/度。真正拉开差距的是基础设施的响应速度:中国可以在西部沙漠铺设光伏板,通过特高压电网将电送到东部算力集群。因此,从电力角度看,美国的Token价格短期内很难大幅下降。

同时,Alex认为,从存储等供应链角度来看,Token价格短期内更难下降。DDR4(DRAM)价格是过去的10倍,CX7和电源供应(Power supply)也面临短缺。OpenClaw、Agent、多模态和编程的兴起,恰好形成了“三个完美的风暴”,导致所有供应链都跟不上节奏。最大的挑战是建设足够多的数据中心,这是物理上的限制。尽管云服务商会努力提升Token效率、降低延迟,但最终仍受限于数据中心数量、GPU卡数量和电力供应。当然,这还涉及数据跨境、网络延时、隐私安全等合规问题。

尽管存在挑战,但OpenRouter上的开发者平台出海、云平台出海以及开源模型出海的趋势正在迅速发生。这波出海红利已实实在在地反映在收入上:MiniMax海外收入占比超过七成;月之暗面Kimi K2.5发布后数周内收入就超过了2025年全年;智谱的模型API收入也出现了爆发式增长。

Token需求的天花板目前根本还看不到。每一个事件(Event)都触发了Token消耗的指数型增长。目前,并非每个人都在使用OpenClaw,也并非生活中的每一个垂直领域(Vertical)都已完全AI化。因此,Token的消费(Consumption)仍将继续增长,潜力巨大。

Token的消耗正在从“人类主动发起”转变为“机器自动运转”。一个程序员手动使用AI编程助手一天可能消耗几十万Token,但一旦配置Agent全天候在后台运行,进行代码编写、资料查询、测试、部署等任务,消耗量可直接跳到千万级。当这种使用方式从少数极客扩散到普通开发者,再扩散到每一个知识工作者,Token的需求增长将是指数级别的。如果用一句话概括这个趋势,那就是:上一个时代中国出口的是衬衫和家电,这个时代是电动车,那么下一个时代可能就是Token了。

Token到底意味着什么?对Meta员工来说,它是排行榜上的勋章;对创业公司来说,它是每月最大的一笔开支;对OpenRouter来说,它是抽取5%佣金的流水;对中国的云厂商来说,它是把电力变成美元的管道;对黄仁勋来说,Token会变成大宗商品(Commodity),每一个输入和输出都与芯片挂钩。Token作为一种大宗商品,人类历史上所有销售大宗商品的方式,如期货、套利、批发零售、聚合平台、计量计费,都将在Token身上重新上演。

同时,Token的定价方式也可能发生巨大变化。业界正在尝试按“复杂度计费”的Effort-based Pricing模式,或按任务完成度计费的Task-based Pricing模式。这都使得Token Economy的定价方式在未来有着巨大的进化空间,就像原油到汽油再到续航里程的定价逻辑,将在Token到任务到业务结果这条进化路径上再现。从Token-maxxingToken套利,从OpenRouterMetronome,每一个概念和公司本质上都是古老商业逻辑的AI升级版本,唯一不同的是速度——这一切不是在几十年里慢慢展开,而是在几个月内迅速发生。这场游戏才刚刚开始。

关键字: token-economy ai-pricing model-arbitrage ai-native supply-chain