晶圆级集成的第一性原理
Cerebras 产品的核心优势源于其对第一性原理的应用,旨在彻底解决现代 AI 计算中的内存墙问题。在现代大语言模型的推理过程中,尤其是自回归解码(Auto-regressive Decoding: 一种 AI 推理方式,每次生成一个 token)阶段,系统一次只能生成一个 token。为了生成这一个 token,系统必须将庞大的模型权重数据从内存中调出到计算核心。对于千亿级参数的模型,每生成一个 token 可能需要移动上百 GB 的数据。
传统的 GPU 架构,例如 Nvidia 的 Blackwell B200,由于芯片面积的物理限制,被迫通过先进封装将高带宽内存(High Bandwidth Memory: 放置在计算芯片外部的内存类型)放置在计算芯片外部。这种频繁的片外数据搬运不仅消耗了大量时间,还产生了巨大的能耗。
Cerebras 的解决方案是将计算核心和海量内存直接放在同一块巨大的硅片上,即实现了晶圆级集成(Wafer-scale Integration: 将整个计算核心和海量内存放置在同一巨大硅片上)。其 WSE-3 芯片拥有 44GB 的 SRAM(Static Random Access Memory: 片上极速缓存)。这意味着在运行大多数前沿模型时,整个模型的权重可以直接驻留在片上极速内存中,完全消除了芯片外的数据传输瓶颈。得益于这种结构,WSE-3 实现了每秒 20 PB 的存算带宽。在针对主流开源模型的第三方独立基准测试中,Cerebras 的推理速度比同等规模的领先 GPU 集群快了 10 到 15 倍。这种基于物理底层架构的速度优势,极大地降低了推理延迟,并显著提升了能源效率。
技术劣势与商业瓶颈
然而,这种极端物理形态的晶圆级集成也为 Cerebras 带来了难以回避的技术劣势和商业瓶颈。
首先,它极度依赖单一晶圆代工厂。如果 TSMC 的先进制程产能受到限制,或发生地缘政治危机,Cerebras 几乎没有任何替代制造方案。其次,其系统级工程的复杂性极高。CS-3 系统庞大的体积、极端苛刻的闭环水冷需求以及特殊的供电标准,使得其在传统企业级数据中心的现场部署和后期维护中面临极高的运营成本。
最后,在软件生态系统的护城河方面,Nvidia 的 CUDA 系统经过十多年演进,已渗透到 AI 学术界和工业界的方方面面。尽管 Cerebras 通过努力实现了架构兼容,但在面对开发者需要进行底层算力优化,或引入全新非标准模型架构时,其开发者心态的易用性和响应速度依然处于劣势。
颠覆市场的核心商业假设
一家企业在商业上的成功建立在正确的商业假设及其极致执行之上。检视 Cerebras 的核心假设,就是在判断其商业愿景是否能最终实现。Cerebras 认为其业务模式能颠覆现有格局,主要基于以下三个核心假设:
第一个假设是推理时代的全面到来。AI 产业的最大商业价值和计算需求,将从前几年的暴力训练、超大模型迅速转移到高频次、大规模的实时推理应用上。
第二个假设是系统二推理(System 2 Reasoning: 模型在输出前生成大量思维链的深度推理过程)成为前沿标准。随着诸如 OpenAI o1 系列等具备思考和推理能力的模型普及,AI 在输出最终结果前,需在后台生成大量的中间思维链。这意味着单个查询的推理计算量将呈指数级增长,底层硬件对内存带宽的要求将远超对算力的要求。
第三个假设是极速交互将成为不可逆的产品护城河。一旦开发者和终端用户体验到每秒生成数百上千个 token 的极速速度,市场对传统 GPU 集群高延迟的容忍度将大幅降低。速度将直接转化为更高的用户留存率和商业变现能力。
基于上述假设,Cerebras 坚定投入,成功推出了三代晶圆级芯片,并实现了算力、云服务和按 token 计费的多元化转型。其与 OpenAI 签订的 750MW 超级基础设施订单,是对其技术实力的最高级别背书。然而,对于二级市场投资人而言,OpenAI 的订单及背后的交易结构安排中透露出的利益架构,依然是核心关注焦点。