乐高式数据中心:重塑AI基建范式
当我们讨论AI算力竞赛时,大家都在聊芯片、模型和电力。但你有没有想过这些承载数万张GPU的数据中心到底是怎么建起来的呢?更有意思的是,今天全世界最顶级的科技公司建数据中心的方式正在变得跟你小时候拼的乐高积木越来越像:混凝土墙板是做好了运过来的,机电房是接好线运过来的,甚至整个数据大厅直接就是卡车拉过来的成品。扎克伯格在搭帐篷,贝索斯在玩魔术,整个行业像回到了狂野西部,所有人都在说自己是模块化,但是每个人说的模块化可能根本不是一回事。今天我们就来借着SemiAnalysis的最新文章聊聊这个正在重塑整个算力基建格局的乐高式数据中心革命。
要理解这场变革的根源,我们得从一个钱解决不了的问题说起,那就是劳动力。这两年我们聊了很多数据中心的瓶颈,包括电力、土地、水资源,这些问题某种程度上都可以靠资本投入去推动的,但是有一个瓶颈真的是砸钱也很难快速绕过去,就是熟练技工的短缺。具体来说,就是电工和管工。你可能觉得不就是工人吗?涨工资不就行了?事情没那么简单。Crusoe在德州阿比林Abilene建Stargate园区的时候峰值需要超过9000名工人,他们直接把工资涨了30%去抢人就这还是不够。电工这个工种在整个数据中心项目的总施工工时里要占到30%到40%,是绝对的主力工种。SemiAnalysis做了一个分州的劳动力模型,把每个州的数据中心建设规划换算成每个工种需要的工时再跟可获得的劳动力供给做对比,结果显示如果还是按照传统施工方式到2027年,电工短缺就会全面爆发,德州和俄亥俄州这些建设最集中的地方情况会最严重。这不是周期性的劳动力紧张,这是结构性的瓶颈。一个成熟电工的培养周期要好几年,你不可能今天开工明天就变出几万名合格的电工来。那怎么办呢?整个行业给出的答案就是模块化。说穿了很简单,就是把那些可以重复的工作从工地搬到工厂里去做:墙板在工厂里浇筑好,电力模块在工厂里接好线,冷却单元在工厂里组装测试完,这些工作在工厂里可以跟现场地基施工并行开展,最后运到现场像搭积木一样拼起来。这样一来,不仅能缓解劳动力短缺的压力,更重要的是能大幅缩短建设周期。今天在AI这个行业,速度就是收入:一个MW的IT负载一年大概能产生1200万到1500万美元的收入,折算下来一个月就是100万到125万美元。早一天上线,就是真金白银的收入。我们来算一笔账:一个50MW的数据大厅如果能提前8个月上线,不算复利的话,就是差不多2亿美元的价值,这还不算抢占市场先机的战略价值。所以你就明白为什么从超大规模云厂商到主机托管运营商,再到AI实验室,所有人都在往模块化方向冲。
预制与模块化的概念厘清
Compass和Switch是最早开始把部分建设工作搬离现场的运营商,现在用设备橇(Skid)方式安装电气设备已经是行业标准操作了。AWS有个项目代号叫**胡迪尼(Houdini)**能把服务器进场前的准备时间从几个月压缩到几周;Meta更激进,直接在搭织物覆盖的帐篷大厅。SemiAnalysis的数据库里现在已经追踪到超过61GW的模块化容量,1000多个使用了某种预制或模块化策略的站点,他们估计到2028年底模块化建设的渗透率会达到总运营容量的30%以上。不过问题也来了:现在这个市场真的就像狂野西部,所有人都说自己是模块化,但是厂商、工程总承包商(EPC)、主机托管运营商们之间说的根本不是一回事。有的说的是预制墙板,有的说的是电力模块,有的说的是整栋建筑。所以在展开聊之前,我们得先把两个最基本的概念厘清:预制(Prefabrication)和模块化(Modular)。
预制是一个更宽泛的概念,只要是在工厂制造、运到现场就能安装的部件都可以叫预制,它说的是工作在哪里完成而不是东西是什么形状。而模块化的定义就窄多了,它指的是那些真正自包含的单元,可能是一个房间、一个箱子、一个区块,运过来就是完整的,现场只需要螺栓连接和外部接口对接。这么说吧,所有的模块化单元都是预制的,但不是所有预制件都是模块化的,这个区分很重要。因为接下来我们会按照数据中心实际建设的顺序从外到内一层一层拆开讲,你就会发现模块化的程度是逐级加深的。
数据中心的物理结构与层级划分
一个数据中心从物理上可以分成三层:最下面是场地层(Site),也就是地块本身,你得找一块地清表、场地平整、打地基。这一层是没办法模块化的,你总不能把地基从工厂里运过来吧,必须在现场实实在在地破土动工,把混凝土浇筑到地块里。在地基上面是外壳层(Shell),也就是建筑结构、墙体、屋顶,作用是把整个建筑撑起来同时遮风挡雨。外壳里面就是系统层(Systems),也就是所有的机电系统和IT设备,包括电力、冷却、机柜、服务器全在这一层。预制和模块化的文章主要就是做在外壳和系统这两层。
外壳的演进:从传统到特殊结构
我们先从外壳说起。传统的外壳建设,大家都见过工地现场支模板、绑钢筋、浇筑混凝土等这一层达到75%的设计强度了才能往上浇下一层,一层一层等,这个等待的时间是非常长的。模块化外壳同样是在现场浇筑的地基上开始,但是从那之后结构件和墙板都是工厂做好的成品运过来直接用起重机吊装螺栓固定就行,直接跳过了现场浇筑和养护的等待时间。不过外壳的模块化也不是一步到位的,它大致经历了三个阶段的演进:
-
预制混凝土阶段:本质上还是用工业化的方式来生产传统外壳,只不过不在现场支模浇筑了,改成在受控的工厂环境里生产混凝土面板然后运到现场吊装到准备好的地基上。这其实不是什么新技术,北弗吉尼亚州因为劳动力早就紧张了已经用预制混凝土很多年了。CloudHQ在阿什本(Ashburn)的两层LC-2 facility就是典型代表,它的承重外壳能支持长跨度无柱空间结构强度也足够把机械设备放在屋顶上,但问题是这栋楼从开工到交付还是用了18到20个月,因为它本质上还是一栋大型多层建筑,预制只是减少了现场支模和养护的时间。还有一种类似的方式叫Tilt-up混凝土,也就是在建筑的楼板上直接浇筑墙板然后吊起来,这种方式不用长途运输,对于大型单层建筑来说可能是成本最低的方案,但是质量和进度受现场条件和天气影响比较大。
-
简化设计阶段:就不只是换生产方式了,而是开始简化建筑本身的设计。为了进一步提速,整个行业开始转向更简单的设计,用标准化的结构开间减少不必要的建筑装饰,外墙板全部标准化,钢材开始成为首选材料,因为钢构件可以在工厂预制运输效率高,现场螺栓连接速度快,在平坦的大型园区里尤其适合。这其中最轻量的形式叫预工程金属建筑(Pre-engineered Metal Building)简称PEMB,它由三部分组成:主框架是结构骨架,次框架是更轻的钢构件比如屋顶檩条把主框架连起来,最外面是表皮,也就是薄薄的金属板作用只是遮挡风雨。这种方式速度是最快的,所有零件在工厂都切割好了、打好孔了、编好号了,现场工人只需要拧螺栓就行,而且轻钢结构比混凝土省很多材料。要求更高的数据大厅会用结构钢,也就是更重的热轧钢梁和钢柱,工厂预制后现场用螺栓连接成刚性框架成本比轻钢结构高,但是能支持更大的跨度、更重的负载也能适应更复杂的布局。QTS在锡达拉皮兹(Cedar Rapids)的园区就是这种方式的典型代表,目前在建的420MW阶段占地约280万平方英尺用了大约28000吨结构钢,从破土到封顶只用了大约5个月整个建筑交付大概11个月,这个速度在传统建设方式下是不可想象的。
-
快速部署特殊外壳阶段:这也是最近两年最有话题性的方向。Meta在新奥尔巴尼的Prometheus园区用的铝框架织物包覆结构,也就是大家说的帐篷。每个结构大约12.5万平方英尺,2025年7月宣布到2026年4月已经立起来8个帐篷了,Meta第一栋永久建筑花了两三年,帐篷的速度快得多。当然这里要说明一下,帐篷加速的主要是外壳部分,不是整个数据中心,里面的电力、冷却、调试还是需要时间的。AWS现在也在大规模推进他们自己的模块化设计代号叫SAMDC,结构更窄、重复性更高,完全围绕内部系统来组织。这个阶段的核心逻辑已经不是把传统建筑放到工厂里做了,而是重新设计建筑本身让它从一开始就适合模块化制造和快速组装。
系统层的分级:组件到数据块
讲完外壳,我们再往里面走,来讲系统层的模块化。这一层的模块化程度差异就更大了,我们可以把它分成五个等级:
- 一级是组件(Component):也就是单个设备,比如一台不间断电源(UPS)、一个配电柜,这其实就是传统的设备采购还谈不上模块化。
- 二级叫设备橇(Skid):也就是设备组,把多个组件安装在一个开放的钢架上作为一个整体运输,现场只需要连接外部管线,这是现在行业最常用的方式。比如一个电力设备橇可能包含变压器、开关设备、UPS,在工厂里装在一个底座上接好线运过来接上主电和负载就行。
- 三级叫封闭模块(Module):设备橇是开放的,封闭模块是有墙体和屋顶的,是一个封闭的空间,相当于一个完整的房间运过来就能用。
- 第四级是集装箱(Container):这是模块的一种特殊形式,用ISO标准集装箱或者专门的防水外壳封装,适合边缘计算、工业场景或者偏远地区,但是受集装箱的尺寸限制密度和布局灵活性有限。
- 最高一级叫预制数据中心块(Prefab Datacenter Block)简称PDB:多个工厂模块在现场拼接成大型设施块形成完整的数据大厅。
核心子系统的模块化进展
我们具体看看几个核心子系统的模块化进展:
- 电力系统是模块化推进最快的领域之一。传统方式下,一个50MW的电力大厅现场布线和调试需要5.5到16.7个月,工厂预制可以把这个时间压缩到大约2.5个月。Flex通过他们收购的阿诺德·马尔迪克斯(Anord Mardix)做模块化电力块,施耐德和维谛也都有成熟的电力模块方案。这其中有个很有意思的公司叫DG Matrix,他们在做软件定义的电力路由模块,用功率电子的多端口路由替代传统的变压器加开关设备加UPS加电池的整条链路,这个思路如果跑通会把电力系统的复杂度再降一个量级。
- 冷却系统的模块化也在快速推进,尤其是液冷普及之后管道工作量大幅增加,预制管道的价值越来越突出。Airedale by Modine做基于设备橇的冷量分配单元(Coolant Distribution Unit)简称CDU,2MW级别,一个设备橇上集成了冷却回路、缓冲罐、泄漏检测到现场接上主管道就行。更激进的是Karman Industries做的CO2基热处理单元(Heat Processing Unit)简称HPU,用碳化硅(Silicon Carbide,简称SiC)功率电子和永磁电机做成美国电气制造商协会(NEMA)标准的户外设备橇,占地面积能减少60%到80%。
- 白色空间也就是放服务器机柜的区域也在工厂预制。施耐德电气(Schneider Electric)的EcoStruxure Pod最多能放40个机柜供电、冷却、布线全部在工厂预装好,支持30多种参考设计。AWS的Project Houdini本质上就是把标准数据大厅重新切割成工厂预制的设备橇,每个大约45英尺长、2000磅重能放在双低拖车上运输,现场部署时间从最多15周缩短到2到3周,每个模块能消除5万多个现场电工工时。AWS在休斯顿、盐湖城、托皮卡都建了工厂早期部署在德州和南本德目标是从开工到第一个服务器房间就绪大约25周。
- 还有一种更彻底的方式就是整栋设施的模块化,集装箱式数据中心大家可能听说过把整个数据中心塞进ISO集装箱或者专门的防水外壳里适合边缘场景,但密度和布局灵活性受集装箱尺寸限制。维谛的MegaMod走得更远是模块化工厂生产的完整设施,中间是IT机架周围是冷却和电力单元参考设计是1MW大约26.5米长、24米宽、4米高Plus版本能延伸到31米宽运输的时候拆成可运输的预制段用重型卡车运到现场再连接调试。
平台级方案与生态整合
Hut 8在科珀斯克里斯蒂(Corpus Christi)的Beacon Point园区704MW的IT容量就是用维谛的OneCore方案做的,围绕英伟达的DSX参考架构设计。说到这里就不得不提英伟达的Vera Rubin DSX,这是2025年10月首次发布、2026年3月正式定型的参考设计。它的意义不只是一个模块化产品而是一个平台级的模块化方案,覆盖计算、网络、存储、硬件集群设计以及设施侧的电力、冷却、控制,还通过Omniverse DSX Blueprint构建数字孪生(Digital Twin)模拟布局、电力拓扑、热行为和运营策略。CoreWeave已经在用DSX Air来构建AI工厂的数字孪生了。这个生态里已经聚集了Cadence、达索系统、伊顿、Jacobs、施耐德、西门子、维谛技术(Vertiv)等一大批玩家。
维谛的OneCore本质上就是把电力和冷却打包成标准的12.5MW Pod去匹配DSX这类参考设计。EdgeConneX有个估算,通用的参考设计能把项目推进到大约30%到60%的许可状态让大量场外工作可以提前开始。
落地挑战与实施流程
讲到这里你可能会觉得模块化一切都好,但实际落地的时候挑战一点都不少。我们先从厂商的宣称说起,现在几乎每个厂商都在说模块化能省多少时间、省多少钱。SemiAnalysis从底层重新建模验证了这些说法发现模块化确实能把施工窗口压缩大约36%,也就是7到9个月,资本支出每MW大约便宜8%,从传统的大约每MW1460万美元降到大约每MW1350万美元,每MW省大约110万美元。但你要注意,这些节省不是主要来自硬件成本而是来自工厂效率更高带来的劳动力节省、更少的现场工时以及更短建设周期带来的升级、变更订单和现场管理费用的减少。而且厂商宣传的数字往往来自更窄的统计范围,比如维谛说的85% SmartRun针对的是架空母线和封闭系统不是端到端的施工;施耐德说的60%,针对的是电力和冷却模块不是整个数据中心的建设周期,所以,如果你要是以为买了模块化产品就能省85%的时间那肯定要失望。
再来说说模块化的实施流程,它不是把东西运到现场拼起来那么简单,整个过程大致可以分成五个阶段:
- 方案设计和仿真:包括定义负载、选择设备、开发单线图(Single-line Diagram)、完成短路保护和电弧闪络研究。现在415V和480V的交流方案已经模板化了,但是800V直流方案还不成熟,只有少数参考设计,设施级架构还是要逐个项目设计。Aran Industries用自研软件把原来需要多个工程师做几个月的设计压缩到几个小时计算加单人审查,这就是设计工具进步带来的效率提升。
- 图纸包和文档:包括工厂用的IFF图纸包、现场施工用的IFC图纸包还有许可和调试文档。设计自动化能减少大量重复的手工绘图工作。
- 模块组装和工厂验收测试(FAT):这里有个经典的1-10-100规则:设计和组装阶段花1美元就能修复的缺陷,到了生产阶段就要花10美元,发运到现场之后就要花100美元,所以工厂测试的价值怎么强调都不过分。工厂的一次通过率预计能超过95%,而现场施工的一次通过率大概只有60%到70%。
- 运输和安装:这可能是整个模块化流程里最大的挑战。模块都是超大超重的,不需要特殊许可的包裹上限是102英寸宽、8万磅重,超过16英尺宽就要触发桥梁工程审查,每个州要审7到21天不等。保险也是个大问题,高价值的AI机架一次只能运1到2个,运输风险太高,起重机的成本也不低,每天5000到25000美元,而且起重能力随半径变化很大。马尼托沃克(Manitowoc) 18000起重机在7.3米距离能吊600吨到104米距离就只能吊10吨了。现场布局的时候必须把这些因素考虑进去,比如施耐德的500kW电力模块就有5万磅重需要6个吊点。
- 现场调试:这部分分成6个等级,从L1的工厂见证测试到L2的运输安装验证,L3的预功能和启动检查,L4的功能性能测试一直到L5的集成系统测试。L2以后的测试必须在现场进行,整个站点的调试需要3到8个月。当然模块化也带来了新的调试方式,就是并行工厂调试,在运输前就完成设备验证和控制检查能缩短现场调试时间。
市场模式与未来趋势
现在这个市场上的玩家大致可以分成三种模式:
- 运营商主导模式:代表是AWS、Meta、Aligned这些超大规模厂商,他们自己掌握设计控制权定义模块化标准让供应商按照他们的要求生产。好处是设计完全符合自己的需求,但坏处是所有的成本库存交付风险都要自己承担。
- 系统集成商和工程总承包主导模式:代表是Comfort Systems、Sterling Infrastructure、Quanta这些承包商,客户保留设计控制权,承包商把施工工作转移到工厂完成。这种模式对很多中型客户比较友好。
- 原始设备制造商(OEM)主导模式:代表是维谛、施耐德这些设备厂商,他们提供端到端的全栈解决方案。好处是客户不用整合多个供应商,厂商的单项目价值捕获也大幅提升。但原始设备制造商模式也有问题,维谛现在的模块化方案交付周期超过12个月产能是个瓶颈。
主机托管运营商里也有做得非常激进的:Compass可能是工业化程度最高的,大约70%到85%的建筑都在工厂制造,整个设施分解成可重复的零件包,外壳是免钢筋的纤维增强预制外壳,白色空间用标准的预制机架和封闭系统,电力块是可重复的约1.25MW施耐德电力中心中压开关设备用西门子的模块化设备橇。他们最快的项目框架和屋顶18到21天就能搭完。QTS有自己的Freedom Design灵活外壳加重复电力架构,每个工厂Pod包含1.5MW UPS和2.25MW发电机以1.5MW为增量扩展后来的Freedom LC+还扩展到了冷却系统支持全空气冷却或者全液冷。Rapids设计更是把模块化推进到建筑本身以可重复的60MW大厅块来组织容量,QTS甚至准备了700万平方英尺的仓库用来存放UPS、开关设备、冷却设备这些长周期设备库存,这也是他们速度快的重要原因。
Aligned Data Centers的Adaptive Modular Infrastructure平台走的是另一条路,核心电力和冷却架构标准化但大厅配置可以根据客户需求变化。他们的Delta³空气冷却方案支持最高约50kW每机架,DeltaFlow液冷方案支持超过350kW每机架,电力和冷却的混合配置可以在不重新设计整个大厅的情况下切换。
垂直整合与未来展望
Crusoe作为新派AI算力运营商在模块化上也走得很靠前,他们2022年收购了Easter-Owens实现了模块化数据中心和电气系统制造的垂直整合。在阿比林的Stargate园区他们用结构钢加工厂制造的绝缘金属面板每个建筑大约672块面板面板制造不到40天就完成了安装速度是每天15到20块不到8周建筑就封闭了。他们在科罗拉多州布莱顿(Brighton)的Spark工厂生产的Spark单元每个大约1MW属于整栋设施模块化已经在Redwood Materials部署了最初4个Spark单元加12MW微电网后来扩展到24个单元。Nebius作为新兴的AI云在新泽西园区用预制结构组件加速外壳建设,用Bloom Energy的燃料电池作为电力方案在法国贝蒂讷(Béthune)的园区更是直接复用了旧的普利司通轮胎工厂的基础设施。
当然,模块化也不是万能银弹,行业里也有不少质疑的声音。很多运营商和机电工程承包商就说模块化解决方案的可靠性还有待验证,万一工厂里做的模块到现场出了问题排查和修复可能反而更麻烦甚至可能把最初省下来的时间又赔进去还可能让珍贵的硬件面临风险。而且不是所有项目都适合模块化,小项目、定制化程度很高的项目模块化的规模效应就出不来反而可能更贵更慢。
但不管怎么说,大趋势已经很明确了。**SemiAnalysis追踪的80多家模块化相关玩家从上市公司维谛、施耐德、Flex、Comfort Systems、Sterling Infrastructure到私营公司Infra Partners、Bladeroom、Faith Technologies、Radiant整个生态正在快速成熟。所以我们今天聊的不只是一种新的施工方法,而是整个算力基础设施建设范式的转移,就像从手工造船到分段造船,从现场造汽车到流水线生产汽车。数据中心这个曾经高度定制化、依赖现场手工艺的行业正在不可逆转地走向工业化、标准化、工厂化。未来你看到的大多数AI数据中心都会是在工厂里制造在现场组装的乐高式积木,毕竟在这个所有人都在抢算力、抢时间的时代谁能更快把数据中心建起来谁就掌握了AI竞赛的入场券。感谢收看,我们下期再见。