「AI工厂」冷却标准之争:锁死的不是机架,是混凝土
数据中心改名「AI工厂」不是营销话术,而是一份规格书。标准尚未落定,建筑却已经按单一芯片商的热工与电力规格浇筑成型,转换成本已经从机柜转移到了地基里。
这十年最昂贵的一句话,是一次改名:「数据中心」退场,「AI工厂」登场。这个说法来自芯片行业本身。黄仁勋两年来一直把这类建筑描述成生产「智能」这种大宗商品的「AI工厂」,英伟达甚至以此为名发布了800伏直流电源架构。这个比喻应当被认真对待,因为它本质上是一份工程文件。数据中心是通用型厂房:标准机柜、标准供电、风冷散热,谁家的硬件都能上架,和别家的设备并排而立。工厂则是为单一产品线定制的专用厂房。一旦AI工厂冷却标准由卖芯片的公司说了算,建筑的角色就变了,它成了某个供应商的专属外设,背着一份十五年期的按揭。
追根溯源:为什么工厂不是数据中心
追根溯源。目前NVL72级别的机柜功耗已经普遍突破100千瓦,而厂商公布的路线图显示,2027年起的机柜功耗将逼近1兆瓦。作为参照,Uptime Institute的全球运营商调查发现,现役机柜的平均功耗大多不到10千瓦。这是一个数量级的跃升,风冷根本来不及把热量带走。于是行业转向芯片直接液冷:硅片上贴冷板,机列里放冷却液分配单元,地板下埋歧管和快速接头。供电侧,高压直流配电正在取代数据中心用了几十年的交流配电。
每一项选择单独看都合乎工程逻辑,问题在于它们叠加起来意味着什么。一栋按照单一厂商歧管几何形状、冷却液化学成分和电力规格浇筑的建筑,实际上已经预设了它未来十几年要伺候谁家的硬件。到那时想换供应商,做的就不是采购决策,而是土建工程。
同样值得用同样的机械论眼光审视的,是随之兜售的「节能」故事。厂商材料承诺大幅削减制冷用电,在特定条件下甚至可以做到「零用水」。也许如此。但别看新闻稿,去查电表读数:要独立核实的、你所在气候带、你实际负载下的设施级数据。厂商自己给自己的产品做的基准测试,不过是穿着实验室白大褂的营销文案。
AI工厂冷却标准,谁说了算?卖方
标准本该是资本进场前那段无聊却必要的铺垫。铁路轨距先吵出结果,路网才动工,押错轨距的一方事后为这个教训买单。到了AI工厂这里,顺序反过来了:接口、电压、冷却液拓扑都还没定型,混凝土已经在浇。标准未定就先砸钱,等于白白放弃了一个本可以议价的期权,自己却毫无察觉。
留意这支笔握在谁手里。英伟达和同行都在力推自家的冷却与电力标准,而最有动机让接口保持专有的,恰恰是靠这种依赖关系赚钱的公司。互操作性对买方是优点,对卖方是缺陷,指望卖方主动去做标准化,就像指望赌场自己在门口把赔率贴出来。
但制衡力量确实存在,而且比「锁定论」承认的更成熟。开放计算项目(Open Compute Project, OCP)发布了开放式机架与液冷规格,包括盲插式快速接头和共享歧管;2024年,英伟达自己就把GB200 NVL72系统的机架设计贡献给了这个项目。这恰好从反面证明了论点:买方一旦握有议价筹码并主动要求,卖方就会开放接口。自愿的慷慨不是采购策略,有据可查的议价筹码才是。
资金已经流动
在模型这一层,支票金额已经骇人。据《华尔街日报》的报道,OpenAI已同意从2027年起的五年内向甲骨文支付3000亿美元采购算力基础设施,这一数字尚未获两家公司公开证实。无论最终数字是否精确落地,方向已经很清楚:巨额、长周期的实体承诺,现在就要签字。
能源预测也跟着水涨船高。国际能源署预计,全球数据中心用电量将从2024年的约4150亿千瓦时,翻倍增长到2030年的约9450亿千瓦时,AI是最大的推手;其署长法提赫·比罗尔如今称AI是「当今能源界最重要的故事之一」。这种量级的电力需求,不是租约里能靠假设一笔带过的舍入误差。
而在应用这一层,回报却没跟上。埃森哲自己的报告也承认AI价值兑现不及预期,除了少数数字原生企业,大多数企业的采用速度依然迟缓。两相对照,失衡一目了然:资本已经押在物理层,赌的是价值会在应用层兑现。如果后者落后于前者,留下的就只有这堆管线。
液冷AI数据中心能改造吗?
这是每一位设施总监该在签字前问、而不是签字后才想起来问的问题。技术上,几乎什么都能改造。经济上,答案通常是不能。你得加固地板、重新布设冷却回路、加装分配单元、重新谈保修和保险条款,而且这一切都要绕着还在运行的设备进行。密度差距让这项工程比看上去更庞大:从不到10千瓦的机房跳到100千瓦以上的机列,是土建工程,不是周末换根管子的活。当初建造时如果就按单一厂商的几何规格设计,改造账单往往逼近新建的造价。
这就是所谓的「搁浅资产」:一栋还能运转的建筑,但它下一段生命周期的成本,已经高过它能带来的回报。
同样的逻辑适用于电力系统。今天押注800伏直流方案,赌的是2029年行业在电压和接口上的选择还长这样。押对了,你显得有先见之明。押错了,你拥有的就是一座效率极高的博物馆。
热量去哪儿了?
余热回收是真实的工程学。液冷能捕获温度足够高、可用于区域供暖或温室的热量,这也是宣传册里总爱展示服务器机房为居民小区供暖的原因。
问题在于地理位置。回收需要在管道可达范围内有热量消纳方,而多数市场的规划规则把大型数据中心推向产业园区或偏远地段,离能用上这些热量的住宅区很远。除非规划部门把这类设施当成热力公用事业单位、而不是仓库来对待,否则多数余热回收方案只会停留在宣传册里。
德国的做法展示了政策不再等待时会发生什么。其《能效法》(Energieeffizienzgesetz)规定,自2026年7月起,新建数据中心的电能利用效率(PUE)上限为1.2,并要求运营商逐步提高余热回收比例,从投运时的10%提高到2028年的20%。在已有区域供暖网络的地方,这只是一项合规任务;在没有的地方,这项强制要求本身会创造出热力需求,原先图便宜选在产业园区的算盘顿时显得代价高昂。可以预见其他政府会效仿这一机制。
设备更新周期则从另一个方向拉大了这种错配。加速卡每隔几年就要更新换代,而建筑的折旧周期是十五年,由此产生的电子废弃物,至今在任何地方都缺乏像样的政策框架。每一次硬件更新换代,都在把一笔环境负债记到了「无人」的账上。没有监管介入,这笔负债只会悄悄累积,不会永远无人定价。
反方论证:密度是真实存在的问题
现在轮到用同样的标准检验我自己的论点。这类锁定有一部分确实纯粹是物理规律使然。在机架密度的最高端,不需要任何厂商的算盘,液冷都是唯一能带走那些热量的方式。签下十年期协议的超大规模云厂商,能承受足以拖垮一家中型企业的搁浅资产风险,对它们而言,专有设备是一笔有资产负债表托底的、算计过的赌注。这项技术本身不该因此被怀疑。真正的陷阱,是资产负债表撑不起同等风险的中下游企业,照搬同一套架构,签下比里面芯片寿命还长的租约。
如何购买选择权
以上都不是反对建设的理由,而是主张带着退路去建设。资本动用前,做四项测试。第一,要求供应商提供开放、公开发布的快速接头、歧管和电源接口标准;开放计算项目的规格是现成的对标基准。第二,趁自己还有议价能力时,把改造权和重新配电权写进租约和保修条款。第三,让资本投入跟着实测回报走,而不是跟着预测走,这正是先谈AI就绪、再谈建设背后的纪律。第四,把建筑决策和芯片决策分开做,它们的更新周期完全不同。
给这些选择权定价,正是一份像样的技术战略该做的事:在你把退出权卖掉之前,先算清楚它值多少钱。而在回报这一端,真正兑现价值的,是那些在人为可控的前提下务实使用AI的组织,而不是那些为囤积算力而囤积算力的组织。
由卖方书写的标准,是一座贴着规格书的收费站。行业爱把这些建筑叫作工厂,随它去。只要确保被制造出来的,是你的利润,而不是你的依赖。
编辑:乔纳森·泰勒。
常见问题
什么是AI工厂冷却标准中的「供应商锁定」?
这里的锁定是物理层面的,而非合同层面的。当一座设施的冷却回路、歧管几何形状和电力配送都是围绕单一供应商的硬件设计时,更换供应商意味着重建整套设备,而不是简单地更换服务器。转换成本从便宜的机柜层面,转移到了昂贵的建筑主体层面。买方可以在动工前坚持要求采用开放、公开发布的接口规格来降低这种风险;开放计算项目目前发布的机架与液冷规格是现成的对标基准。
把数据中心改造成液冷需要多少钱?
目前没有可靠的、放之四海而皆准的行业数字,因为账单取决于地板承重、既有管线布局、供配电情况,以及现场能容忍多长的停机时间。但成本的构成是一致的:土建工程和冷却液分配系统占大头。运营商调查显示,现役机房的机柜平均功耗大多远低于10千瓦,因此转向100千瓦以上的液冷机列是数量级的跃升;当初建造时若已按单一厂商的几何规格设计,改造预算往往会逼近新建造价。要在最初建造前就把改造成本算清楚,而不是等到签完约再算。
企业应该自建AI基础设施,还是租用超大规模云厂商的算力?
承诺的强度要匹配负载的确定性。租用适合实验性的、需求波动大的场景,因为搁浅资产的风险由超大规模云厂商承担。只有当负载持续、可预测,并且已有实测回报支撑时,自建或长租才说得通。常见的错误,是仅凭尚未被观测到的预期价值,就签下长达十年的实体承诺。应先分阶段投入资本,让应用层先证明自己。
相关阅读
本文由 Abyshire 专有编辑系统的 AI 编辑角色撰写,并经我们的团队审核。