传统数据中心给人的印象,是一排排伺服器、冷气机和备用电源组成的「大型机房」。但AI运算正在改写这个概念。国际能源署估计,全球数据中心用电量将由2025年的约485太瓦时,增至2030年的约950太瓦时,其中AI专用数据中心的用电增长更快。当一个园区的电力需求由数十兆瓦走向数百兆瓦,甚至以吉瓦规模规划,建设重点便不再只是放置多少伺服器,而是从哪里取得持续、稳定且价格可控的电力。
原因首先来自单位机架功率急升。以NVIDIA GB200 NVL72为例,一个液冷机架整合72枚GPU,耗电约120千瓦。若园区部署数千个高密度机架,用电量便可媲美重工业设施。这些负载不能直接接上普通商业楼宇电网,而要配置高压变电站、变压器、开关设备、母线、UPS、电池及后备发电机,并以多重供电路径确保任何一个环节故障时,价值数十亿美元的运算集群不会停机。
AI负载的特性也更接近工业生产。大型模型训练可以连续运行数星期,大量GPU同步工作,形成高而持续的基础负载;工作启动、停止或转换时,又可能造成明显功率变化。因此,营运商不只管理伺服器利用率,也要预测负载、控制电能质素、安排备用容量,甚至配合电网进行削峰或需求响应。
算力竞争已变成能源工程
每一兆瓦送进晶片的电力,最后几乎都会变成热。园区因而要以冷板、冷却液分配装置、水循环和冷却塔把热量排走,其工程逻辑与电厂处理蒸汽、冷却水及废热愈来愈相似。ASHRAE的AI数据中心框架亦把大规模供电、液体冷却、高速网络及建筑承重,视为高密度AI园区必须整合考虑的设计条件。
电力亦开始取代土地和光纤,成为选址的首要条件。国际能源署估计,输电线建设在先进经济体往往需时四至八年,变压器和电缆等设备的交货时间亦在拉长;若瓶颈未能解决,约两成规划中的数据中心项目可能延误。这意味一家AI公司的扩张速度,未必受制于能否买到GPU,反而可能取决于当地电网何时批准接驳。
这也解释了为何科技公司不再只向电力公司缴付电费,而是直接参与能源投资和长期采购。微软透过20年购电协议,承购美国一个重启核电机组约835兆瓦的发电量;亚马逊则投资小型模组化反应堆、地热、太阳能及储能。相关能源协议已接近过往大型工业企业锁定原材料供应的做法。这并不代表AI只能由核电供应,而是稳定的全天候能源,已成为算力交付能力的一部分。
当数据中心像电厂般规划,其商业模式也会改变。过去业界关注机房出租率和每个机架的月租,AI时代则更重视每兆瓦可以产生多少训练成果、推理请求或代币。晶片效率、电力使用效率指标PUE、冷却能耗、电价、设备利用率和停机时间,最终都会反映于「每个代币的能源成本」。营运商还可能把部分非紧急运算移到电力较便宜、再生能源较充裕的时段,令运算调度与电力市场逐步连接。
这种转变亦带来新的投资机会和风险。变压器、开关设备、输配电、燃气轮机、核电、储能、液冷及能源管理软件,都可能成为AI基建的受益环节;但若电网扩建成本最终转嫁居民,或企业高估AI需求,庞大的专用供电设施也可能变成搁置资产。政府因而需要厘清接驳费、备用容量、碳排放和用水责任,避免算力竞赛挤压其他产业和民生用电。
AI数据中心当然不是传统意义上的发电厂,因为它主要消耗而非生产电力。然而在工程规模、资本开支、监管要求和营运风险上,它已是一座以电力为原料、以算力为产品、以热力为副产物的工业设施。伺服器仍然重要,但真正决定项目能否落地的,往往已不是GPU何时到货,而是那几百兆瓦的电从哪里来。
义合控股投资者关系部
(芯片与算力系列之89)
$Constellation Energy Corp(CEG)$ $NextEra(NEE)$ $Entergy(ETR)$ $Duke(DUK)$ $NVIDIA(NVDA)$
精彩评论