一根电线下垂暴露数据中心电网问题

本周华盛顿特区外一条输电线路故障,引发美国最大电网运营商PJM上一次严重扰动。事件始末与行业启示如下:

故障线路跳闸后,北弗吉尼亚州的数据中心集群在约30秒内同步切断了总计3.1吉瓦的负载,导致PJM电网电压从北弗吉尼亚到芝加哥全线骤升。虽然未造成大停电,但导致区域灯光闪烁。根据Ting Labs的物联网传感器数据,电网经历了约11分钟才恢复稳定。这起事件中,断连的数据中心负载约占PJM当时总需求的3%。专家指出,电网要求供需近乎完美平衡,微小的比例波动即可触发连锁过载保护,而数据中心的同步行动将初始问题放大了。

PJM是覆盖美国67百万用户的超大规模电网运营商。本次事件已是2024年类似事故的加倍重现——当时60座数据中心同时断连,拉走1.5吉瓦负载。Synapse Energy Economics数据显示,目前数据中心占PJM负载约6%,预计到2040年将升至24%。如不解决,后果可能更严重。

核心问题在于:大多数数据中心响应速度极快,在检测到电压波动时均选择瞬间切断负载并切换至备用电源。这种同步决策对电网是灾难性的,因为大量负载同时消失会导致供给过剩。独立电力系统运营商高级市场模型专家Ali Zain Banatwala指出,需设计机制让相邻数据中心按序断开或重连,而非同时行动。

应对方案之一来自初创公司ON.Energy。其产品本质是为整个数据中心园区构建一个“电力缓冲层”:在数据中心与电网之间部署大型电池组和精密电力转换设备,使电网看到的始终是一个平稳、可控的负载。这套系统既能吸收电网波动(多余电力充电,缺电时放电),也能在不扰动电网的前提下调节计算负载(含AI训练)。ON.Energy CTO Ricardo de Azevedo透露,公司目前正在四个数据中心园区安装总计3吉瓦容量的系统。

监管层面亦开始行动:ERCOT(德州电网运营商)正计划强制要求数据中心等大型负载具备故障穿越能力,即能吸收扰动而非直接脱网。

本次事件是典型基础设施容量扩张滞后于AI计算增长的警示案例。数据中心与电网的交互机制必须从“安全切断”转向“韧性吸收”,否则单一线路故障可能引发系统性风险。

One fallen power line exposed a growing AI data center problem. Here's how to fix it. | TechCrunch

查看原文