发布时间:2026-08-06 已有: 位 网友关注
电池、发电机、冷却装置等AI计算设施的核心系统正因承受异常电力冲击而出现故障或提前报废。在xAI位于田纳西州孟菲斯的Colossus超算设施,燃气轮机已出现裂缝;英国多处规模较小的数据中心同样出现轮机开裂问题。部分已安装的稳压电池在高强度运行下,数周乃至数月内便需更换。
一位参与数据中心融资的知情人士透露,部分设施的实际运行时间已降至80%左右,远低于全年不间断运行的设计预期,若问题未能解决,未来12至24个月内将对相关项目投资者造成直接冲击。与此同时,北美电力可靠性公司今年早些时候发出罕见的三级警报,要求大型数据中心立即应对电网稳定性风险。
一个具体案例是:为确保微软要求的99.999%可靠性,Joulent Inc.与雪佛龙联合开发的德克萨斯州西部2.67吉瓦AI园区,不得不在工期中预留额外工程时间,供电启动时间因此从2027年推迟至2028年。Joulent首席执行官Chris James表示,这一调整正是为了应对电力波动带来的工程挑战。
施耐德电气电能质量专家、全球产品经理Sreemant Roy警告称,这类高度动态的负荷会导致电网不稳定,若不加以纠正,可能引发停电或断电。他特别指出,数据中心可能引发次同步振荡,损坏电网其他节点的连接设备,这已令全球电力公司深感忧虑。
据NERC去年9月的报告,在对美国逾33吉瓦在运数据中心的评估中,约四分之三的负荷模型不足以反映数据中心的动态行为。今年早些时候,NERC发出罕见的三级警报,要求大型数据中心于8月3日前提交应对方案。
英伟达表示,自2024年发布Blackwell GPU起,已加强与电力专家的合作。英伟达超大规模基础设施解决方案高级总监Dion Harris表示,公司正致力于在数据中心建设、设计、工程及电力输送各环节实现更平稳的部署。
运营层面,部分数据中心用户已采用侧边计算技术——运行不属于训练流程的虚拟计算任务,以维持GPU稳定运行、平滑用电波动。但批评者指出,这一方法在电力需求本已高涨之际造成了额外的电力浪费。
政策层面,美国能源部去年委托科罗拉多州丹佛附近的国家洛基山实验室建立测试平台,专门研究如何将AI安全接入电网。
NLR项目经理Martha Symko-Davies表示,该平台配备GPU和发电设备,供开发者测试其系统能否应对AI负荷的波动性,并将用于测试电池、软件及其他稳压设备。我们现在有机会把这件事做对,她说。