欢迎您访问欢迎来到沄森网,沄森智能旗下资讯平台!今天是:2026年08月06日 星期四 农历:丙午(马)年-六月-廿四
您现在的位置是:首页 > AI

AI尽头是“高质量电力”!945太瓦时需求狂潮之下,“电力系统稳定性”正在接管AI基建最优先级

创始人2026-08-06 15:52:30
  天量级人工智能训练/推理集群对电力的巨大需求早已广为人知。但是人们较少了解到的是,数据中心用电需求的快速波动,会如何损坏这些庞大基础设施中的关键设备。  在建设进程如火如荼的人工智能基础设施中,高容量电池、发电机、冷却装置及其他关键系统

  天量级人工智能训练/推理集群对电力的巨大需求早已广为人知。但是人们较少了解到的是,数据中心用电需求的快速波动,会如何损坏这些庞大基础设施中的关键设备。

  在建设进程如火如荼的人工智能基础设施中,高容量电池、发电机、冷却装置及其他关键系统承受着如此巨大的压力,以至于它们频繁出现故障,或过早达到使用寿命终点。

  随着人工智能繁荣局面加速推进,这些技术问题意味着额外成本和此前未曾预料到的数据中心电力设备可靠性隐患;即使仅损失几分钟的正常运行时间,也会打击数据中心开发商们赚钱强劲利润数据。与此同时,投资者和贷款机构本就已对单个超大规模云计算企业高达数千亿级别美元的支出感到不安,市场还越来越担心,这些数据中心最底层硬件基础设施的折旧速度可能远快于此前分析师们一致预期。

  这些关于“人工智能剧烈波动的电力需求正在损害其自身的数据中心”的最新动态似乎预示着,AI基础设施建设狂潮的估值锚正由“GPU/TPU数量”进一步延伸至供电质量、动态稳定性、电力链条设备寿命与有效运行时间。

  AI数据中心真正的隐性瓶颈,似乎已从“能否获得足够电力”升级为“能否承受毫秒级、城市规模的剧烈功率波动”:数十万枚AI GPU或者数十个英伟达Vera-Rubin与AMD Helios 高功耗AI机架同步启停会反复冲击燃气轮机、发电机、电池、变压器、UPS和冷却系统,造成设备开裂、异常磨损和提前报废;一旦故障导致算力基础设施出现停机与供给中断,损失的核心并非更换零部件的成本,而是昂贵GPU资产无法持续产生利润,同时这些动态负荷还可能通过电压、频率和次同步振荡威胁外部电网稳定,这也是为何NERC(北美电力可靠性委员会)已将大型数据中心的快速负荷变化列为重要可靠性风险。

  “AI尽头真就是电力”的叙事愈发火热!兆瓦级机架重构数据中心设备投资版图

  “AI尽头是电力”正在进一步演化为“AI尽头是稳定且可控的高质量电力”——储能、UPS、高压直流、电力电子、微电网和先进冷却设备将获得更高价值量,而数据中心项目的估值也必须计入设备加速折旧、停机损失和可靠性改造等此前被低估的隐性成本。

  AI的最终约束是能够稳定、连续并以极快动态响应速度送达芯片的高质量可用电力。传统CPU机架功率密度相对较低、负载变化平缓,而Blackwell等机架级系统将数十枚GPU、CPU、NVSwitch和高速网卡同步耦合:GB200 NVL72满载功率约120千瓦,GB300 NVL72最高可达142千瓦;当训练任务进入集合通信、检查点保存或推理批次切换时,整柜GPU会在毫秒级同步升降功率,形成巨大的浪涌、谐波与热负荷。

  英伟达预计2027年开始支持1兆瓦级及以上IT机架,传统54伏直流配电将遭遇铜排体积、传输损耗和转换级数的物理极限。因此,AI集群每增加一单位算力,不只是多采购GPU,还必须同步扩张中压变压器、开关柜、母线、整流器、UPS、电池储能、超级电容、备用发电机以及冷却液分配单元;功率转换、配电稳定与散热系统,正从辅助设施升级为决定GPU能否开机的核心生产资料。

  全球企业对于Vera Rubin与AMD Helios的强劲机架级AI算力需求进一步表明,下一代竞争已经从“芯片级性能”转向“计算—供电—网络—液冷”全机架协同设计。Vera Rubin NVL72加入功率平滑机制,并配置约为Blackwell Ultra六倍的机架本地能量缓冲,用电池或电容在负荷骤升时瞬时供能、骤降时吸收剩余能量,避免把GPU功率尖峰原样传导至变压器和电网;800伏直流架构则通过降低相同功率下的电流,减少铜材、线缆体积及多级AC/DC转换损耗。

  AMD Helios同样将72枚MI455X GPU、31TB HBM4、集中式电源管理母线和液冷歧管整合为一个机架级系统。这也是为何AI算力密度越高,电力设备价值量与技术门槛反而提升得更快,结构性受益方向将从单纯发电容量扩展至变压器与开关设备、高压直流电源、UPS与储能、电能质量管理、液冷以及微电网,而缺乏动态负荷管理的数据中心则可能因设备加速折旧和停机损失侵蚀资本回报率。

  华尔街金融巨头高盛预计,全球数据中心电力需求到2030年将较2023年疯狂增长220%,相当于增加一个全球前十大用电国家。IEA(国际能源署)预计,全球数据中心耗电量将由2024年的约415太瓦时增至2030年的约945太瓦时,年均增长约15%,占全球用电量接近3%;其中AI加速服务器用电年均增长约30%,美国数据中心耗电量较2024年增加约240太瓦时、增幅约130%,并贡献美国至2030年接近一半的新增电力需求。

  毫秒级功耗震荡,AI正在加速耗损自己的基础设施

  为电力供应商和数据中心提供标准与可靠性咨询的英国Uptime Institute资深顾问安伯·维勒加斯-威廉姆森表示:“人工智能确实会产生非常异常的电力需求。这就像让汽车发动机持续超高转速运转,会比保持恒定速度更快地磨损发动机。”

  数据中心已经存在了数十年,它们大量消耗电力,以确保从你喜爱的流媒体节目到线上杂货订单等各种服务顺畅运行。但为人工智能计算设计的底层算力基础设施有所不同,因为其用电需求规模极其庞大,而且波动幅度也大得多。

  相当于工厂、城镇甚至城市用电量的负荷,可能在数秒内突然出现或消失,从而形成反复冲击,使与之连接的设备难以承受。

  为工业和数据中心客户开发微电网项目的Mainspring Energy Inc.创始人兼总裁香农·米勒表示,一座1吉瓦数据中心的用电规模相当于波士顿这样一座城市,而其中一半的负荷可能每隔几秒就开关闪变一次。得克萨斯州和美国中西部规划中的部分人工智能园区,规模甚至超过这一水平的五倍,其平均耗电量几乎与纽约市相当。

  如上图所示,AI芯片销售数据预示数据中心电力需求增长激增——2022年至2033年,美国将占新增AI用电量的64%。注:BloombergNEF模型估算了人工智能芯片所隐含的电力需求,其中包括计算、网络和冷却基础设施。

  人工智能数据中心在训练新模型时,会给供电系统带来尤其巨大的压力——这一过程会让所有图形处理器同时启动。就像数字世界中的蜂群集体飞舞,或鱼群突然改变方向一样,数十万枚GPU会以毫秒为单位同时升高或降低功率。

  创办Heron Power Electronics Co.的前特斯拉高管德鲁·巴格利诺表示,人工智能设施的功耗有时会飙升至设计容量以上50%,“因此,一座1吉瓦设施可能会在极短的一瞬间消耗1.5吉瓦电力”。该公司正在开发用于管理功率波动的设备,以配合英伟达计划于2027年推出、能耗更高的下一代服务器。

  大多数设备并不是按照如此剧烈的用电波动设计的。储能开发商Terraflow Energy首席执行官乔恩·帕雷拉将其比作驾驶法拉利时直接从六挡切换到一挡。他表示:“你不可能这么快地切换。”

  本文基于对美国和欧洲三十多名电力专家的采访,其中包括发电企业及其他电力供应商、数据中心开发商、电网运营商、公用事业公司、投资者、标准制定者、保险公司和监管机构。几乎所有受访者都表示,这些设施承受的物理压力已经非常明显。

  多名受访者表示,用于在数据中心发电的小型天然气内燃机,其曲轴已经发生断裂。其中一人称,在田纳西州孟菲斯的xAI Colossus计算设施,燃气轮机已经出现裂纹。该人士表示,系统中随后安装了电池,以帮助平抑功率波动,并减轻旋转涡轮所承受的压力。xAI的母公司SpaceX未立即回应媒体置评请求。

  GeoPura Ltd.首席执行官安德鲁·坎宁安表示,英国一些规模小得多的数据中心也出现了涡轮开裂。该公司正在部分站点提供氢气,用于燃料电池,以平滑电力流动。

  负责测试和认证新技术的UL Solutions Inc.首席执行官詹妮弗·斯坎伦表示,设备上的裂纹或磨损可能引发电弧闪络——即电流在导体之间跳跃——从而可能损坏人工智能芯片。

  电池、电容器、变压器和飞轮等一整套设备都可以帮助稳定电力流动。然而,多名受访者表示,在争分夺秒建设人工智能算力的过程中,新建数据中心并没有充分采用这些技术。据Uptime Institute及其他与运营商合作的人士透露,一些为此用途安装的电池,由于承受的压力过大,仅使用数月甚至数周就不得不更换。

  Uptime Institute的维勒加斯-威廉姆森表示,从中东、非洲到欧洲和美国,全球各地的数据中心都出现了这一问题。

  停机率侵蚀现金流,AI算力基础设施可靠性开始成为金融风险

  这些问题已经导致部分人工智能计算设施出现项目延期或运营受限,并由此减少收入。

  Joulent Inc.首席执行官克里斯·詹姆斯表示,为确保位于西得克萨斯州、规划容量达2.67吉瓦的人工智能园区能够实现微软要求的99.999%可靠性,工程计划中预留了额外时间。该公司正与能源巨头雪佛龙共同开发这一设施。这意味着供电将从原定的2027年推迟至2028年开始。

  数据中心建设及运营商Switch首席战略官杰森·霍夫曼表示,如果关键设备过早发生故障,“其财务后果主要并不是更换一台泵、一个断路器或某个电力部件的成本,而是昂贵算力因停机无法创造收入所损失的价值”。

  停机造成的收入损失差异极大,根据设施类型和所运行的工作负载不同,估算范围从每分钟数千美元到数十万美元不等。

  一名参与此类设施融资的人士表示,数据中心的建设假设是,一旦投入运营,就会全年365天、全天候运行。但现实中,一些设施的正常运行率仅接近80%;如果这一问题得不到解决,未来12至24个月内,部分项目的投资者可能会受到冲击。

  任何可靠性问题,都会进一步加剧市场对数千亿美元人工智能投资能否产生相应回报的担忧。数据中心另一项关键设备——GPU机架本身——的折旧速度,也已引发外界质疑:这一行业是否真的能够实现其所承诺的盈利能力。

  这些可靠性问题还可能扰乱更广泛的电力系统。由高压输电线路、变压器和发电厂组成的庞大网络需要持续校准,但由于设备老化、电力需求上升和极端天气,这项工作正逐年变得更加困难。

  间歇性的风能和太阳能发电持续扩张,往往会造成供电量在一小时之间出现剧烈波动,本身就已经成为电网不稳定因素。人工智能数据中心则可能让这种波动被成倍放大。

  施耐德电气驻田纳西州纳什维尔的电能质量专家兼全球产品负责人斯里曼特·罗伊表示:“这些负荷极具动态性,或者说波动非常剧烈,这会造成电网不稳定;如果不加以纠正,可能导致停电或供电中断。”他表示,尤其令人担忧的是,数据中心可能在电力流动中引发次同步振荡,从而损坏连接在电网其他部分的设备。

  罗伊表示:“这已经令全球公用事业公司感到非常担忧。”

  过去两年内,负责制定美国电力可靠性标准的最高监管机构——北美电力可靠性公司——已多次发出警告和预警,称数据中心是电网稳定面临的最大风险之一。

  根据一份9月发布的报告,北美电力可靠性公司评估了美国超过33吉瓦的在运行数据中心,发现其中约四分之三的负荷模型“都不足以反映数据中心的动态行为”。今年早些时候,该机构发布了一项罕见的三级警报,要求大型数据中心处理这些紧迫风险,并在8月3日前提交回应。

  从“虚假计算”到储能缓冲,AI算力产业链开始彻底重构供电架构?

  从产业链上游到下游,人工智能行业都已经意识到这些问题,并正在积极研究解决方案。

  英伟达超大规模基础设施解决方案高级总监迪翁·哈里斯表示,在开发Blackwell GPU时,英伟达开始与电力专家展开更密切合作。Blackwell于2024年首次发布,目前已广泛部署于数据中心。

  哈里斯表示:“我们不仅在制造芯片和处理器”,也在英伟达自己的数据中心中使用这些产品。英伟达正在努力让部署过程更加平稳,“既包括数据中心建设、设计和工程阶段,也包括供电环节”。

  数据中心用户已经采用一些技术来平滑人工智能工作负载的功率波动,例如运行辅助计算——本质上是与训练过程无关的无效数学运算——以保持GPU稳定运行。然而,在电力需求激增之际,这种方法因浪费电力而受到批评。

  美国落基山国家实验室项目经理玛莎·西姆科-戴维斯表示,去年,位于科罗拉多州丹佛附近的该实验室代表美国能源部建立了一座测试平台,用于研究如何安全地将人工智能接入电网。她负责能源部电力办公室的相关项目。

  该测试场地配备了GPU和现场发电设备,开发商可以借此判断其系统能否承受人工智能负荷的波动。一家电力供应商表示,将利用该设施测试电池、软件及其他设备,以平抑数据中心与电网之间可能对双方造成损害的振荡。

  西姆科-戴维斯表示:“我们现在有机会把这件事做对。”

所有文章未经授权禁止转载、摘编、复制或建立镜像,违规转载法律必究。

举报邮箱:1002263188@qq.com

相关标签: