New Power Challenge for AI Data Centers: Frequent Damage to Critical Equipment from Power Fluctuations Tests Trillion-Dollar Investments

華爾街見聞
2026.08.06 07:43

AI 數據中心因 GPU 集羣毫秒級用電波動,導致電池、發電機等關鍵設備頻繁損毀,威脅設施可靠性。部分設施運行時間降至 80%,NERC 發出電網穩定性警報。這一隱蔽問題正考驗萬億美元投資,若未解決將對投資者造成直接衝擊。

AI 對電力的巨大需求早已人盡皆知,但一個更隱蔽、更棘手的問題正浮出水面:數據中心用電量的劇烈波動正在損毀關鍵設備,威脅設施可靠性,並向整個電網輸出不穩定風險。

據彭博 8 月 6 日報道,電池、發電機、冷卻裝置等 AI 計算設施的核心繫統正因承受異常電力衝擊而出現故障或提前報廢。在 xAI 位於田納西州孟菲斯的 Colossus 超算設施,燃氣輪機已出現裂縫;英國多處規模較小的數據中心同樣出現輪機開裂問題。部分已安裝的穩壓電池在高強度運行下,數週乃至數月內便需更換。

這一問題的市場影響正在顯現。據報道,一位參與數據中心融資的知情人士透露,部分設施的實際運行時間已降至 80% 左右,遠低於全年不間斷運行的設計預期,若問題未能解決,未來 12 至 24 個月內將對相關項目投資者造成直接衝擊。與此同時,北美電力可靠性公司(NERC)今年早些時候發出罕見的三級警報,要求大型數據中心立即應對電網穩定性風險。

電力波動的根源:GPU 集羣的"毫秒級"衝擊

AI 數據中心的用電模式與傳統數據中心存在本質差異。傳統設施的用電量相對平穩,而 AI 計算——尤其是模型訓練階段——會驅動數十萬塊 GPU 同步啓停,用電量在毫秒級時間內大幅躍升或驟降。

Mainspring Energy Inc.創始人兼總裁 Shannon Miller 將這一現象形象地描述為:一座相當於波士頓規模的 1 吉瓦數據中心,其中一半的用電量可能每隔數秒便閃爍開關。而德克薩斯州和美國中西部規劃中的部分 AI 園區規模超過 5 吉瓦,平均用電量接近紐約市全市水平。

前特斯拉高管、Heron Power Electronics Co.創始人 Drew Baglino 指出,AI 數據中心的瞬時用電量有時會飆升至設計容量的 50% 以上——"一座 1 吉瓦的設施可能在瞬間消耗 1.5 吉瓦"。其公司正為英偉達預計於 2027 年推出的下一代服務器開發電力波動管理設備。

Uptime Institute 英國首席顧問 Amber Villegas-Williamson 將這種衝擊比作駕車時反覆猛踩油門:

"就像不斷超速運轉發動機,比勻速行駛磨損快得多。"

設備損毀已成現實:從裂縫到電弧閃絡

據彭博採訪的逾三十位美歐電力專業人士,AI 數據中心對物理設備造成的壓力已有目共睹。

報道稱,多位知情人士表示,數據中心所用小型天然氣內燃機的曲軸已出現斷裂。xAI 的 Colossus 設施中,燃氣輪機出現裂縫,運營方隨後安裝電池以平滑電力波動、減輕輪機負荷。GeoPura Ltd.首席執行官 Andrew Cunningham 亦證實,英國多處規模較小的數據中心同樣出現輪機開裂問題。

UL Solutions Inc.首席執行官 Jennifer Scanlon 指出,設備裂損或磨損可能引發電弧閃絡——即電流在導體間跳躍——進而損毀 AI 芯片。

Uptime Institute 及多位業內人士表示,為穩壓而安裝的電池有時在數週乃至數月內便需更換。電池、電容器、變壓器、飛輪等穩壓設備雖已存在,但在搶速建設 AI 算力的浪潮中,新建數據中心對這些技術的部署明顯不足。

值得注意的是,這一問題遍及全球,從中東、非洲到歐洲和美國均有出現。

可靠性下滑直擊營收:每分鐘損失可達數十萬美元

設備損毀帶來的直接後果是設施停機,而停機的代價極為高昂。

Switch 數據中心首席戰略官 Jason Hoffman 表示,關鍵設備提前損毀的財務代價,"主要不是更換一個泵或斷路器的成本,而是昂貴算力資產因離線而無法創造收入的損失"。據估算,停機造成的收入損失從每分鐘數千美元到數十萬美元不等,因設施類型和工作負載而異。

據報道,一個具體案例是:為確保微軟要求的 99.999% 可靠性,Joulent Inc.與雪佛龍聯合開發的德克薩斯州西部 2.67 吉瓦 AI 園區,不得不在工期中預留額外工程時間,供電啓動時間因此從 2027 年推遲至 2028 年。Joulent 首席執行官 Chris James 表示,這一調整正是為了應對電力波動帶來的工程挑戰。

報道稱,據一位參與數據中心融資的知情人士透露,行業普遍假設設施上線後將全年不間斷運行,但現實中部分設施的實際運行率已接近 80%。若問題無法解決,未來 12 至 24 個月內將對相關項目投資者產生實質衝擊。

分析指出,超大規模雲廠商數千億美元的資本開支已令投資者和貸款方神經緊繃。設備損毀加速折舊的問題,與此前市場對 GPU 機架折舊速度的質疑相互疊加,令外界對 AI 數據中心能否兑現其盈利承諾產生更深層的疑慮。

即便數分鐘的停機,也會直接侵蝕數據中心開發商的營收。而若實際運行率長期低於預期,項目的財務模型將面臨根本性重估。在 AI 基礎設施投資熱潮尚未退温之際,這一結構性風險正成為投資者不得不正視的新變量。

電網穩定性告急:監管機構發出罕見警報

值得注意的是,AI 數據中心的電力波動不僅威脅設施自身,還向更廣泛的電網輸出不穩定性。

據報道,施耐德電氣電能質量專家、全球產品經理 Sreemant Roy 警告稱,這類高度動態的負荷"會導致電網不穩定,若不加以糾正,可能引發停電或斷電"。他特別指出,數據中心可能引發次同步振盪,損壞電網其他節點的連接設備,"這已令全球電力公司深感憂慮"。

監管層面,NERC 在過去兩年內多次發出警告,將數據中心列為電網穩定性的最大風險之一。

據 NERC 去年 9 月的報告,在對美國逾 33 吉瓦在運數據中心的評估中,約四分之三的負荷模型"不足以反映數據中心的動態行為"。今年早些時候,NERC 發出罕見的三級警報,要求大型數據中心於 8 月 3 日前提交應對方案。

面對上述挑戰,產業鏈各環節正積極尋求解決方案。

英偉達表示,自 2024 年發佈 Blackwell GPU 起,已加強與電力專家的合作。英偉達超大規模基礎設施解決方案高級總監 Dion Harris 表示,公司正致力於在數據中心建設、設計、工程及電力輸送各環節實現更平穩的部署。

運營層面,部分數據中心用户已採用"側邊計算"技術——運行不屬於訓練流程的虛擬計算任務,以維持 GPU 穩定運行、平滑用電波動。但批評者指出,這一方法在電力需求本已高漲之際造成了額外的電力浪費。

政策層面,美國能源部去年委託科羅拉多州丹佛附近的國家洛基山實驗室(NLR)建立測試平台,專門研究如何將 AI 安全接入電網。

NLR 項目經理 Martha Symko-Davies 表示,該平台配備 GPU 和發電設備,供開發者測試其系統能否應對 AI 負荷的波動性,並將用於測試電池、軟件及其他穩壓設備。"我們現在有機會把這件事做對,"她説。

風險提示及免責條款

市場有風險,投資需謹慎。本文不構成個人投資建議,也未考慮到個別用户特殊的投資目標、財務狀況或需要。用户應考慮本文中的任何意見、觀點或結論是否符合其特定狀況。據此投資,責任自負。