正在改寫的備援採購清單:微軟把整棟GPU機房的發電機和不斷電系統拆掉了,且寫上官網
微軟官方部落格白紙黑字寫下 Fairwater 亞特蘭大的 GPU 機群可以省略現地發電、不斷電系統與雙路供電,設計目標是四個 9 的可用度用三個 9 的成本達成。SemiAnalysis 把同樣的設計量化成追蹤中的 15GW 以上容量。這篇拆開三件事:備援被拿掉的到底是哪一層、同一家微軟為什麼在另一個州買 864 台引擎、以及這張採購清單重排之後錢流去哪裡。
本系列前十四篇有大半在問同一個問題:電從哪裡來。燃氣機組排到 2030 年、變壓器交期以年計、併網排隊六年起跳,這條線從 5 月中追到現在、將近三個月。現在有一份微軟自己貼在官網上的設計文件,把問題換了一個方向。電進來以後,那套從機房誕生第一天就存在的備援設備,還在不在。答案是有一整棟 GPU 機房,它不在了。
微軟自己寫下來的那句話
先看原文。微軟在 2025 年 11 月 12 日的官方部落格裡描述 Fairwater 亞特蘭大園區的電力設計,寫的是這一句:
we can also forgo traditional resiliency approaches for the GPU fleet (such as on-site generation, UPS systems and dual-corded distribution)
中文直譯:我們也可以對 GPU 機群省去傳統的韌性做法,例如現地發電、不斷電系統以及雙路供電。
同一篇文章給了這個決定的前提與目標:
The Atlanta site was selected with resilient utility power in mind and is capable of achieving 4×9 availability at 3×9 cost
中文直譯:亞特蘭大這個場址在選址時就把韌性市電納入考量,能夠以三個 9 的成本達成四個 9 的可用度。
這三樣東西被點名拿掉,各自都是機房電氣系統的主結構。現地發電指的是柴油或燃氣發電機組,機房停電時它負責在幾十秒內接手。不斷電系統俗稱 UPS,是介於市電與機櫃之間的那一層儲能與整流設備,負責填補市電中斷到發電機起動之間的空窗。雙路供電則是把每一台設備接到兩條獨立的供電路徑,任何單一路徑故障都不影響運轉。通用雲端機房的可用度承諾靠的就是這三層疊起來;微軟這次把目標寫成四個 9,等於明講 GPU 機群不需要通用雲端那一級。
拿掉之後不是什麼都沒有。微軟在同一篇文章裡描述了電網穩定度的處理方式,三段並行:軟體端在負載低谷插入補充工作負載,讓機房對電網的取電曲線平緩一點;硬體端由 GPU 自行執行功率上限,避免瞬間尖峰;再加上一套現地儲能方案。第三段是關鍵,電池留下來了。
所以這件事的正確描述是:發電機拿掉、中央不斷電系統拿掉、雙路供電拿掉,儲能留下。備援被重新配置,而不是被取消。 後面所有推論都建立在「留下的那一層是什麼」上面。
Fairwater 亞特蘭大是微軟第二座 Fairwater,2025 年 11 月上線,機櫃功率密度約 140kW、每列約 1,360kW。這個密度本身就說明了為什麼要重新想備援:每一列 1,360kW 的負載,用傳統中央不斷電系統去撐,設備體積、散熱與轉換損耗都會變成建置速度的敵人。
這份文件為什麼是現在才被大量討論
微軟的部落格是 2025 年 11 月的東西,但這個設計被當成產業現象討論,是 2026 年 8 月的事。中間差了將近九個月,差別在於樣本數。
2026 年 8 月 5 日,SemiAnalysis 的資料中心團隊公布他們的追蹤結果:目前追蹤到 15GW 以上的容量,屬於沒有發電機、沒有中央不斷電系統,或者兩者皆無。這個數字讓一份單一園區的設計文件變成一條產業趨勢線。
必須先說清楚這個數字的性質。15GW 這個量出自 SemiAnalysis 自家的產業模型,外部沒有可比對的公開統計,也沒有第二個機構做過同樣的普查。引用它的正確方式是掛名,寫成「SemiAnalysis 追蹤到 15GW 以上」,不可寫成產業統計。這一點在本篇後面的反方論點段會再處理一次。
同一份追蹤裡點名的清單包含四個對象:微軟 Fairwater 的 GPU 機房完全無後備、發電機只留在網路核心;Anthropic 的機房設計同樣拿掉發電機;Meta 的兩座 AI 機房在衛星影像上看不到發電機;以及在 Colossus 部署的 Tesla Megapack。這四個對象的證據等級差很多,後面兩個要特別小心,本篇第三節會逐一拆。
為什麼是現在,而且為什麼是訓練機房先動
SemiAnalysis 在同一串貼文裡給了兩個理由,這兩個理由分屬完全不同的性質,混在一起讀會得到錯誤的結論。
第一個理由是技術性的:訓練任務靠持續檢查點機制,本來就容忍中斷。大型模型訓練會定期把模型參數與優化器狀態寫到儲存裝置,機房斷電後從最近一個檢查點續跑,損失的是幾十分鐘到幾小時的算力,不是整個訓練任務。這跟一個線上交易系統斷電十秒就要賠錢,是完全不同的可用度需求。
第二個理由是工期與成本的:砍掉發電機同時砍掉的是採購前置期、許可、試車以及多廠商合約。這四樣全部是時間的問題;SemiAnalysis 另外把資本支出節省單獨列為一項,跟這四樣並列而非重疊。發電機組要環保許可,柴油機組還牽涉排放與噪音的地方審查;試車要協調機組廠商、開關廠商與系統整合商;多廠商合約則意味著任何一家延遲都會拖住整個交付。
把這兩個理由放在一起,去備援的對象範圍就清楚了:它發生在訓練機房,不是發生在所有機房。 推論服務、企業雲端、金融與醫療客戶的工作負載,可用度需求沒有降低,那些機房的備援設備不會消失。
我的判斷
我把這件事讀成一體兩面,但重心放在技術性那一半。
被拿掉的是為通用雲端多租戶環境設計的冗餘。一座傳統機房要同時服務數千個彼此不相干的客戶,任何一個客戶都可能是那種斷電十秒就出事的應用,所以只能按最嚴格的那個客戶去設計,可用度承諾是被逼出來的下限。AI 訓練機房服務的是單一工作負載,而那個工作負載自己就內建容錯機制。用「壓低可靠度門檻」去描述這件事,對訓練機房是分類錯誤,需求本來就低一階,過去只是沒有專門為它設計的建築。
這條線要盯的是:這套拓撲有沒有外溢到推論機房。訓練負載容忍中斷,推論負載不容忍,如果哪一天出現推論為主的園區也開始拿掉中央不斷電系統,那才代表可靠度門檻真的被整體調低,那時候這個讀法要翻。反過來,只要去備援的樣本仍集中在訓練與大型叢集,這件事就是工程分工變細的結果,跟業者對回報有沒有信心是兩個獨立問題。
微軟自己的財務揭露支持這個讀法。FY26 第四季資本支出含融資租賃 410 億美元、年增 70%,其中約三分之二是中央處理器與繪圖處理器等短壽命資產。把單季 410 億美元的三分之二押在會被技術世代淘汰的東西上面,不是省成本的行為模式。省下來的發電機與不斷電系統,相對於這個量級是小數。
同一家微軟,兩座園區兩種拓撲
到這裡為止,故事聽起來像是一個乾淨的趨勢:業者開始不裝發電機了。但同一家微軟的另一個案子會把這個結論打散。
微軟簽了意向書,採購西維吉尼亞州「Mason County」的「Monarch Compute Campus」約 1.35 至 1.4GW 離網天然氣微電網電力,更大的方案是 2.16GW、864 台往復式引擎。開發商是「Nscale」,引擎點名 Caterpillar,搭配 NVIDIA Vera Rubin GPU,2027 年投產。這個案子選擇離網,直接繞過 PJM 六年以上的併網排隊。Caterpillar 那一端對應的是 2GW 的 G3516 快速反應天然氣發電機組,7 秒可達滿載。
所以同一家公司,在亞特蘭大的 GPU 機群一台發電機都不裝、依 SemiAnalysis 的追蹤只在網路核心留一組,在西維吉尼亞卻買 864 台引擎。
這兩件事不矛盾,因為決定拓撲的變數是場址的電網條件。亞特蘭大的市電被微軟評估為韌性足夠,足夠到可以把電網本身當成備援層,所以才寫得出「以三個 9 的成本達成四個 9 的可用度」。西維吉尼亞的難題在排隊,六年的併網等待等於這個案子在 2032 年前不用談,所以只能自己蓋電廠。
一個是把電網當備援,一個是把電網整個跳過。兩者的共同點是都拒絕了傳統那套「接市電、再疊發電機、再疊中央不斷電系統」的標準堆疊。
Colossus 那條要特別小心
SemiAnalysis 那串貼文的第三則,在點名清單的最後寫了一句:「Elon just parked 168 Megapacks at Colossus instead」,中文直譯是 Elon 剛在 Colossus 擺了 168 台 Megapack 取而代之。這句話有三個問題,寫進投資判斷之前必須拆開。




