AI也怕熱?伺服器愈跑愈燙 資料中心為何開始改用液冷

中央社/
2 小時前

(中央社財經訊息服務20260827 16:49:07)AI再聰明,也得先想辦法不要過熱。企業把更多GPU放進IDC機房跑影音辨識、生成式AI或資料分析後,最先碰到的可能不是模型問題,而是機櫃太熱、電力不夠,原有空調也吹不動。

國際能源總署(IEA)2025年資料指出,伺服器平均約占現代資料中心用電量的60%;冷卻與環境控制則依機房效率不同,約占7%至30%以上。AI加速高效能伺服器部署,也讓單一機櫃需要供應及帶走的熱量持續增加。白話來說,GPU買得到,不代表既有機房放得下、供得起,也冷得下來。

過去常見的氣冷,是用冷空氣及冷熱走道的配置,帶走設備熱量;液冷則把冷卻液送到機櫃、設備內部或發熱元件附近。液體帶走熱量的方式更適合高熱密度設備,但需要搭配機房機櫃整體管線、冷卻分配、環境監控及維修流程,並非把空調換掉就完成。

評估AI算力進機房時,可先看4件事:

一、不要只看整間機房平均用電,要確認GPU集中後,單一機櫃的供電與散熱上限。

二、電力與冷卻要一起算。電有餘裕,但熱排不出去,設備仍可能降速或停機。

三、先確認既有伺服器支援哪種冷卻方式。ASHRAE指出,除全浸沒式液冷外,資料中心通常仍需支援氣冷與液冷並存。

四、故障流程要先排好。溫度異常時誰收到通知、工作負載是否轉移、維修時能否不中斷服務,都要在上線前確認。

Cloudmax匯智曾在一項影音平台專案中,處理大量語音與影像推論的尖峰負載。團隊在IDC建置專屬AI推論節點,採8kW高密度機櫃、2N A/B雙路供電及資料中心級環控;節點實測功耗為2.38kW,並保留70%電力與散熱餘裕。專案記錄顯示,處理吞吐提升300%,上架時程由天級縮短至小時級。

第一線經驗顯示,氣冷或液冷,其實沒有單一標準答案。較實際的做法,是先盤點GPU功耗、機櫃密度、供電路徑及未來擴充量,再決定哪些區域維持氣冷、哪些高密度節點需要液冷。AI算力要跑得久,先確認機房能不能把熱帶走。

關於Cloudmax匯智 Cloudmax匯智提供企業雲端、IDC機房、網路、資安與AI基礎設施相關服務,協助企業依工作負載規畫電力、散熱、連線及維運環境。

第三方資料來源: International Energy Agency(IEA),https://www.iea.org/reports/energy-and-ai/energy-demand-from-ai ASHRAE,https://handbook.ashrae.org/Handbooks/A23/SI/A23_Ch20/a23_ch20_si.aspx

圖片來源:Cloudmax 匯智/AI生成

採用氣冷或液冷,較實際的做法,是先盤點GPU功耗、機櫃密度、供電路徑及未來擴充量,氣冷與液冷的區域便可彈性配置。AI算力要跑得久,先確認機房能不能把熱帶走。