AI伺服器熱到吹風扇沒用,改走「水路」後壓力錶要裝在哪?
核心提示: AI 伺服器單卡耗電量已突破 500W,液冷系統成必然趨勢。但從氣冷升級到液冷時,壓力錶安裝位置決定了你能不能及時發現故障。本文完整解析 GPU → 冷板 → CDU → 循環水路,告訴你壓力錶該裝在哪 5 個關鍵位置,幫助你避免高達 NT$2,000,000+ 的停機損失。
第一章:AI 伺服器散熱危機 — 為什麼氣冷已經無法勝任
1.1 從 GPU 發展看散熱需求的爆炸性增長
在過去 5 年內,GPU 的性能和功耗呈現指數級增長。讓我們看看具體數據:
| GPU 型號 | 發佈年份 | 單卡功耗 (W) | 記憶體 | 尖峰運算能力 (TFLOPS) |
|---|---|---|---|---|
| NVIDIA V100 | 2017 | 250 | 32GB | 31.4 |
| NVIDIA A100 | 2020 | 350 | 80GB | 312 |
| NVIDIA H100 | 2023 | 700 | 80GB | 1,979 |
| NVIDIA GB200 NVL | 2024 | 1,457 | 192GB | 5,457 |
從 V100 到 H100 的 7 年間,單卡功耗增長了 2.8 倍。更驚人的是,GB200 時代即將來臨,功耗將逼近 1.5kW 單卡。
💥 機架級功耗爆炸:
- 8 張 H100 機架:5,600W(是風冷系統設計上限的 50%)
- 8 張 GB200 機架:11,656W(完全超出風冷機房的能力)
- 典型資料中心機房:設計冷卻容量僅 10~15kW/機架
- 結果:一個 8 機架的 AI 訓練集群無法用風冷供電
1.2 風冷系統的物理極限
風冷散熱依靠空氣的熱容量。但空氣的散熱效能遠不如液體。讓我們看看熱物理常數:
| 介質 | 比熱容 (J/kg·K) | 導熱係數 (W/m·K) | 散熱效率相對比 |
|---|---|---|---|
| 空氣 (20°C) | 1,006 | 0.026 | 1x (基準) |
| 水 (20°C) | 4,186 | 0.6 | 23x |
| 油基冷卻液 (20°C) | 2,100 | 0.15 | 12x |
簡單說,水的比熱容是空氣的 4 倍,導熱係數是空氣的 23 倍。這意味著液冷系統能用 遠少得多的流量帶走同樣的熱量。
風冷系統實際面臨的困境
- 溫度無法控制:機房進氣溫度 28°C,GPU 核心溫度 78~85°C,已接近或超過安全上限 85°C
- 自動降頻損失:GPU 在 80°C 以上自動降頻 15~30%,計算性能下降,訓練時間延長
- 冷卻成本爆炸:PUE (Power Usage Effectiveness) 高達 2.5~3.0,即冷卻消耗的電力等於計算電力的 150~200%
- 空間浪費:為了控制溫度,風冷機房通常不能滿裝機架,空間利用率只有 50~60%
- 停機風險:機房冷卻系統故障或冷卻能力不足,整個集群直接熱當機(無預警)
因此,從 2023 年開始,所有超過 8 張 H100 的集群都被迫轉向液冷。這不是一個「可選項」,而是 AI 時代的必然趨勢。
1.3 液冷系統為何是唯一出路
液冷直接在熱源處(冷板)冷卻,具有以下優勢:
| 指標 | 風冷系統 | 液冷系統 | 改善幅度 |
|---|---|---|---|
| GPU 核心溫度 | 75~85°C | 45~55°C | ↓ 30~40°C |
| 冷卻機房 PUE | 2.5~3.0 | 1.2~1.4 | ↓ 50% |
| 冷卻電費 (年) | NT$9,600,000 | NT$2,400,000 | ↓ 75% |
| 機架密度 | 5~6 kW/機架 | 15~20 kW/機架 | ↑ 3 倍 |
| GPU 壽命 | 3~4 年 | 5~7 年 | ↑ 50% |
從投資回報角度,液冷的成本雖然初期高,但 3 年內就能通過降低冷卻電費收回投資。
第二章:液冷系統的完整架構解析
2.1 一個典型液冷系統的 7 大組成部分
要理解壓力錶該裝在哪裡,首先要理解液冷系統的完整流程。一個典型的封閉式液冷系統由以下部分組成:
| 序號 | 組件名稱 | 功能 | 典型工作溫度 | 典型工作壓力 |
|---|---|---|---|---|
| 1 | GPU 晶片 | 產生熱量 | 70~90°C | N/A |
| 2 | 冷板 (Cold Plate) | 與晶片接觸、傳遞熱量給冷卻液 | 60~80°C | 3~6 bar |
| 3 | 供液管 (Supply Line) | 從 CDU 把冷液送到冷板 | 25~50°C | 5~8 bar |
| 4 | CDU 冷卻分配裝置 | 泵循環、冷卻器降溫、過濾、壓力調節 | 25~45°C | 6~10 bar(泵出口) |
| 5 | 冷卻器 (Chiller/Radiator) | 與外界 (空調或冷卻塔) 交換熱量 | 25~35°C | 0.5~2 bar |
| 6 | 回流管 (Return Line) | 把升溫的液體從冷板送回 CDU | 45~70°C | 0.5~1.5 bar |
| 7 | 液體儲存箱 (Reservoir) | 儲存液體、散氣、防蒸發 | 常溫 | 略微負壓 |
2.2 液冷循環的物理過程
讓我們用一個完整的溫度和壓力軌跡來理解液冷系統的運作:
液體在系統中的「旅程」
起點:CDU 儲存箱 (Reservoir)
- 液體溫度:25~30°C(冷卻器剛冷卻過)
- 液體壓力:略微負壓(約 -0.1 bar),泵主動吸入
第一站:CDU 泵吸入口
- 負壓區域:-0.1~-0.3 bar(泵正在吸液)
- 溫度:26~31°C(無變化)
- 【監測重點】如果負壓 <-0.5 bar,表示液體快耗盡,需要緊急加液
第二站:CDU 泵出口 ⭐ 【第一個重要監測點】
- 壓力:6~8 bar(泵工作壓力)
- 溫度:26~31°C(無變化)
- 【監測重點】壓力突然下降 <3 bar = 泵故障或洩漏 | 壓力突然升高 >9 bar = 下游堵塞
第三站:CDU 濾芯 (Filter)
- 壓力變化:-0.2~-0.5 bar(通過濾芯的壓力損失)
- 溫度:26~31°C
- 【監測重點】如果濾芯積垢,此處壓力損失會升高至 >1 bar
第四站:供液管 ⭐ 【第二個重要監測點】
- 壓力:5.5~7.5 bar(泵壓力 - 濾芯損失 - 管道損失)
- 溫度:26~31°C
- 【監測重點】比較 CDU 出口和此處的壓力差,判斷供液管是否堵塞
第五站:冷板進口 ⭐ 【第三個重要監測點】
- 壓力:5.0~7.0 bar(供液管末端,壓力已損失)
- 溫度:26~31°C(還沒升溫)
- 液體流量:決定於泵壓力、系統阻力、冷板設計
第六站:冷板內部 🔥 【熱交換發生】
- 液體吸收 GPU 的熱量:每個 GPU 產生 300~700W 熱量
- 溫度升高:27°C → 35~45°C(溫升 8~18°C)
- 流經冷板的壓力損失:-0.5~-1.2 bar(冷板設計決定)
第七站:冷板出口 ⭐ 【第四個重要監測點】
- 壓力:4.0~6.0 bar(冷板出口,已損失 1.0~1.5 bar)
- 溫度:35~48°C(升溫 8~18°C)
- 【監測重點】比較冷板進出口,計算冷板差壓,判斷是否積垢
- 差壓判斷:
- • 新冷板:0.3~0.8 bar(正常)
- • 積垢 6 個月:0.8~1.2 bar(可接受)
- • 積垢 1 年:1.2~1.5 bar(需清洗)
- • 差壓 >2 bar(嚴重積垢,必須清洗或更換)
第八站:回流管 ⭐ 【第五個重要監測點】
- 壓力:0.5~1.5 bar(低壓區域)
- 溫度:35~48°C(經過冷板升溫後)
- 【監測重點】壓力波動不穩定 = 可能有空氣進入(致命問題)
第九站:CDU 冷卻器 (Chiller)
- 溫度變化:48°C → 28°C(通過冷卻器降溫)
- 壓力損失:0.2~0.5 bar
- 【監測重點】如果出口溫度 >35°C,說明冷卻器故障或風扇損壞
終點:回到儲存箱
- 溫度:28~32°C(經過冷卻器後)
- 壓力:略微負壓 -0.1 bar(準備再次被泵吸入)
- 完成一個循環,整個過程耗時 5~15 秒
2.3 關鍵參數速查表
液冷系統中,有幾個關鍵的物理量需要監測,它們決定了系統是否健康運行。
| 參數 | 符號 | 單位 | 正常範圍 | 警告範圍 | 危急範圍 |
|---|---|---|---|---|---|
| 系統工作壓力 | P_sys | bar | 6~8 | 8~10 | >10 或 <3 |
| 系統差壓 | ΔP_sys | bar | 5~7 | 7~9 | >9 |
| 冷板差壓 | ΔP_cold_plate | bar | 0.5~1.2 | 1.2~1.5 | >1.5 |
| 冷卻液進溫 | T_in | °C | 25~32 | 32~38 | >40 |
| 冷卻液出溫 | T_out | °C | 35~45 | 45~50 | >50 |
| 液體溫升 | ΔT | °C | 8~15 | 15~20 | >20 |
| 流量 | Q | L/min | 取決於設計 | -20% ~ +10% | 變化 >20% |
| 吸入壓力 | P_suction | bar | -0.1 ~ 0 | -0.3 ~ -0.5 | <-0.5 |
第三章:壓力錶的 5 個關鍵安裝位置 — 詳細技術指南
這是本文最重要的章節。每一個壓力監測點都代表系統的一個不同方面的健康狀況。錯誤的位置或精度不足,可能導致故障無法及時發現。
3.1 位置一:CDU 泵出口 — 監測泵的健康狀況
🎯 位置:冷卻泵的出口接管,距離泵葉輪出口 10~20 厘米處
📏 規格:壓力錶 0~10 bar,精度 ±1.6%,耐溫 -20~100°C
💾 數據記錄:連續採樣,5 分鐘記錄一次,建立趨勢曲線
為什麼這是最重要的監測點?
泵是整個系統的「心臟」。泵的工作壓力直接反映了系統的阻力大小。CDU 出口的壓力是所有下游測點的「基準值」。
正常壓力解讀:
- 6.0~6.5 bar:最低工作壓力。系統阻力小,冷板、管道都非常乾淨。典型出現在系統剛安裝或剛清洗後。
- 6.5~7.5 bar:標準工作壓力。這是大多數時間的壓力範圍。泵工作效率最高。
- 7.5~8.0 bar:略高工作壓力。冷板或管道有輕微積垢,但不影響冷卻效果。可在下個計畫維護時清洗。
異常壓力的診斷:
| 讀數 | 可能原因(按概率排列) | 症狀 | 緊急程度 |
|---|---|---|---|
| <3 bar | 1. 泵葉輪損壞 2. 液體洩漏 3. 吸入堵塞 | 泵發出異常聲音、冷卻液溫度急升、GPU 溫度超標 | 🔴 危急 |
| 3~4 bar | 1. 泵部分損壞 2. 進液濾芯堵塞 3. 液體即將耗盡 | 冷卻效能下降 20~30% | 🟠 高 |
| 8~9 bar | 1. 冷板或管道有積垢 2. 濾芯需要更換 3. 冷卻液黏度升高(溫度過高) | 液體溫度升高 3~5°C | 🟡 中 |
| >10 bar | 1. 系統嚴重堵塞 2. 管道破裂但液體未洩漏 3. 冷板完全堵塞 | 冷卻液溫度 >50°C,泵發出尖叫聲 | 🔴 危急 |
| 壓力波動 ±0.5 bar | 1. 空氣進入系統 2. 泵軸承磨損 3. 液體老化 | 冷卻不穩定,GPU 頻率波動 | 🟠 高 |
安裝細節
⚙️ 機械安裝:
- 使用 1/4 英寸或 M16x2 的螺紋接頭
- 在泵出口 10~20 厘米處安裝(太近會捕捉泵的脈動,太遠會延遲反應)
- 安裝位置最好高於液體面,避免虹吸現象
- 使用緩衝管(Small Diameter Tubing)連接壓力錶,減少噪音
🌡️ 溫度考慮:
- 如果液體溫度 >60°C,需要加裝冷卻導管(Cooling Tube)隔離錶頭,防止錶頭本身過熱而失效
- 冷卻導管通常是 10~20 厘米長的銅管,中間有進液孔,外面用風冷散熱
📡 信號處理:
- 如果使用指針壓力錶:每小時目視記錄一次讀數
- 如果使用數位壓力錶(4~20mA 訊號):直接連接 PLC 或資料採集卡,自動採樣間隔 5 分鐘
- 推薦使用帶 4~20mA 輸出的電子壓力錶,可以同時看指針和數位讀數
故障案例分析
📋 案例:某資料中心 CDU 出口壓力突然從 7.2 bar 跌至 2.1 bar
時間線:
- 09:45 :自動監測系統偵測到壓力驟降,發出黃色警告
- 09:50 :壓力继续下降到 2.0 bar,警告升級為紅色,系統自動發 SMS 到運維
- 10:00 :運維人員到現場,發現冷卻液在CDU基座漏出,與泵出口接管鬆脫
- 10:15 :重新鎖緊接管,重新排氣,壓力恢復至 7.1 bar,系統恢復正常
- 停機時間:15 分鐘(因為有壓力監測,及時發現)
如果沒有壓力監測:液體洩漏會继续,泵會空轉,5 分鐘內就會發生 "Cavitation"(氣蝕),泵葉輪被損壞,需要更換泵,停機 2~4 小時,成本 NT$50,000+
3.2 位置二:冷板進口 — 監測供液管路健康
🎯 位置:供液管最後 5~10 厘米處,冷板接頭之前
📏 規格:壓力錶 0~10 bar,精度 ±1.6%,耐溫 -20~100°C
💾 目的:與 CDU 出口壓力對比,判斷供液管是否有阻力損失
壓力差分析 — 診斷供液管路狀況
通過比較 CDU 出口和冷板進口的壓力差,可以判斷供液管路是否堵塞。
計算公式:
供液段損失 = CDU 出口壓力 - 冷板進口壓力
| 壓力差 (ΔP) | 判斷 | 診斷結論 | 建議行動 |
|---|---|---|---|
| <0.3 bar | ✓ 優秀 | 供液管路設計良好,接頭少,無積垢 | 繼續監測 |
| 0.3~0.5 bar | ✓ 正常 | 供液管路正常,輕微的摩擦損失 | 繼續監測 |
| 0.5~1.0 bar | ⚠️ 警告 | 供液管有輕微堵塞或接頭過多 | 計畫清洗 |
| 1.0~1.5 bar | ⚠️ 警告 | 供液管積垢明顯,可能濾網堵塞 | 立即更換濾網 |
| >1.5 bar | 🔴 危急 | 供液管嚴重堵塞,可能有物質阻塞(金屬屑、礦物質) | 停機排查,可能需拆檢管道 |
📊 實際案例:供液管差壓升高的警示
- 第 1 周:差壓 0.2 bar(正常)
- 第 2 周:差壓 0.3 bar(正常)
- 第 4 周:差壓 0.5 bar(開始積垢跡象)
- 第 8 周:差壓 1.2 bar(濾網積垢嚴重)
- 第 10 周:差壓 1.6 bar(濾網幾乎堵塞,冷卻效率下降 20%)
- 第 11 周:更換濾網,差壓恢復至 0.3 bar
重點:通過每周監測差壓趨勢,可以提前 2~3 周知道何時需要清洗。而不是等到系統故障才發現。
3.3 位置三:冷板出口 — 監測冷板堵塞程度
🎯 位置:冷板下游 5~10 厘米處,回流管連接前
📏 規格:壓力錶 0~5 bar,精度 ±1.6%(可選用差壓錶,直接測冷板差壓)
💾 目的:計算冷板的內部壓力損失(差壓),判斷是否積垢
冷板差壓的五個等級判斷
冷板是整個液冷系統中最常出現故障的組件。冷板內的微細流道容易被礦物質、微生物、粒子等堵塞。通過監測冷板差壓,可以預測何時需要清洗。
| 冷板差壓 | 運行時間 | 內部狀況 | 冷卻效率 | 建議行動 |
|---|---|---|---|---|
| 0.3~0.8 bar | 新冷板 | 流道清潔,無積垢 | 100% | ✓ 正常監測 |
| 0.8~1.2 bar | 3~6 個月 | 輕微積垢,正常老化 | 95~99% | ✓ 正常監測 |
| 1.2~1.5 bar | 6~12 個月 | 中等積垢,開始影響效率 | 85~95% | ⚠️ 計畫清洗 |
| 1.5~2.0 bar | 12~18 個月 | 嚴重積垢,冷卻效率明顯下降 | 70~85% | 🔴 立即清洗 |
| >2.0 bar | >18 個月 | 致命積垢,冷板報廢邊緣 | <70% | 🔴 更換冷板 |
計算冷板差壓的公式
ΔP_cold_plate = P_in(冷板進) - P_out(冷板出)
例如:冷板進口 6.5 bar,冷板出口 5.2 bar
冷板差壓 = 6.5 - 5.2 = 1.3 bar(中度積垢,需計畫清洗)
冷板堵塞的物理原因
為什麼冷板會積垢?主要有以下幾個原因:
- 水垢沉積(Mineral Scaling):冷卻液中的鈣、鎂等礦物質在高溫下發生化學反應,沉積在冷板內的微細流道裡。這是最常見的原因,佔 60~70% 的積垢。
- 微生物膜(Biofilm):長期運行的冷卻液可能被藻類或細菌污染,在冷板內形成粘性膜層,進一步加速堵塞。佔 15~20% 的積垢。
- 粒子沉積(Particulate Clogging):管道接頭鬆脫產生的金屬屑、冷卻液氧化產生的固體顆粒進入冷板。佔 10~15% 的積垢。
- 液體老化(Fluid Degradation):冷卻液使用 2 年以上後,添加劑失效,防垢能力下降,原有的溶解沉積物開始析出。這是長期的根本原因。
冷板清洗指南
⚠️ 冷板清洗是技術性很強的工作,不當操作會造成更多損傷。以下是基本流程:
- 停機並排液:關閉泵,打開所有排液閥,完全排空冷卻液
- 冷板拆卸:小心拆下冷板,避免損傷接頭
- 化學浸泡:用專業液冷系統清洗液(pH 中性,包含去垢劑和防腐劑)浸泡冷板 2~4 小時
- 機械沖洗:用低壓清水(<2 bar)沖洗冷板內部,不能用高壓水槍
- 風乾檢查:風乾冷板,目視檢查流道內是否有沉積物
- 重新安裝:裝回冷板,重新連接所有管線
- 加新液並排氣:注入新的冷卻液,打開頂部排氣閥,運行泵 5~10 分鐘排出所有空氣
- 驗證差壓:確認冷板差壓恢復至 0.5~0.8 bar
成本:清洗一個冷板 NT$2,000~5,000(含人工)。全系統(8 個冷板)清洗 NT$16,000~40,000。相比更換冷板(NT$30,000~50,000 per 件)便宜得多。
3.4 位置四:回流管 — 監測系統是否有空氣進入
🎯 位置:冷板出口至 CDU 進口的中點,回流管上任意位置
📏 規格:壓力錶 0~3 bar,精度 ±2.5%
💾 目的:監測回流管路的壓力,是判斷系統是否有空氣進入的關鍵指標
為什麼回流管的壓力波動這麼重要?
回流管通常是液冷系統中壓力最低的區域(0.5~1.5 bar)。但如果這裡的壓力出現 無規律波動,99% 的情況是系統中有空氣進入。
空氣進入的危害:
- 冷卻中斷:空氣不導熱,被空氣占據的冷板區域無法吸收熱量,冷卻效率立即下降 20~50%
- 氣蝕現象(Cavitation):空氣氣泡在泵內破裂產生高溫高壓,損傷泵葉輪。症狀:聽到泵發出「嘆氣」聲,如果持續 1~2 小時,泵就會報廢
- 系統損傷:空氣產生的真空區會腐蝕冷板、管道、接頭,導致洩漏
- 難以診斷:空氣栓塞經常導致壓力讀數跳躍,系統會表現得「莫名其妙地不穩定」
⚠️ 真實警示:空氣進入案例
某資料中心的一個液冷機架運行 2 周後,回流管壓力開始波動 0.3~1.5 bar 之間(正常應該穩定在 0.8 bar)。運維團隊沒有及時發現(他們沒有監測回流管),結果 3 天後,泵開始發出尖叫聲。拆檢泵時發現葉輪已經被氣蝕得滿是小洞,泵完全報廢。更換泵 + 重新排氣 = 停機 4 小時 + 成本 NT$80,000。
如果有壓力監測:在壓力波動出現的第一天就能發現,只需 20 分鐘的排氣工作,成本 NT$0。
空氣進入的來源與預防
| 可能的空氣來源 | 症狀 | 預防方法 |
|---|---|---|
| 接頭鬆脫 | 液體滴漏,聞到冷卻液味道 | 定期檢查所有接頭,用扭力扳手確保螺紋擰緊 |
| 冷板破損 | 冷板進出口接頭附近有液體洩漏 | 定期目視冷板表面,檢查是否有裂紋 |
| 管道破裂 | 機架下方有液體漏出 | 安裝漏液感知器(Drip Sensor),及時警報 |
| 液體箱進液口負壓過高 | 液體箱周圍聞到液體蒸發的味道 | 檢查進液濾網,定期清洗或更換 |
| CDU 頂部排氣閥損壞 | 系統無法排出初期空氣 | 定期開啟排氣閥 20~30 秒,讓氣泡浮出 |
排氣程序(重要!)
如果發現回流管壓力波動,以下是應急排氣程序:
- 開啟 CDU 頂部排氣閥:通常在液體箱蓋上有一個小閥門(可能是球閥或針閥)
- 讓泵運行 5 分鐘:低速運行泵,氣泡會浮向液體箱表面
- 聽聲音判斷:如果能聽到「嗚嗚」聲,說明有大量空氣在排出
- 看液體流出:打開排氣閥時,會有少量液體流出,這是正常的
- 持續 20~30 秒後關閉:如果繼續排氣只有液體流出沒有氣泡,說明空氣已排完
- 檢查回流管壓力:應該恢復穩定在 0.8~1.0 bar
時間成本:5~10 分鐘,建議每周進行一次排氣作為預防性維護。
3.5 位置五:CDU 吸入口 — 防止泵空轉的最後防線
🎯 位置:冷卻液箱至泵吸入口之間的位置
📏 規格:真空壓力錶(負壓錶),範圍 -1~0 bar,精度 ±2.5%
💾 目的:監測泵的吸入壓力,防止液體耗盡導致泵空轉和破壞
吸入壓力的生死線
這是最容易被忽視卻最關鍵的監測點。泵無法向上吸液體(沒有吸力),它只能向下推。當液體箱中的液體變少時,泵會吸不到液體,產生真空。
| 吸入壓力 | 系統狀況 | 泵的狀態 | 行動 |
|---|---|---|---|
| -0.05 ~ 0 bar | ✓ 正常 | 泵正常吸液,無問題 | 繼續監測 |
| -0.1 ~ -0.2 bar | ✓ 正常 | 泵需要用力吸液,但仍在安全範圍 | 正常監測 |
| -0.3 ~ -0.4 bar | ⚠️ 警告 | 泵吸液困難,液體可能快耗盡 | 檢查液位計,準備加液 |
| -0.5 ~ -0.6 bar | 🔴 危急 | 泵正在吸空,液體即將耗盡,泵馬上會破壞 | 立即停機,加液至滿 |
| <-0.7 bar | 🔴 致命 | 泵已經在吸空,氣蝕已開始 | 緊急停機,檢查泵是否損傷 |
為什麼液體會耗盡?
- 正常蒸發:特別是在夏季,液體每周會蒸發 0.5~1.5% 的體積
- 洩漏:接頭微漏、冷板裂紋、管道破損都會導致液體逐漸損失
- 忘記加液:運維人員沒有定期檢查液體箱的液位
- 冷卻液溶解度變化:液體溫度升高時,原本溶解的空氣會析出,佔據液體空間(這就是為什麼要定期排氣)
防止液體耗盡的方案
方案一:液位計(最經濟)
- 在 CDU 液體箱側面安裝液位計(光學或浮球式)
- 成本:NT$1,200~2,500
- 優點:簡單、可靠、無需電源
- 缺點:需要人工檢查,無法自動警報
方案二:液位開關 + 自動補液系統(推薦)
- 安裝液位開關在液體箱底部,當液位低於臨界值時觸發
- 配合自動補液泵,將備用冷卻液自動注入系統
- 成本:NT$8,000~15,000
- 優點:自動補液,無需人工干預;可連接 PLC 警報
- 缺點:需要定期檢查備用液體是否充足
方案三:結合吸入壓力監測 + 警報系統(最安全)
- 同時監測吸入壓力和液位
- 當吸入壓力 <-0.4 bar 時,自動發送 SMS/郵件警報,同時觸發自動補液
- 成本:NT$15,000~30,000(含 PLC、傳感器、軟體)
- 優點:多層防護,可靠性最高,停機風險最低
第四章:差壓監控 — 從 5 個測點到系統診斷
4.1 三個最重要的差壓指標
安裝了 5 個壓力錶之後,下一步是學會計算和解讀差壓(Differential Pressure,ΔP)。差壓是判斷系統故障的最有力工具。
| 差壓類型 | 計算式 | 正常範圍 | 超高告警 | 診斷意義 |
|---|---|---|---|---|
| 系統總差壓 (System ΔP) | P_out - P_return (CDU出 - 回流) | 5~7 bar | >9 bar | 整個系統的阻力大小 |
| 供液段差壓 (Supply ΔP) | P_out - P_cold_in (CDU出 - 冷板進) | <0.5 bar | >1.5 bar | 供液管及濾芯是否堵塞 |
| 冷板差壓 (Cold Plate ΔP) | P_cold_in - P_cold_out (冷板進 - 冷板出) | 0.5~1.2 bar | >2 bar | 冷板內部是否積垢 |
4.2 差壓監控決策樹 — 快速故障診斷
第一步:監測系統總差壓是否升高
- 是 (>8 bar):系統整體阻力升高,進入第二步
- 否 (≤8 bar):系統健康,繼續監測
第二步:監測供液段差壓是否升高
- 是 (>1.0 bar):供液管或濾芯堵塞
- → 解決方案:清洗濾網、更換濾芯、檢查管道
- → 停機時間:20~30 分鐘
- 否 (≤1.0 bar):進入第三步
第三步:監測冷板差壓是否升高
- 是 (>1.5 bar):冷板積垢嚴重
- → 解決方案:用化學清洗液清洗冷板或更換
- → 停機時間:2~4 小時
- 否 (≤1.5 bar):進入第四步
第四步:監測回流管是否有壓力波動
- 是 (波動 >±0.5 bar):系統有空氣進入
- → 解決方案:檢查接頭、排氣
- → 停機時間:10~20 分鐘
- 否 (穩定):系統健康
4.3 溫度 + 壓力的二維診斷矩陣
壓力數據最有效的用法是配合溫度數據進行二維分析。這樣可以更準確地診斷問題。
| 進液溫度 (T_in) | 出液溫度 (T_out) | 系統壓力 (P_sys) | 冷板差壓 (ΔP_cp) | 診斷結論 | 建議行動 |
|---|---|---|---|---|---|
| 28~32°C | 35~40°C | 6~8 bar | 0.5~1.2 bar | ✓✓✓ 完美 | 持續監測,無需維護 |
| 32~36°C | 40~45°C | 6~8 bar | 0.5~1.2 bar | ✓ 正常 | 監測,無迫切需要 |
| 28~32°C | 35~40°C | 8~10 bar | 1.2~1.5 bar | ⚠️ 冷板略微積垢 | 計畫清洗冷板 |
| 36~40°C | 45~50°C | 6~8 bar | 0.5~1.2 bar | ⚠️ CDU 冷卻器故障 | 檢查冷卻器風扇、清洗翅片 |
| 28~32°C | 35~40°C | <3 bar | - | 🔴 泵故障或洩漏 | 立即停機檢修 |
| 40~48°C | 48~56°C | 8~12 bar | 1.5~2.5 bar | 🔴 雙重故障:冷卻失效 + 冷板堵塞 | 立即停機,全系統清洗 |
結論:壓力監測是液冷系統的「健康監測儀」
核心要點回顧
- AI 伺服器必須用液冷 — 單卡 700W 功耗,風冷無法散熱
- 壓力監測是防止停機的唯一手段 — 可提前 24~48 小時預警故障
- 5 個關鍵監測點 CDU 出口、冷板進/出、回流管、吸入口
- 差壓分析比單點壓力更有診斷價值 — 可精準定位故障部位
- ROI 投資回本週期只需 1.6~2 年 — 冷卻成本節省遠超監測系統成本
立即行動:五步部署計畫
- 評估現況:你現在有幾個 GPU?機房冷卻成本多少?
- 選擇方案:基礎/標準/專業配置,根據預算選擇
- 聯絡昶特:填寫詢價單
- 取得方案報告:包含系統設計圖、成本估算、實施時程
- 開始運行:建立壓力趨勢圖,進行預防性維護
聯絡昶特 ATLANTIS
業務一部 Ian: ian@atlantis.com.tw | 02-2820-3405
業務二部 Nori: nori@atlantis.com.tw | 02-2820-3405
公司網站: re-atlantis.tw