AI伺服器功率不斷提升,CDU如何確保液冷系統散熱效能?完整技術解析 2026
當單顆 GPU 的熱設計功耗(TDP)逼近 1,400 瓦、單一機櫃功耗突破 100 kW 甚至朝 1 MW 邁進,傳統氣冷系統早已觸及物理極限——空氣的熱傳導能力在 700 瓦等級的晶片前幾乎束手無策。液冷,已經從「進階選配」變成 AI 資料中心的「剛性需求」。而在整個液冷架構中,真正決定散熱效能成敗的核心設備,正是被業界稱為「液冷系統心臟」的 CDU(Coolant Distribution Unit,冷卻液分配單元)。
CDU 的任務聽起來單純:把冷卻液精準地送到每一片伺服器冷板,再把帶走的熱量交換出去。但當機櫃功率從 20 kW 一路攀升到 120 kW、142 kW,甚至下一代設計挑戰 1 MW 等級,CDU 必須在流量、壓力、溫度三者之間做出毫秒級的動態平衡——任何一個監測環節失準,輕則 GPU 降頻、效能下滑,重則冷板洩漏、機櫃報廢,單次事故的損失動輒是設備採購成本的數十倍。
這篇文章要回答的核心問題是:當 AI 伺服器功率持續攀升,CDU 究竟依靠哪些機制與儀表,確保液冷系統的散熱效能不失控? 我們會從 CDU 的系統架構、監測參數、儀表選型,到實際案例與 ROI 計算,提供工程師、設施管理者與採購決策者一份完整、可落地的技術指南。全文由昶特 ATLANTIS 資深工程團隊依據 31 年工業量測製造經驗撰寫,聚焦壓力、溫度、流量監測在 CDU 中的實際應用。
⚡ 功率密度暴增
NVIDIA GB300 NVL72 機櫃功耗上看 120 kW,單顆 GPU TDP 逼近 1,400W,傳統氣冷約 700W 即達物理極限。
💧 液冷滲透率飆升
2026 年 AI 伺服器液冷滲透率預估突破 50%,AI 訓練伺服器更逼近 80%,液冷已是主流架構而非選配。
🌡️ 效率差距懸殊
液體熱傳導效率是空氣的數十倍,導入液冷後資料中心 PUE 可由氣冷的 1.5 降至 1.05~1.1,冷卻用電降低約 40%。
🔧 CDU 是失效關鍵點
CDU 控制冷卻液流量、溫度與壓力,一旦監測失準,洩漏或阻塞往往在溫度飆升前毫無徵兆——這正是儀表配置的價值所在。
第一章:CDU 系統架構全解析——液冷系統的「心臟」如何運作
要理解 CDU 如何確保散熱效能,得先拆解它在整套液冷系統中的實際角色。CDU 並不是單純的「幫浦加水箱」,而是一套集流量控制、熱交換、壓力調節、污染防護與即時監測於一身的精密子系統。每一台液冷機櫃通常都需要搭配一套(或以 N+1 冗餘方式搭配多套)CDU,才能穩定供應冷卻液給機櫃內每一片伺服器冷板。
1.1 一次迴路與二次迴路:隔離設計的關鍵意義
CDU 最核心的設計邏輯,是把冷卻液迴路切分成「一次迴路」(Primary Loop,連接建築設施冷水系統或室外冷卻塔)與「二次迴路」(Secondary Loop,直接進入機櫃、接觸伺服器冷板)兩個獨立系統,中間以板式熱交換器(Plate Heat Exchanger)做熱量傳遞,兩側液體完全不混合。
這樣的隔離設計有三個實際好處:
- 水質純淨度可控:二次迴路使用去離子水或特殊配方冷卻液,避免設施用水中的雜質、礦物質直接接觸精密冷板,降低阻塞與腐蝕風險。
- 壓力互不干擾:一次迴路的壓力波動(例如冷卻水塔幫浦啟停)不會直接傳導到二次迴路,伺服器端的壓力環境更穩定。
- 維護與擴充彈性:二次迴路可針對機櫃特性獨立調校溫度、流量設定值,不受一次迴路整體排程限制。
💡 工程重點
二次迴路的供水溫度必須嚴格控制在資料中心露點溫度以上,這是 CDU 溫控邏輯中最容易被忽略、卻最關鍵的一項參數——一旦供水溫度低於露點,冷板與管路外部將產生結露,water damage 風險直接威脅整機櫃電子元件。因此 CDU 的溫度感測與控制迴路,本質上同時肩負「散熱」與「防結露」雙重任務。
1.2 CDU 的核心組件與各自職責
| 組件 | 功能說明 | 失效時的典型症狀 |
|---|---|---|
| 循環幫浦(通常 N+1 冗餘) | 驅動二次迴路冷卻液循環,維持設計流量 | 流量驟降、GPU 局部溫度異常升高 |
| 板式熱交換器 | 一次/二次迴路間進行熱交換,不混合液體 | 供水溫度無法下降、Delta-T 縮小 |
| 精密過濾器(常見規格 50 微米) | 阻擋雜質與微粒,保護冷板通道 | 壓差上升、流量逐漸衰減 |
| 壓力感測與控制閥 | 維持二次迴路供回水壓力在安全範圍 | 壓力過高致管路接頭滲漏,過低則流量不足 |
| 溫度感測陣列 | 監測供水、回水溫度,計算 Delta-T 換算散熱量 | 無法即時掌握實際散熱效能,故障預警延遲 |
| 流量計 / 流量開關 | 確認冷卻液確實循環,偵測低流量異常 | 幫浦故障或管路阻塞時無法即時停機保護 |
| 洩漏偵測裝置 | 偵測機櫃底部或管路接頭滲漏 | 洩漏初期無明顯徵兆,延誤搶修時機 |
| 膨脹桶/儲液桶液位計 | 監測系統補液狀態,反映系統是否洩漏 | 液位持續下降代表系統存在隱性洩漏 |
1.3 Liquid-to-Liquid 與 Liquid-to-Air 兩種 CDU 架構
依熱交換方式不同,CDU 可分為兩大類,適用場景與監測需求也不同:
| 類型 | 散熱方式 | 優勢 | 監測重點 |
|---|---|---|---|
| Liquid-to-Liquid(液對液) | 與建築冷水系統/冷卻水塔連接 | 散熱效能最佳,適合超高密度機櫃(>50kW) | 一次/二次迴路壓差、供回水溫度、流量平衡 |
| Liquid-to-Air(液對氣) | 內建風扇將熱量排至機房空氣 | 免接建築水管,安裝彈性高,導入成本較低 | 環境溫度對散熱效能的影響、風扇轉速與背壓 |
1.4 完整儀表需求清單:CDU 監測到底需要哪些量測點?
以一套典型的機架式 CDU(服務單一或多個 AI 伺服器機櫃)為例,完整的儀表配置通常包含以下量測點位:
| 量測點位 | 建議儀表類型 | 監測目的 |
|---|---|---|
| 二次迴路供水壓力 | HART 智能壓力傳送器 | 確保幫浦出口壓力穩定,供水充足到達每片冷板 |
| 二次迴路回水壓力 | 壓力傳送器 | 與供水壓力比對,計算系統壓損,判斷是否阻塞 |
| 過濾器前後壓差 | 微差壓傳送器 | 監測濾網阻塞程度,提前排程更換 |
| 供水溫度 | 管路型溫度傳送器 | 確認送入機櫃的冷卻液溫度符合設定值且高於露點 |
| 回水溫度 | 管路型溫度傳送器 | 與供水溫度計算 Delta-T,換算實際散熱功率 |
| 冷卻液流量 | 流量開關/流量計 | 確認幫浦運轉正常、迴路暢通,低流量立即告警 |
| 幫浦壓力保護 | 壓力開關(上下限) | 壓力異常時觸發保護動作,防止乾轉或超壓 |
| 膨脹桶/儲液桶液位 | 液位傳送器 | 監測補液狀態,間接反映系統是否洩漏 |
| 機櫃底部洩漏區 | 洩漏感測搭配液位開關 | 第一時間偵測滴液或滲漏,觸發緊急停泵 |
從這張清單不難看出,CDU 的散熱效能其實不是靠「一顆感測器」撐起來的,而是壓力、溫度、流量、液位四大類儀表彼此配合、交叉驗證的結果。下一章我們會進一步分析,當 AI 伺服器功率持續攀升,這些監測點位所面對的負荷變化與實際數據。
第二章:功率密度攀升下的散熱挑戰與尖峰負荷分析
2.1 機櫃功率密度的攀升軌跡
過去五年,資料中心機櫃功率密度的成長速度遠超過傳統散熱系統的設計假設。傳統伺服器機房設計功率密度多落在 3~5 kW/機櫃,一般大型機房也僅約 20~30 kW/機櫃;但 AI 訓練與推理叢集已經全面改寫這個標準。
| 機櫃等級 | 典型功率密度 | 適用冷卻方式 |
|---|---|---|
| 傳統企業機房 | 3~5 kW/機櫃 | 氣冷(CRAC/CRAH) |
| 大型雲端機房 | 20~30 kW/機櫃 | 氣冷 + 局部背板液冷 |
| AI 推理機櫃 | 30~50 kW/機櫃 | 背板液冷(Liquid-to-Liquid CDU) |
| AI 訓練密集機櫃 | 80~120 kW/機櫃 | 直接液冷(Direct-to-Chip)+ CDU |
| 次世代超高密度機櫃 | >100 kW,規劃朝 1 MW/機櫃邁進 | 浸沒式液冷 + 大流量 CDU |
以業界指標性的 NVIDIA GB300 NVL72 機櫃為例,單櫃功耗上看 120 kW,單顆 GPU 熱設計功耗逼近 1,400 瓦,遠遠超出傳統氣冷約 700 瓦左右的物理極限。這代表 CDU 不再只是「加分項」,而是整個機櫃能否穩定運作的先決條件。
2.2 散熱量與流量、溫差的關係:Delta-T 為何是核心指標
CDU 的散熱能力可以用一個簡化的熱力學公式理解:
📐 散熱功率計算公式
Q = m × c × ΔT
其中 Q 為散熱功率(kW),m 為冷卻液質量流量,c 為冷卻液比熱,ΔT 為供回水溫差(Delta-T)。這代表在流量固定的前提下,回水溫度與供水溫度的差值(Delta-T)直接反映了機櫃實際帶走的熱量;當 Delta-T 異常縮小,即使表面溫度看似正常,也代表散熱效能正在下降。
這正是為什麼 CDU 監測系統必須「同時」掌握供水溫度、回水溫度與流量三項數據,而不是只看單一溫度值。只監測回水溫度,可能誤判「溫度沒有超標」,卻忽略了流量已經因濾網阻塞而悄悄下滑、Delta-T 被迫放大來維持相同散熱量的警訊。
2.3 尖峰負荷下的壓力與溫度變化實測參考
以一套服務 80 kW 機櫃的背板液冷 CDU 為例,從閒置到滿載訓練負載,各項監測參數的變化幅度具有代表性:
| 負載狀態 | GPU 使用率 | 供水壓力 | 供回水溫差 (Delta-T) | 流量需求 |
|---|---|---|---|---|
| 閒置/待機 | <10% | 0.15~0.20 MPa | 2~3°C | 基礎流量的 30~40% |
| 一般推理負載 | 40~60% | 0.20~0.30 MPa | 5~7°C | 基礎流量的 60~75% |
| 滿載訓練負載 | 90~100% | 0.25~0.40 MPa | 8~12°C | 設計流量的 95~100% |
| 尖峰瞬間爆衝 | 短時間 100%+ | 可能瞬間超過 0.40 MPa | 短時間超過 12°C | 接近或觸及流量上限 |
⚠️ 關鍵風險提醒:AI 訓練負載具有「突發性尖峰」特性——大批次運算啟動的瞬間,GPU 功耗可在數秒內從閒置跳升到滿載,若 CDU 的壓力與流量控制反應不夠即時,供水壓力可能瞬間超出安全上限,導致管路接頭滲漏;反之若幫浦調節過慢,則會出現短暫的局部過熱,觸發 GPU 降頻保護機制。這正是為何壓力開關與智能壓力傳送器的反應速度(通常要求秒級甚至更快)在 CDU 設計中如此關鍵。
2.4 露點控制:容易被忽略的「隱性風險」
當機房濕度偏高、供水溫度設定過低時,二次迴路管路外壁與冷板表面可能低於環境露點溫度,產生結露。結露對於精密電子設備而言幾乎是不可逆的損害風險,且初期徵兆並不明顯,往往要到出現隨機當機、記憶體錯誤時才會被發現。因此,成熟的 CDU 控制邏輯會同步監測環境溫濕度,動態調整供水溫度設定值,確保「散熱」與「防結露」兩個目標不互相衝突——這也是為什麼溫濕度傳送器經常與 CDU 溫度監測系統整合部署的原因。
2.5 小結:尖峰負荷對監測系統的三項核心要求
- 反應速度:壓力與流量異常必須在秒級內被偵測並觸發保護動作,避免瞬間尖峰造成管路損壞。
- 量測範圍:儀表量程需涵蓋閒置到尖峰爆衝的完整區間,避免因量程設計不足導致誤判或飽和失準。
- 資料完整性:供水溫度、回水溫度、壓力、流量四項數據必須同步記錄,才能準確還原 Delta-T 與實際散熱效能,而非仰賴單一參數判斷。
第三章:CDU 關鍵監測參數與儀表選型原則
掌握了架構與負荷特性後,接下來要回答工程師最實際的問題:每一個監測點位,該怎麼選對規格?本章依壓力、溫度、流量、液位四大類,整理選型時必須確認的技術參數。
3.1 壓力監測:量程、精度與連接方式怎麼選
CDU 二次迴路的操作壓力通常落在 0.1~0.5 MPa 區間,但選型時不能只看「操作範圍」,還必須預留尖峰爆衝的安全裕度,同時考慮幫浦啟停瞬間的水鎚效應。一般建議量程選擇約為正常操作壓力上限的 1.5~2 倍,避免長期在滿量程附近運作影響感測元件壽命。
| 監測需求 | 建議精度等級 | 訊號輸出 | 連接方式考量 |
|---|---|---|---|
| 供/回水主迴路壓力 | 0.2~0.5 級 | 4-20mA 或 HART 智能通訊 | 不鏽鋼材質,考量冷卻液相容性 |
| 過濾器壓差監測 | 0.5 級以上 | 4-20mA 微差壓輸出 | 雙側取壓,避免單向壓力干擾 |
| 幫浦保護(上下限開關) | 依安全裕度設定 | 繼電器接點輸出 | 快速反應(秒級)觸發停泵保護 |
3.2 溫度監測:供回水溫度與 Delta-T 計算
溫度感測點位的佈置原則,是「供水」與「回水」必須成對量測,且盡量靠近冷板進出口,減少管路熱損失造成的量測誤差。對於需要整合 PLC/SCADA 系統的場域,建議選用具備 4-20mA 類比輸出或 HART 通訊能力的管路型溫度傳送器,方便納入既有監控平台。
| 監測需求 | 感測元件類型 | 建議精度 | 安裝方式 |
|---|---|---|---|
| 供水溫度(近機櫃入口) | Pt100 白金電阻 | ±0.3~0.5°C | 管路直插式,靠近分歧管入口 |
| 回水溫度(近機櫃出口) | Pt100 白金電阻 | ±0.3~0.5°C | 管路直插式,靠近集水總管 |
| 環境溫濕度(防結露) | 溫濕度複合感測 | 溫度 ±0.5°C/濕度 ±3%RH | 機櫃周邊或冷通道內佈點 |
3.3 流量監測:確認冷卻液真的有在循環
流量監測經常被低估重要性,但實務上它是判斷「幫浦是否正常運轉」與「管路是否阻塞」最直接的指標。流量開關屬於較經濟的方案,適合作為「有沒有流動」的門檻式保護;若需要精確掌握流量數值以計算 Delta-T 與散熱功率,則需搭配連續輸出型流量計。
3.4 液位與洩漏監測:預防「隱性故障」的最後防線
膨脹桶或儲液桶的液位變化,是判斷系統是否存在隱性洩漏的重要線索——正常運作下液位應維持穩定,若持續緩慢下降,即使尚未出現明顯滴液,也代表管路接頭或冷板密封已經出現微滲漏,必須及早排查。機櫃底部的洩漏感測則是最後一道防線,一旦偵測到液體即應觸發告警甚至自動停泵保護。
3.5 CDU 完整監測配置參考(依規模分級)
| 配置等級 | 適用機櫃規模 | 監測點位數量 | 核心配置重點 |
|---|---|---|---|
| 基礎型 | 單櫃、<30kW | 供回水壓力、供回水溫度、流量開關共 4~5 點 | 基本保護,異常時聲光警報 |
| 標準型 | 多櫃列、30~80kW/櫃 | 加入濾網壓差、液位、環境溫濕度共 8~10 點 | 納入 PLC/SCADA,具備數據記錄 |
| 進階型 | 高密度機列、>80kW/櫃 | 全點位監測 + 洩漏感測 + 冗餘備援訊號 | HART/雲端整合,48 小時前預警能力 |
值得強調的是,儀表本身的精度只是選型的一部分,「連接方式與材質相容性」同樣重要——冷卻液種類(純水、乙二醇混合液或特殊配方液)、管路材質、以及是否需要防爆等級,都會直接影響感測器的隔膜材質與殼體設計選擇。下一章我們將具體介紹昶特 ATLANTIS 針對 CDU 監測情境開發的產品組合。
第四章:昶特 ATLANTIS CDU 監測解決方案與產品介紹
昶特 ATLANTIS 深耕工業量測儀表製造 31 年,長期服務半導體、石化、食品、精密製造等對精度與可靠度要求極高的產業。面對 AI 資料中心液冷系統這類新興應用,我們將既有的壓力、溫度、流量、液位量測技術,重新整合為一套完整的 CDU 監測解決方案,協助工程團隊在功率密度持續攀升的環境下,確保散熱效能穩定可控。
4.1 CDU 監測核心產品組合

SDPT-3100|HART 智能型壓力傳送器——CDU 二次迴路供水壓力監測首選,支援雲端平台整合
DPTX|防爆差壓傳送器——監測過濾器前後壓差,提前掌握濾網阻塞趨勢

STT|HART 智能型溫度傳送器——供回水溫度精密監測,計算 Delta-T 換算實際散熱功率

ATT-P4/D4 系列|管路型溫度傳送器——4-20mA 輸出,直接整合 PLC/SCADA 系統

AT25 系列|流量開關——確認冷卻液確實循環,低流量異常即時告警

DPS-2.5SPD3|多功能壓力開關——上下限保護設定,壓力異常秒級觸發停泵保護

SLPTX|數位式 HART 液位傳送器——監測膨脹桶/儲液桶液位,及早發現隱性洩漏
THT-S351 系列|溫濕度傳送器——機房環境溫濕度同步監測,防止結露風險
4.2 各產品在 CDU 系統中的部署位置
| 產品型號 | 部署位置 | 核心功能 |
|---|---|---|
| SDPT-3100 | CDU 出水總管、幫浦出口 | HART 通訊,可接入雲端平台做 48 小時前預警分析 |
| DPTX | 過濾器前後兩側 | 差壓監測反映濾網阻塞程度,安排預防性更換 |
| STT | 供水管、回水管各一支 | 成對量測計算 Delta-T,掌握實際散熱效能 |
| ATT-P4/D4 | 各分歧管路溫度監測點 | 4-20mA 類比輸出,整合既有 PLC 控制邏輯 |
| AT25 系列 / RHFS | 主迴路與各分歧迴路 | 流量開關確認循環正常,門檻式低流量保護 |
| DPS-2.5SPD3 | 幫浦出口保護點 | 上下限壓力保護,異常時秒級觸發停泵 |
| SLPTX | 膨脹桶/儲液桶 | 連續液位監測,反映系統補液與洩漏狀態 |
| THT-S351 | 機櫃周邊、冷通道 | 溫濕度同步監測,動態調整供水溫度避免結露 |
4.3 兩種常見配置方案比較
| 比較項目 | 基礎防護配置 | 進階智能配置 |
|---|---|---|
| 監測點位 | 供回水壓力、溫度、流量開關(4~5 點) | 全點位監測含濾網壓差、液位、洩漏、環境溫濕度(8 點以上) |
| 訊號整合 | 4-20mA 類比輸出,本地 LCD 顯示 | HART 智能通訊,雲端平台即時掌握趨勢 |
| 異常反應 | 聲光警報,人工巡檢確認 | 動態閾值預警,異常前 48 小時主動通知 |
| 適用場景 | 單櫃或小型液冷試點部署 | 多櫃列、高密度機房、對停機零容忍場景 |
| 擴充彈性 | 可日後升級至進階配置 | 已具備雲端串接能力,可延伸 AI 預測維護 |
兩種配置皆可依現場冷卻液種類(純水、乙二醇混合液)選配對應材質的隔膜座與感測元件,確保長期運作下的耐腐蝕與相容性。所有產品皆採報價制,實際型號與規格建議依現場冷卻液性質、管徑與壓力等級,由昶特工程團隊協助現場評估後提供配置建議。
4.4 工業 4.0 整合:從單點監測到全機房智慧化
對於已導入或規劃導入 PLC、SCADA 或雲端監控平台的資料中心,選用支援 HART 通訊或 4-20mA 標準訊號輸出的儀表,能直接無縫整合進既有系統架構,不需要額外建置獨立監控介面。透過集中化的數據平台,工程團隊可以同時掌握多套 CDU 的供回水壓力、溫度、流量趨勢,並設定動態閾值,在異常初期即觸發預警,將維護模式從「事後搶修」轉為「事前預防」。
第五章:真實案例研究與投資效益分析
5.1 案例一:北部 AI 雲端運算中心——CDU 監測升級改善散熱穩定性
📍 案例背景
北台灣某 AI 雲端運算服務業者,機房規模約 400 m²,部署多列 GPU 訓練機櫃,單櫃功耗約 80~100 kW,採用背板液冷架構搭配 CDU 供液。
遭遇的問題
- 原有 CDU 監測僅有基礎壓力錶與單一回水溫度顯示,缺乏供回水成對量測,無法計算實際 Delta-T。
- 濾網阻塞初期無壓差監測,往往要等到流量明顯下降、GPU 開始降頻才被察覺。
- 膨脹桶液位無連續監測,一次接頭微滲漏累積數週後才在巡檢時發現,機櫃底部已有明顯積液痕跡。
- 訓練任務尖峰負載時,曾發生供水壓力短暫超出安全上限,導致一處快接頭滲漏,緊急停機排查耗時逾 2 小時。
解決方案:分階段導入
導入後成效(6 個月追蹤數據)
| 指標 | 導入前 | 導入後 | 改善幅度 |
|---|---|---|---|
| 洩漏/滲漏相關異常事件 | 約 2~3 次/季 | 約 0 ~1 次/季(多為預警攔截) | 大幅下降 |
| 濾網阻塞導致的降頻事件 | 不定期發生,事後才發現 | 提前排程更換,未再發生 | 轉為主動預防 |
| 異常反應時間 | 需人工巡檢發現,約數小時至數天 | 系統即時告警,數秒至數分鐘 | 反應速度大幅提升 |
| GPU 因散熱異常降頻頻率 | 尖峰負載時偶發 | 顯著減少 | 訓練任務穩定度提升 |
5.2 案例二:半導體先進封裝廠液冷測試站監控強化
📍 案例背景
南部某半導體先進封裝廠新建 AI 運算測試站,導入直接液冷(Direct-to-Chip)架構,對於液冷系統的水質純淨度與壓力穩定性要求極高,同時場域鄰近潔淨室,對洩漏風險的容忍度趨近於零。
遭遇的問題
- 測試站初期沒有獨立的過濾器壓差監測,工程團隊擔心濾材阻塞影響流量卻難以量化判斷。
- 機房環境濕度control不易,供水溫度設定偏保守,散熱裕度未被充分利用。
- 缺乏環境溫濕度即時監測,無法動態調整供水溫度以兼顧防結露與散熱效率。
解決方案
導入完整 CDU 監測配置:DPTX 監測濾網壓差、THT-S351 監測環境溫濕度並回饋至控制邏輯動態調整供水溫度設定、SDPT-3100 與 STT 分別監測壓力與供回水溫度,全數整合進廠內既有製程監控平台,並比照半導體潔淨室規格要求提供材質證明與校正紀錄。
| 指標 | 導入前 | 導入後 |
|---|---|---|
| 供水溫度設定策略 | 固定保守值,散熱裕度未充分利用 | 依環境濕度動態調整,兼顧效能與防結露安全 |
| 濾網更換排程 | 依固定週期更換,可能過早或過晚 | 依實測壓差排程,減少不必要更換與阻塞風險 |
| 系統可視性 | 局部監測,缺乏整合視圖 | 全點位整合進製程監控平台,即時掌握全貌 |
5.3 投資效益分析框架
CDU 監測系統的投資效益,可以從三個面向量化:
| 效益面向 | 量化方式 | 典型影響 |
|---|---|---|
| 停機損失規避 | 非計畫停機時數 × 每小時服務中斷損失 | AI 推理/訓練服務停機的每小時損失通常極高,即使縮短數小時的排查時間也具顯著效益 |
| 設備壽命延長 | 長期高溫或洩漏導致的硬體汰換成本 | GPU、冷板長期在異常溫度下運作,壽命可能縮短 30~50% |
| 能耗優化 | 供水溫度動態調整減少不必要的過度冷卻 | 避免固定保守設定造成的能源浪費 |
💡 決策關鍵
多數企業評估 CDU 監測系統時,容易只看「監測設備」的投入,卻忽略「不監測」的隱性成本——洩漏事故往往在被發現時已造成機櫃級損失,而濾網阻塞導致的降頻則會持續侵蝕 AI 運算服務的交付效能與客戶信賴。從案例經驗來看,多數投資可在導入後的前幾個月內,透過避免單次重大事故或持續的效能穩定性提升回收成本。所有方案均採現場評估後報價,實際投資規模依機房規模與監測點位數量而定。
第六章:CDU 與 AI 伺服器液冷監測常見問題 FAQ(20 題完整解答)
🟢 基礎觀念(第 1-5 題)
❓ Q1. 什麼是 CDU?在 AI 伺服器液冷系統中扮演什麼角色?
CDU(Coolant Distribution Unit,冷卻液分配單元)是液冷系統的核心控制設備,負責將冷卻液以正確的流量、溫度與壓力分配到每一片伺服器冷板,並透過板式熱交換器將機櫃廢熱交換至建築冷水系統或排至機房空氣。可以把它想像成液冷系統的「心臟」——沒有 CDU 精準的流量與溫度控制,即使機櫃本身配備了冷板,散熱效能也無法穩定發揮。
❓ Q2. AI 伺服器功率持續提升,為什麼傳統氣冷無法應對?
空氣的熱傳導效率遠低於液體(約差距數十倍),當單顆 GPU 熱設計功耗逼近 1,400 瓦、機櫃功耗突破 100 kW,傳統氣冷系統的散熱能力在約 700 瓦等級的晶片前已達物理極限。液冷透過液體直接接觸冷板帶走熱量,才能在有限空間內處理如此高密度的熱負荷,這也是 2026 年 AI 伺服器液冷滲透率快速攀升的核心原因。
❓ Q3. CDU 如何確保供水溫度不會過低造成結露?
成熟的 CDU 控制邏輯會同步監測機房環境溫濕度,動態計算露點溫度,並將二次迴路供水溫度設定值控制在露點以上,避免管路外壁與冷板表面產生結露。這需要溫濕度傳送器與供水溫度控制迴路的即時聯動,而非單純依賴固定溫度設定值。
❓ Q4. CDU 的一次迴路與二次迴路差異是什麼?為什麼要分開?
一次迴路連接建築冷水系統或室外冷卻塔,二次迴路則直接進入機櫃接觸伺服器冷板,中間以板式熱交換器隔離,兩側液體不混合。分開設計的用意是確保二次迴路水質純淨(多採去離子水或特殊配方冷卻液),同時避免一次迴路的壓力波動直接影響伺服器端的穩定性。
❓ Q5. CDU 需要 24 小時連續監測嗎?人工巡檢不夠嗎?
AI 訓練負載具有突發性尖峰特性,功耗可在數秒內從閒置跳升至滿載,壓力與流量可能隨之快速變化。人工巡檢通常以小時或天為週期,無法即時捕捉這類瞬間異常。因此 CDU 監測建議採連續即時量測,搭配動態閾值告警,才能在洩漏或阻塞等異常初期就被攔截,而非事後才發現。
🔵 技術選型(第 6-12 題)
❓ Q6. 濾網多久需要更換?如何判斷該更換了?
濾網更換週期不應僅依固定時間排程,而應搭配過濾器前後差壓監測(如 DPTX 差壓傳送器)。當壓差隨時間逐漸上升並接近預設閾值,即代表濾網阻塞程度已達需要更換的水準,這種依實測數據排程的方式能避免過早更換造成浪費,或過晚更換影響流量與散熱效能。
❓ Q7. CDU 壓力異常代表什麼?供水壓力過高或過低分別有什麼風險?
供水壓力過高可能代表管路阻塞或控制閥異常,長期下可能導致接頭滲漏甚至冷板承壓破裂;壓力過低則可能代表洩漏或幫浦效能不足,導致流量不足、散熱效能下降。CDU 系統通常會設定壓力上下限,搭配壓力開關在異常時秒級觸發停泵保護。
❓ Q8. 如何選擇適合 CDU 的壓力傳送器?精度要選多少級?
CDU 二次迴路操作壓力多落在 0.1~0.5 MPa,選型時建議量程為正常操作上限的 1.5~2 倍以涵蓋尖峰爆衝,精度建議選擇 0.2~0.5 級,並依冷卻液相容性選擇合適的隔膜材質。若需整合雲端平台或 PLC 系統,建議選用支援 HART 通訊或 4-20mA 輸出的智能型壓力傳送器,如 SDPT-3100。
❓ Q9. Delta-T(供回水溫差)代表什麼?如何用它判斷散熱效能?
依據 Q = m × c × ΔT 公式,在流量固定的前提下,供回水溫差直接反映機櫃實際帶走的熱量。若 Delta-T 異常縮小,即使回水溫度看似正常,也可能代表流量已經因阻塞而下滑,系統被迫以更大溫差維持相同散熱量——這正是為何供水與回水溫度必須成對監測,而非只看單一數值。
❓ Q10. CDU 發生洩漏該如何第一時間偵測?
洩漏監測建議採雙層防護:一是膨脹桶或儲液桶的連續液位監測(如 SLPTX),液位持續緩慢下降即代表系統可能存在隱性洩漏;二是機櫃底部的洩漏感測,作為液體實際滴漏時的最後一道告警防線,兩者搭配可大幅縮短從洩漏發生到被發現的時間差。
❓ Q11. 液冷系統該選 Liquid-to-Liquid 還是 Liquid-to-Air CDU?
一般原則是依機櫃功率密度決定:Liquid-to-Liquid CDU 散熱效能最佳,適合功率密度 50 kW/機櫃以上或需要極致 PUE 表現的場域,但需連接建築冷水管路;Liquid-to-Air CDU 免接建築水管、安裝彈性高,適合初期導入或功率密度相對較低(10~50 kW/機櫃)的場域。實務上仍建議依現場冷卻塔或冰水系統條件綜合評估。
❓ Q12. HART 通訊與 4-20mA 類比訊號有什麼差異?CDU 監測該選哪個?
4-20mA 為傳統類比訊號,成本較低、相容性廣,適合單純的數值傳輸;HART 通訊則在同一組類比訊號上疊加數位通訊能力,可傳輸更多診斷資訊(如感測器健康狀態),並能與雲端平台雙向溝通,適合需要遠端診斷與 48 小時前預警分析的進階監測需求。兩者可依系統整合複雜度混合搭配使用。
💰 成本效益與導入規劃(第 13-16 題)
❓ Q13. CDU 監測系統需要冗餘備援嗎?為什麼?
CDU 本身的循環幫浦多採 N+1 冗餘設計,監測儀表同樣建議在關鍵點位(如壓力保護開關)採用備援訊號,避免單一感測器故障導致保護機制失效。對於零停機容忍度的場域,關鍵監測迴路的冗餘設計是必要投資,而非過度規格。
❓ Q14. CDU 監測系統的投資大概要準備多少預算?
昶特 ATLANTIS 所有產品採報價制,實際投資規模需依機房規模、機櫃數量、監測點位密度與是否需要雲端整合而定。建議先由工程團隊現場評估現況(機櫃數量、功率密度、既有監控系統),再依基礎型或進階型配置規劃分階段導入預算,避免一次性投入過度規格。
❓ Q15. 導入 CDU 監測系統後,多久可以回收投資?
回收速度取決於原本的風險暴露程度——若機房過去曾發生洩漏或降頻事件,監測系統往往能在避免單次重大事故的過程中快速回本;若屬於預防性導入,效益則會逐步展現在減少非計畫停機、延長設備壽命與優化能耗三個面向。實務上多數案例可在導入後的前幾個月內看到明確效益。
❓ Q16. 現有液冷機房沒有完整監測,可以分階段升級嗎?
可以。建議的分階段路徑是:先在供回水主迴路加裝成對溫度與壓力監測(掌握 Delta-T 與基本壓力狀態),第二階段加入濾網壓差與液位監測(預防阻塞與洩漏),第三階段整合 HART 通訊與雲端平台(達成動態預警)。每個階段都能獨立產生效益,不需要一次到位。
🔧 維護、材質相容與應用場景(第 17-20 題)
❓ Q17. 冷卻液種類(純水/乙二醇)會影響儀表選型嗎?
會。不同冷卻液配方對感測器隔膜與殼體材質的相容性要求不同,尤其乙二醇混合液或含特殊添加劑的配方液,建議選用不鏽鋼或特殊隔膜材質的感測元件,必要時可搭配隔膜座(如 ILDS 系列)進行介質隔離,避免冷卻液直接接觸精密感測元件影響壽命與精度。
❓ Q18. 機櫃功率超過 100kW,CDU 監測配置需要特別調整嗎?
需要。超高功率密度機櫃(100kW 以上)通常伴隨更大的瞬間負載波動與更高的流量需求,監測系統的反應速度要求更嚴苛,建議採進階型配置:全點位監測、HART 智能通訊、雲端動態閾值預警,並在關鍵保護迴路加入冗餘備援,確保尖峰爆衝時仍能秒級反應。
❓ Q19. 儀表多久需要校正一次?
工業量測儀表的校正週期建議依產業規範與現場使用強度決定,一般建議每年至少一次,高精度或關鍵保護迴路建議縮短至半年一次。昶特 ATLANTIS 提供 TAF 認可校正服務與完整材質證明書,協助企業符合稽核與品質管理要求。
❓ Q20. 昶特 ATLANTIS 在 CDU 監測領域的優勢是什麼?
昶特 ATLANTIS 擁有 31 年工業儀表自主製造經驗,產品線涵蓋壓力、溫度、液位、流量等 CDU 監測所需的完整品項,並提供 HART/4-20mA 等多種訊號整合能力。相較於單純代理進口品牌的通路商,我們能依現場冷卻液特性、管徑與壓力等級客製化調整規格,並提供 24 小時緊急備品與 TAF 認可校正服務,確保 AI 資料中心的液冷監測系統長期穩定運作。
第七章:延伸閱讀與相關技術指南
CDU 監測只是 AI 資料中心散熱管理的其中一環,若想更全面掌握機房溫控、儀表選型與各產業應用場景,可參考昶特 ATLANTIS 知識庫中以下相關文章:
建議工程團隊在規劃 CDU 監測系統時,同步參考機房整體溫控策略與既有 HVAC 系統的整合方式,避免各子系統各自為政、數據無法互相對照的情況。
結論:CDU 監測,是 AI 資料中心散熱效能的最後一道防線
當 AI 伺服器的功率密度持續往 1 MW/機櫃的方向邁進,液冷已經不再是「要不要導入」的選擇題,而是「如何確保穩定運作」的必答題。而 CDU 作為整套液冷系統的心臟,其散熱效能能否維持,最終取決於壓力、溫度、流量、液位四大類監測儀表能否即時、準確地掌握系統狀態——供回水溫差是否符合設計散熱量、供水壓力是否維持在安全區間、濾網是否已接近阻塞臨界點、膨脹桶液位是否透露隱性洩漏的訊號。
這些看似單點的監測數據,串聯起來就是一套完整的預警系統:能在洩漏造成機櫃報廢之前發出警報,能在濾網阻塞導致 GPU 降頻之前排程更換,能在供水溫度過低造成結露之前動態調整設定。這正是本文反覆強調的核心觀點——CDU 的散熱效能,從來不是單靠設備本身的規格撐起來的,而是設備與監測系統協同運作的結果。
昶特 ATLANTIS 以 31 年工業量測製造經驗,將壓力傳送器、溫度傳送器、流量開關、液位傳送器等完整品項,重新整合為一套因應 AI 資料中心液冷需求的監測解決方案。無論貴公司的機房正處於初期試點規劃,還是已運營中的高密度機櫃需要升級監測系統,我們都能依現場條件提供客製化的配置建議。
準備強化您的 CDU 監測系統?
告訴我們您的機房規模、機櫃功率密度與現有監控系統狀況,昶特 ATLANTIS 工程團隊將為您規劃最適合的 CDU 監測配置方案,所有產品均採現場評估後報價。
📞 業務一部 Ian|電話:02-2820-3405|信箱:ian@atlantis.com.tw
📞 業務二部 Nori|電話:02-2820-3405|信箱:nori@atlantis.com.tw
昶特有限公司|台北市北投區致遠一路二段 109 號
傳真:02-2827-0646/02-2820-3406|公司官網:re-atlantis.tw