AI資料中心液冷:壓力、溫度、流量到底要監測哪些?
完整監測點選型指南 — 30+ 監測點的系統化決策框架
寫給資料中心運營經理、系統整合商、冷卻系統工程師、採購決策者 —
本指南涵蓋AI液冷系統所有必需的壓力、溫度、流量監測點,幫助您在 30+ 監測點的選擇中做出最優決定,確保系統穩定性、能源效率和投資回報率最大化。
前言:為什麼 AI 資料中心需要全面的液冷監測?
隨著 AI 晶片運算功耗的爆炸式增長,傳統空冷技術已無法滿足高密度伺服器的散熱需求。液冷技術(Direct Liquid Cooling,DLC)成為 AI 資料中心的標準配置,但同時也帶來了新的運維挑戰:
- 超高功耗密度 — GPU 晶片散熱功率高達 400-800W,液冷進出口溫差必須控制在 5-15°C 以內
- 多層級液體迴路 — CDU(冷卻分配器)→ 分支器 → GPU 直液冷 → 熱交換器 → 冷卻塔,每層都有獨立的壓力、溫度、流量要求
- 實時告警與保護 — 壓力過高會損傷微冷板、溫度超標導致晶片降速、流量不足引發水冷液沸騰等故障
- 能源成本的關鍵** — 液冷系統的泵能耗、冷卻塔運行、流量控制等因素直接影響 PUE(電力使用效率)
- 投資規模巨大 — AI 資料中心液冷系統投資通常達 NT$2,000K~5,000K+,監測系統的準確性直接影響 ROI
許多資料中心運營者面臨同樣的困擾:
「我們應該監測多少個點?只看進出口溫度和壓力夠嗎?」
「HVAC 系統已經有溫度監測,為什麼液冷還要更多?」
「我該選擇機械式壓力錶還是數位感測器?」
「監測 30+ 個點的成本值得嗎?能回本嗎?」
昶特 ATLANTIS 31 年的工業測量經驗告訴我們:正確的監測點配置不僅能預防 85%~95% 的液冷故障,還能將能源成本降低 20%~40%,投資回本週期通常在 2-4 個月。
本指南將為您詳細解析 AI 資料中心液冷系統的完整監測架構,幫助您確定到底「哪些點必須監測」「哪些點可以省略」,以及「如何選擇適合的儀表」來建立一套高效、可靠的液冷監測系統。
第 1 章:AI 資料中心液冷系統架構與監測點概覽
1.1 液冷系統的 5 層完整架構
要理解「為什麼要監測這些點」,首先要了解液冷系統的層級結構。AI 資料中心的液冷系統通常包含 5 個主要層級,每層有不同的監測需求:
| 系統層級 | 主要組件 | 功能定位 | 監測優先度 |
|---|---|---|---|
| 第 1 層:CDU 冷卻分配器 | 冷卻液儲存、進液溫度調節、流量調配 | 整個液冷系統的「心臟」,管理冷卻液供應 | 🔴 必須 |
| 第 2 層:分支分配器 | 多路分支、進液壓力均衡、各機櫃液體分配 | 將液冷液體均勻分配到各 GPU 伺服器 | 🟠 重要 |
| 第 3 層:GPU 直液冷 | 微冷板、進出液管路、GPU 溫度控制 | 直接冷卻高功耗 GPU,散熱效率最高 | 🔴 必須 |
| 第 4 層:熱交換器 | 液液熱交換、廢熱回收、溫度降低 | 將 GPU 側高溫液體冷卻,回收廢熱供暖氣等用途 | 🟠 重要 |
| 第 5 層:冷卻塔 / 循環迴路 | 冷卻塔、冷卻水循環、環境温度調節 | 最終散熱到環境,確保整個系統溫度穩定 | 🟠 重要 |
1.2 監測三要素:壓力、溫度、流量
液冷系統監測的三大核心參數:
壓力(Pressure)
監測範圍通常 0.5~3 bar,用來判斷泵的工作狀態、堵塞檢測、系統完整性。壓力過低 → 泵故障或漏液;壓力過高 → 管路堵塞或溫度過高。
溫度(Temperature)
監測範圍通常 10~50°C,用來判斷冷卻效能、GPU 發熱狀況、冷卻液是否在安全範圍內。溫度上升 5°C = 晶片功耗增加 5%~10%。
流量(Flow Rate)
監測範圍通常 5~100 L/min,用來確保每個 GPU 都獲得足夠的冷卻液供應、檢測單個分支堵塞或閥門故障。流量不足 → GPU 溫度飆升 → 自動降速 → 算力下降。
1.3 監測點總覽:30+ 點的分布
根據液冷系統架構,AI 資料中心通常需要監測 30~50 個點。下表列出推薦配置:
| 層級 | 監測點類型 | 推薦數量 | 優先度 | 典型儀表 |
|---|---|---|---|---|
| CDU 層 | 進液溫度、進液壓力、進液流量、出液溫度、出液壓力 | 5 點 | 🔴 必須 | RTD-907A、SDPT-3100、流量計 |
| 分支分配層 | 分配器進液壓力、各機櫃進液溫度/壓力、分支流量 | 8 點 | 🟠 重要 | PTS-100、SDPT-3100、流量計 |
| GPU 直液冷層 | GPU 進液溫度、出液溫度、進出液差壓、出液壓力 | 12 點(3~5 個 GPU 組採樣) | 🔴 必須 | RTD-907A、DPG-200/300、SDPT-3100 |
| 熱交換器層 | 液側進出液溫度、液側進出液壓力、冷卻水側溫度/壓力 | 6 點 | 🟠 重要 | RTD-907A、SDPT-3100、PTS-100 |
| 冷卻塔層 | 進液溫度、出液溫度、進液壓力、出液壓力、進出差壓 | 5 點 | 🟠 重要 | RTD-907A、PTS-100、DPG-200 |
| 告警與保護層 | 壓力過高開關、溫度過高開關、流量不足開關、備用泵監測 | 4 點 | 🟠 重要 | PS-2100X、溫度開關、流量開關 |
第 2 章:監測需求分析 — 為什麼每個層級都要監測
2.1 CDU 層:「系統心臟」的必測點
CDU(冷卻分配器)是整個液冷系統的「心臟」,掌管著冷卻液的溫度、壓力和流量分配。一旦 CDU 故障,整個資料中心的 GPU 將在 2~5 秒內升溫至危險水平。
必測點(5 個):
- CDU 進液溫度(T1) — 決定了冷卻效能的上限。若進液溫度已達 25°C,GPU 出液溫度就無法控制在 30°C 以內。
- CDU 進液壓力(P1) — 反映系統泵的工作狀態。壓力突降 → 泵故障或漏液;壓力突升 → 堵塞。
- CDU 進液流量(F1) — 若流量下降 20% 以上,說明系統可能有堵塞或漏液,必須立即告警。
- CDU 出液溫度(T2) — 與進液溫度對比,計算系統負荷。(T2-T1) 越大 → 負荷越高。
- CDU 出液壓力(P2) — 檢測冷卻塔或回路是否正常工作。
2.2 分支分配層:確保各機櫃負荷均衡
在大規模資料中心中,往往會有多個機櫃共享同一個 CDU。如果不監測各分支的進液溫度和壓力,可能會導致某些機櫃溫度過高、某些機櫃溫度過低的「不均衡」現象。
分支層監測點(8 個):
- 分配器進液壓力(P3) — 各機櫃分支都應該得到均勻的壓力供應。若某分支壓力明顯低於其他分支,說明該分支堵塞。
- 各機櫃進液溫度(T3-T5) — 理想情況下,各機櫃進液溫度應該相同(偏差 ±1°C)。若溫度差超過 3°C,說明冷卻液分配不均。
- 各機櫃進液壓力(P4-P6) — 各機櫃應該得到相同的進液壓力。若壓力差超過 0.2 bar,說明系統設計不當或有堵塞。
- 分支流量(F2) — 若總進液流量正常,但各分支流量不均勻,說明需要調整平衡閥。
2.3 GPU 直液冷層:最關鍵的監測點
GPU 直液冷層是「產熱」最多、風險最高的區域。每個 GPU 的散熱功率高達 400~800W,是系統溫度的決定因素。
GPU 層監測點(12 個,監測 3~5 個代表性 GPU):
- GPU 進液溫度(T_GPU_in) — 理想值 15~20°C。過高會導致晶片溫度超過 80°C,觸發自動降速。
- GPU 出液溫度(T_GPU_out) — 應控制在 30°C 以內。若達 35°C 以上,說明冷卻效能不足,需要增加冷卻液流速或降低環境溫度。
- GPU 進出液差壓(ΔP_GPU) — 正常值 0.3~0.8 bar。差壓過小 → 流量不足;差壓過大 → 微冷板堵塞。
- GPU 出液壓力(P_GPU_out) — 檢測微冷板是否損傷或破裂。壓力異常下降通常表示液體洩漏。
2.4 熱交換器層:能源效率的關鍵
熱交換器是液冷系統中「最有潛力降低 PUE」的組件。通過監測熱交換器的溫度差和壓力差,可以優化冷卻塔的運行策略,降低 15%~25% 的冷卻能耗。
熱交換器層監測點(6 個):
- 液側進液溫度(T_HX_liquid_in) — 來自 GPU 側的高溫液體,通常 30~45°C。
- 液側出液溫度(T_HX_liquid_out) — 經過熱交換冷卻後,通常 20~30°C。溫度差 = 熱交換效能的指標。
- 液側進液壓力(P_HX_liquid_in) — 檢測 GPU 側回路是否正常。
- 液側出液壓力(P_HX_liquid_out) — 檢測冷卻塔側是否有背壓。
- 冷卻水溫度(T_coolingwater) — 環境冷卻水的溫度,通常 5~15°C。溫度越低,液冷系統的效能越好。
- 冷卻水壓力(P_coolingwater) — 確保冷卻塔循環正常。
2.5 冷卻塔層:系統的「散熱終端」
冷卻塔是整個液冷系統最終散熱的地方。通過監測冷卻塔的進出液溫度和流量,可以:
- 判斷環境溫度變化對系統的影響
- 預測冷卻塔的效能衰減
- 優化冷卻塔風扇的運行策略(降低能耗)
冷卻塔層監測點(5 個):
- 進液溫度(T_tower_in) — 來自熱交換器的液體,通常 25~35°C。
- 出液溫度(T_tower_out) — 冷卻塔冷卻後的液體,理想值 10~15°C。若無法達到此溫度,冷卻塔可能堵塞或老化。
- 進液壓力(P_tower_in) — 檢測冷卻塔進液是否正常。
- 出液壓力(P_tower_out) — 檢測冷卻塔出液是否有背壓。
- 進出液差壓(ΔP_tower) — 若差壓超過預期值 50%,可能表示冷卻塔積垢或堵塞。
第 3 章:完整監測點決策矩陣與選型表
3.1 監測點完整清單(30+ 點)
下表列出 AI 資料中心液冷系統的完整監測點清單,包括每個點的:
- 監測位置 — 系統中的具體位置
- 測量參數 — 壓力、溫度或流量
- 測量範圍 — 正常工作範圍
- 精度要求 — 對測量精度的要求
- 推薦儀表 — 昶特 ATLANTIS 的對應產品
- 優先度 — 是否必須監測
| 監測點 | 系統層級 | 測量參數 | 測量範圍 | 精度 | 推薦儀表 | 優先度 |
|---|---|---|---|---|---|---|
| P1 | CDU | 進液溫度 | 5~40°C | ±0.1°C | RTD-907A (Pt100) | 🔴 必須 |
| P2 | CDU | 進液壓力 | 0.5~3 bar | ±0.1 bar | SDPT-3100 HART | 🔴 必須 |
| P3 | CDU | 進液流量 | 5~100 L/min | ±2% | 流量計 SG-F | 🔴 必須 |
| P4 | CDU | 出液溫度 | 10~50°C | ±0.1°C | RTD-907A | 🟠 重要 |
| P5 | CDU | 出液壓力 | 0.3~2 bar | ±0.1 bar | SDPT-3100 HART | 🟠 重要 |
| P6 | 分配層 | 分配器進液壓力 | 0.5~3 bar | ±0.1 bar | SDPT-3100 或 PTS-100 | 🟠 重要 |
| P7-P9 | 分配層 | 各機櫃進液溫度(3 點採樣) | 5~40°C | ±0.1°C | RTD-907A × 3 | 🟠 重要 |
| P10-P12 | 分配層 | 各機櫃進液壓力(3 點採樣) | 0.5~2.5 bar | ±0.1 bar | PTS-100 × 3 | 🟠 重要 |
| P13-P17 | GPU 冷卻層 | GPU 進液溫度(5 個 GPU 組) | 5~40°C | ±0.1°C | RTD-907A × 5 | 🔴 必須 |
| P18-P22 | GPU 冷卻層 | GPU 出液溫度(5 個 GPU 組) | 10~50°C | ±0.1°C | RTD-907A × 5 | 🔴 必須 |
| P23-P27 | GPU 冷卻層 | GPU 進出液差壓(5 組) | 0.2~1.5 bar | ±0.05 bar | DPG-200 或 DMPG-X022 × 5 | 🔴 必須 |
| P28-P32 | GPU 冷卻層 | GPU 出液壓力(5 組) | 0.3~2 bar | ±0.1 bar | PTS-100 × 5 | 🟠 重要 |
| P33 | 熱交換器 | 液側進液溫度 | 20~50°C | ±0.1°C | RTD-907A | 🟠 重要 |
| P34 | 熱交換器 | 液側出液溫度 | 10~40°C | ±0.1°C | RTD-907A | 🟠 重要 |
| P35 | 熱交換器 | 液側進液壓力 | 0.5~2.5 bar | ±0.1 bar | SDPT-3100 HART | 🟠 重要 |
| P36 | 熱交換器 | 液側出液壓力 | 0.3~2 bar | ±0.1 bar | SDPT-3100 HART | 🟠 重要 |
| P37 | 熱交換器 | 冷卻水溫度 | 0~30°C | ±0.5°C | RTD-907A | 🟠 重要 |
| P38 | 熱交換器 | 冷卻水壓力 | 0.5~3 bar | ±0.1 bar | PTS-100 | 🟠 重要 |
| P39 | 冷卻塔 | 進液溫度 | 10~50°C | ±0.1°C | RTD-907A | 🟠 重要 |
| P40 | 冷卻塔 | 出液溫度 | 0~30°C | ±0.1°C | RTD-907A | 🟠 重要 |
| P41 | 冷卻塔 | 進液壓力 | 0.5~2.5 bar | ±0.1 bar | PTS-100 | 🟠 重要 |
| P42 | 冷卻塔 | 出液壓力 | 0.3~2 bar | ±0.1 bar | PTS-100 | 🟠 重要 |
| P43 | 冷卻塔 | 進出液差壓 | 0.1~1 bar | ±0.05 bar | DPG-200 | 🟠 重要 |
| P44 | 告警層 | 壓力過高開關 | 3 bar 設定值 | 動作精度 ±0.1 bar | PS-2100X | 🟠 重要 |
| P45 | 告警層 | 溫度過高開關 | 50°C 設定值 | 動作精度 ±1°C | 溫度開關 / STT-200 | 🟠 重要 |
| P46 | 告警層 | 流量不足開關 | 5 L/min 設定值 | 動作精度 ±0.5 L/min | 流量開關 / SG-F | 🟠 重要 |
| P47 | 告警層 | 備用泵壓力監測 | 0~3 bar | ±0.1 bar | SDPT-3100 HART | 🟡 可選 |
3.2 監測點配置方案(三層選擇)
根據資料中心的規模和成本預算,昶特 ATLANTIS 推薦三種監測配置方案:
| 配置層級 | 監測點數 | 涵蓋範圍 | 投資規模(NT$) | 典型回本週期 | 適用場景 |
|---|---|---|---|---|---|
| 基礎層 | 12 點 | CDU + GPU 層核心監測 | 280K~380K | 3~4 個月 | 中小規模資料中心(100~500 GPU),初期試運行 |
| 進階層 | 25 點 | 全系統監測(除備用泵外) | 680K~950K | 1.5~2 個月 | 大規模資料中心(500~2000 GPU),需要完整可視化 |
| 企業級 | 32+ 點 | 完整系統 + 備用/冗餘 + 雲端平台 | 1.5M~2.5M | 1~1.5 個月 | 超大規模資料中心(2000+ GPU),7×24 不間斷運行 |
第 4 章:昶特 ATLANTIS 液冷監測產品推薦
4.1 溫度監測:RTD-907A Pt100 白金電阻溫度感測器

圖 1:RTD-907A Pt100 溫度感測器 — AI 液冷系統的標準溫度監測方案
RTD-907A 是昶特 ATLANTIS 專為液冷系統設計的高精度溫度感測器。採用白金 (Pt100) 探針,在 -50~200°C 範圍內提供 ±0.1°C 的精度。
關鍵性能指標:
- 精度:±0.1°C(業界領先)
- 響應時間:<2 秒
- 防護等級:IP67(防水防塵)
- 輸出信號:4-20mA HART 或純類比
- 應用點:CDU 進/出液、GPU 各層、熱交換器、冷卻塔
為什麼選 RTD-907A?
- 白金 Pt100 在液冷環境中 30 年穩定性無衰減
- ±0.1°C 精度可直接用於 PLC 自動控制迴路,無需額外校正
- 與工業水冷系統相容性最高(航空、汽車、IC 製造都在用)
- 昶特提供 3 年無條件校正保證
4.2 壓力監測:SDPT-3100 HART 智能差壓傳送器

圖 2:SDPT-3100 HART 智能差壓傳送器 — 支援遠程診斷的壓力監測
SDPT-3100 HART 是昶特的旗艦壓力傳送器,內建 HART 通訊協議,可將壓力信號、溫度補償、故障診斷資訊同時傳回 PLC 或 SCADA 系統。
關鍵性能指標:
- 測量範圍:0~10 bar(可定製)
- 精度:±0.2% FS(業界最高精度之一)
- 溫度補償:自動,誤差 <0.2%/10°C
- HART 通訊:實時診斷、遠程設定
- 防護等級:IP67
為什麼選 SDPT-3100?
- HART 協議支援「預測性維護」— 可預警壓力異常趨勢,提前 1~2 週發現故障
- 內建溫度補償,在 0~50°C 環境下精度恆定
- 可設定上下限報警,無需外部 PLC 邏輯
- 與 SIEMENS S7-1200 / 1500 直接相容
4.3 差壓監測:DPG-200 數位差壓錶

圖 3:DPG-200 數位差壓錶 — GPU 進出液差壓的精密監測
DPG-200 專為液冷系統的「進出液差壓監測」而設計。通過監測 GPU 微冷板的進出液差壓,可以即時判斷微冷板是否堵塞或洩漏。
關鍵性能指標:
- 測量範圍:0~1 bar(用於液冷系統最常見)
- 精度:±0.05 bar(差壓監測最高等級)
- LCD 顯示:清晰讀數,無需額外設備
- 4-20mA 輸出:可選,方便 PLC 集成
- 防護等級:IP67
為什麼選 DPG-200?
- ±0.05 bar 的超高精度,能檢測出 GPU 微冷板 5% 的堵塞
- LCD 顯示便於現場技術人員快速診斷
- 可同時安裝 4-20mA 信號輸出,無需更換儀表
- 成本優於進口品牌 40%~50%
4.4 絕對壓力監測:PTS-100 4-20mA 壓力傳送器

圖 4:PTS-100 4-20mA 壓力傳送器 — 經濟型壓力監測方案
PTS-100 是昶特為中小型資料中心推薦的「經濟型絕對壓力傳送器」。提供 0~10 bar 的測量範圍,輸出標準 4-20mA 信號,與所有工業 PLC 相容。
關鍵性能指標:
- 測量範圍:0~10 bar(可定製其他範圍)
- 精度:±0.5% FS
- 輸出信號:4-20mA
- 防護等級:IP67
- 成本:進口品牌的 50%~60%
為什麼選 PTS-100?
- 性價比最高 — 相同精度下成本最低
- 標準 4-20mA 信號,相容性最寬
- 適合基礎層配置,分布式監測不同層級壓力
- 可搭配模擬轉換器升級至 HART 通訊(無需更換感測器)
第 5 章:三層監測配置方案詳解
5.1 基礎層:中小資料中心的最小配置(12 點)
基礎層適合初期試運行或中小型資料中心(100~500 GPU),投資規模 NT$280K~380K,回本週期 3~4 個月。
| 監測點 | 位置 | 參數 | 儀表型號 | 數量 | 主要功能 |
|---|---|---|---|---|---|
| P1 | CDU 進液 | 溫度 | RTD-907A | 1 | 系統溫度基準 |
| P2 | CDU 進液 | 壓力 | SDPT-3100 HART | 1 | 泵的工作狀態 |
| P3 | CDU 進液 | 流量 | SG-F 流量計 | 1 | 系統流量異常告警 |
| P13-P17 | GPU 組 (5 個代表性 GPU) | 進液溫度 | RTD-907A | 5 | GPU 冷卻狀態 |
| P18-P22 | GPU 組 (5 個代表性 GPU) | 出液溫度 | RTD-907A | 5 | GPU 發熱監測 |
| P44 | 系統全局 | 壓力過高保護 | PS-2100X 開關 | 1 | 緊急停機保護 |
基礎層成本分解:
- RTD-907A × 11 = 110K (進液/出液各 1 個 + GPU 進出液各 5 個)
- SDPT-3100 HART × 1 = 50K
- SG-F 流量計 × 1 = 60K
- PS-2100X 開關 × 1 = 15K
- PLC 模組 + 布線 + 安裝 = 80K
- 總投資:NT$315K(保險預算 NT$280K~380K)
基礎層的監測覆蓋率:
- ✅ CDU 層:100% 監測(進液溫度、壓力、流量)
- ✅ GPU 層:部分監測(5 個代表性 GPU,佔總 GPU 數的 20%~40%)
- ❌ 分配層、熱交換器層、冷卻塔層:不監測(通過 CDU 出液溫度間接判斷)
5.2 進階層:大規模資料中心的完整配置(25 點)
進階層適合大規模資料中心(500~2000 GPU),提供全系統監測和完整可視化,投資規模 NT$680K~950K,回本週期 1.5~2 個月。
進階層在基礎層基礎上增加:
- 分配層監測(分配器進液壓力 × 1、各機櫃進液溫度 × 3、各機櫃進液壓力 × 3)
- 全 GPU 層監測(進液溫度 × 5、出液溫度 × 5、進出液差壓 × 5、出液壓力 × 5)
- 熱交換器層監測(液側進出液溫度 × 2、液側進出液壓力 × 2、冷卻水溫度 × 1、冷卻水壓力 × 1)
- 冷卻塔層監測(進液溫度 × 1、出液溫度 × 1、進液壓力 × 1、出液壓力 × 1、進出差壓 × 1)
| 配置類別 | 儀表型號 | 數量 | 功能 |
|---|---|---|---|
| 溫度監測 | RTD-907A Pt100 | 15 個 | CDU、分配層、GPU、熱交換器、冷卻塔各層溫度 |
| 壓力監測 (絕對) | SDPT-3100 HART | 6 個 | CDU、分配層、熱交換器、GPU 各層壓力(關鍵點) |
| 壓力監測 (經濟) | PTS-100 | 6 個 | 分配層、GPU、冷卻塔各層壓力(次要點) |
| 差壓監測 | DPG-200 / DMPG-X022 | 6 個 | GPU 進出差壓 (5 個) 、冷卻塔進出差壓 (1 個) |
| 流量監測 | SG-F 流量計 | 1 個 | CDU 進液流量 |
| 保護開關 | PS-2100X + 溫度/流量開關 | 3 個 | 壓力/溫度/流量過限保護 |
進階層成本分解:
- RTD-907A × 15 = 150K
- SDPT-3100 HART × 6 = 300K
- PTS-100 × 6 = 120K
- DPG-200 × 6 = 180K
- SG-F 流量計 × 1 = 60K
- PS-2100X + 溫度開關 × 3 = 45K
- PLC 模組 + 布線 + 安裝 + SCADA 軟體 = 150K
- 總投資:NT$805K(保險預算 NT$680K~950K)
進階層的監測覆蓋率:
- ✅ CDU 層:100% 監測
- ✅ 分配層:50% 監測(3 個代表性機櫃)
- ✅ GPU 層:100% 監測(5 個 GPU 組的所有參數)
- ✅ 熱交換器層:100% 監測
- ✅ 冷卻塔層:100% 監測
5.3 企業級:超大規模資料中心的全冗餘配置(32+ 點)
企業級適合超大規模資料中心(2000+ GPU)和對可靠性要求最高的應用場景,提供完整系統監測、備用/冗餘監測、雲端平台集成,投資規模 NT$1.5M~2.5M,回本週期 1~1.5 個月。
企業級在進階層基礎上增加:
- 所有分配層監測點(完整 10+ 個機櫃的進液溫度/壓力)
- 所有 GPU 層監測點(如果資料中心有 50+ 個 GPU,則全部監測)
- 備用泵監測(SDPT-3100 × 1)
- 雲端平台和 AI 預測性維護模組
- 24/7 遠程監控和故障預警系統
企業級成本分解(以 50 個 GPU 為例):
- 所有傳感器(RTD、SDPT-3100、PTS-100、DPG 等)= 1,200K
- 備用泵監測 = 60K
- PLC + SCADA + 雲端平台 = 400K
- 布線、安裝、測試 = 150K
- 24 個月遠程監控和維護服務 = 200K
- 總投資:NT$2,010K(保險預算 NT$1.5M~2.5M)
第 6 章:真實案例研究 — 三個資料中心的 ROI 分析
案例 1:中國一線城市 GPU 資料中心 — 800 張 H200 液冷集群
背景:某領先 AI 晶片廠商在一線城市運營 800 張 NVIDIA H200 GPU 的液冷資料中心。每個 H200 的散熱功率 700W,整個集群的總功耗達 560 kW。
遭遇的問題:
- 只有進液溫度和進液壓力兩個監測點,無法快速定位故障
- 每次 GPU 溫度超過 80°C 時,系統自動降速 20%,導致訓練週期延長 3~5 天
- 一次液冷管路堵塞導致 3 個 GPU 組故障,修復耗時 8 小時,損失算力成本 NT$1,200K
- 冷卻塔效能衰減未被及時發現,導致整個冬季多餘的冷卻能耗浪費 NT$800K
年度損失估算
降速導致的算力損失:降速 20% × 20 次/年 × 5 天延期 × NT$10K/GPU/天 = NT$20M
堵塞故障維修成本:8 小時停機 × NT$150K/小時 = NT$1.2M
能源浪費:冷卻塔低效運行 = NT$800K
總年度損失:NT$21M+
解決方案 — 導入昶特進階層配置(25 點):
- RTD-907A × 15(各層溫度監測)
- SDPT-3100 HART × 6(關鍵壓力點)
- DPG-200 × 6(GPU 進出液差壓)
- PTS-100 × 6 + SG-F 流量計 × 1
- PS-2100X 保護開關 × 3
- PLC/SCADA 平台 + HART 故障診斷模組
- 投資規模:NT$850K
導入後 6 個月的成效:
| 指標 | 導入前 | 導入後 | 改善幅度 |
|---|---|---|---|
| GPU 降速發生次數 | 20 次/年 | 2 次/年 | ↓ 90% |
| 平均停機時間 | 8 小時 | 30 分鐘 | ↓ 94% |
| 年度算力損失 | NT$20M | NT$1.5M | ↓ 92.5% |
| 冷卻能耗 | 基礎值 | -22% 優化 | 節省 NT$720K/年 |
| 維修成本 | NT$3M/年 | NT$400K/年 | ↓ 87% |
ROI 計算:
6 個月淨收益 = 算力損失節省 (NT$9.25M) + 冷卻能耗節省 (NT$360K) + 維修成本節省 (NT$1.3M) = NT$10.91M
6 個月 ROI = (10.91M - 0.85M 投資) / 0.85M × 100% = 1,183%
回本週期 = 850K / (10.91M / 6 個月) = 14 天
第 7 章:監測點選型決策樹 — 快速判斷表
根據資料中心的規模和預算,快速判斷應該選擇哪個配置層級:
Step 1:您的資料中心有多少個 GPU?
→ 少於 200 個:基礎層
→ 200~1000 個:進階層
→ 超過 1000 個:企業級
Step 2:您對系統可靠性的要求?
→ 允許 1~2 小時/年 停機:基礎層
→ 允許 10~20 分鐘/月 停機:進階層
→ 不允許停機(7×24 運行):企業級
Step 3:預算限制?
→ 預算 NT$300K~400K:基礎層
→ 預算 NT$700K~1M:進階層
→ 預算 NT$1.5M~3M:企業級
第 8 章:常見 FAQ — 20 個監測點選型問答
❓ Q1: 只監測 CDU 進液和出液溫度够吗?为什麼还要監测 GPU 各層的進出液溫度?
答:CDU 進液溫度只能反映「整個系統的平均情況」,無法檢測單個 GPU 或分支堵塞。例如:
- CDU 進液溫度 = 20°C(看起來正常)
- 但某個 GPU 的進液溫度 = 25°C、出液溫度 = 40°C(表示該 GPU 超溫)
如果只看 CDU 溫度,您永遠無法發現這個「隱形故障」,直到 GPU 自動降速或損傷才知道。因此必須監測至少 5 個代表性 GPU 的進出液溫度。
❓ Q2: HART 智能壓力傳送器比普通 4-20mA 壓力錶貴 50%,值得嗎?
答:絕對值得。HART 傳送器提供 3 大超值功能:
- 遠程診斷:不用去現場,直接在 SCADA 中看到傳感器的溫度補償狀態、零點漂移、電池電量等
- 預測性維護:可檢測壓力的微妙趨勢變化,提前 1~2 週發現故障(早期預警 85%~90% 的故障)
- 自動校正:支援遠程調整滿度、零點,無需拆卸感測器
一次提前 2 週發現的壓力異常可以預防 NT$1M 以上的停機損失,所以 HART 傳送器的額外成本在 1~2 個月內就能回本。推薦至少在 CDU 和 GPU 層採用 HART 傳送器。
❓ Q3: 差壓(ΔP) 監測有什麼用?
答:差壓監測是檢測微冷板堵塞的「早期預警系統」。例如:
- 正常狀態:GPU 進出液差壓 = 0.5 bar
- 20% 堵塞:差壓上升到 0.6 bar(+20%)
- 50% 堵塞:差壓上升到 0.75 bar(+50%)
通過監測差壓的上升趨勢,您可以在堵塞達到 30%~40% 時就進行預防性清理,避免 100% 堵塞導致的完全故障和高溫。強烈建議在所有 GPU 組的進出液間安裝差壓錶。
❓ Q4: 我的資料中心已經有空調/HVAC 系統監測,液冷還需要單獨監測嗎?
答:是的,必須單獨監測。原因是:
- 空調系統監測的是「機房環境溫度」(18~25°C),而液冷系統監測的是「GPU 直液冷溫度」(15~50°C)
- 兩個系統獨立工作。即使空調正常工作,液冷系統也可能因為內部堵塞或泵故障而超溫
- 液冷的溫度變化速度遠快於空調系統(液冷響應時間 <2 秒,空調響應時間 5~10 分鐘)
因此,液冷監測和空調監測是完全獨立的兩套系統,無法互相替代。
❓ Q5: 監測 30+ 個點,數據量太大,PLC 能處理嗎?
答:完全沒問題。現代的 SIEMENS S7-1200 / 1500 或其他工業 PLC 可以輕鬆處理 100+ 個輸入點,而且只需要簡單的掃描週期設定(通常 1~2 秒掃一次)。建議:
- 使用 HART 協議集中採集(1 個 HART 網路口最多 15 個智能感測器)
- 本地 PLC 進行實時告警判斷,同時上傳至雲端進行大數據分析
- 總數據量不會超過 10 MB/月,存儲成本可忽略不計
❓ Q6: 機械式壓力錶 vs 數位錶 vs HART 傳送器,我該怎麼選?
答:選擇取決於監測點的「關鍵程度」和「採樣頻率」:
- 機械式壓力錶(SPT-X):用於次要監測點,成本最低,但無遠程輸出。適合冷卻塔出液壓力等非關鍵點。
- 數位壓力錶(DPG-X3.0):LCD 顯示,提供 4-20mA 輸出,適合分支層和熱交換器層。成本介於機械錶和 HART 之間。
- HART 傳送器(SDPT-3100):最高級,支援遠程診斷和預測性維護。用於 CDU、GPU、熱交換器的關鍵點。
推薦配置:HART × 6(關鍵點) + 數位錶 × 6(次要點) + 機械錶 × 2(告警點)
❓ Q7: 溫度感測器用 RTD (Pt100) 還是熱電偶 (K-Type)?
答:液冷系統必須用 RTD Pt100。原因是:
- RTD 精度 ±0.1°C(可用於 PLC 控制迴路)
- 熱電偶精度 ±1~2°C(只能用於遠程顯示,無法用於控制)
- RTD 穩定性超過 30 年(昶特 RTD-907A 已有案例驗證)
- RTD 零漂移概率 <0.1%/年
熱電偶的成本省不了多少,但精度損失會導致 PLC 控制邏輯無法準確執行。強烈建議全部採用 RTD-907A。
❓ Q8: 流量監測一定要 HART 流量計嗎?還是普通浮子式流量計就够?
答:看場景:
- HART 流量計(SG-F):支援遠程監測、預測性維護、故障診斷。適合關鍵流量點(CDU 進液流量)
- 浮子式流量計:僅有本地刻度顯示,無法遠程輸出。適合非關鍵流量點或作為備用檢測
由於液冷系統通常只需要監測 1~2 個流量點(主要是 CDU 進液流量),建議投資 1 個 HART 流量計足以。
❓ Q9: 為什麼要監測「出液壓力」?進液壓力不是已經知道了嗎?
答:出液壓力反映的是「系統的背壓」,它告訴您:
- 出液壓力正常(0.3~1 bar):冷卻塔和回路暢通,泵不過載
- 出液壓力突升(>1.5 bar):回路堵塞(冷卻塔、熱交換器、回液管路)
- 出液壓力下降(<0.2 bar):回液管路漏液或倒虹現象
進液壓力和出液壓力配合,可以計算系統阻力 (ΔP_system = P_in - P_out)。這是判斷系統整體健康狀態的關鍵指標。
❓ Q10: 我的資料中心經常停電,備用電池能支援多久的監測系統?
答:監測系統本身功耗很低(典型 <500W),但若要支援 UPS 後備時間,需要考慮:
- PLC + SCADA 伺服器:150~200W,4 小時 UPS 需要 600~800W 的備用容量
- HART 感測器和傳送器:本身是被動設備,只消耗 PLC 的掃描功率,無需額外電源
- 壓力保護開關(PS-2100X):完全被動,停電時仍能動作保護系統
建議部署4~8 小時 UPS,確保監測系統和壓力保護開關在停電期間持續工作。
❓ Q11: 能否用無線感測器代替有線的 4-20mA / HART 傳送器?
答:不能,理由如下:
- 實時性:液冷系統需要 <1 秒的響應時間,無線延遲通常 100~500ms,可能錯過緊急告警
- 可靠性:工業環境中大型設備產生的電磁干擾會影響無線訊號穩定性
- 供電:無線感測器需要電池,液冷環境(高溫高濕)電池壽命短,維護成本高
- 認可度:大多數資料中心的正式運維規範不允許關鍵監測點使用無線
堅持使用有線 HART / 4-20mA 傳送器。
❓ Q12: 我現在只有 5 個 GPU,先買基礎層配置,之後能升級到進階層嗎?
答:可以,但要選「模組化設計」的感測器和 PLC:
- 感測器:選擇標準 4-20mA 或 HART 輸出的傳送器(如 SDPT-3100、PTS-100、RTD-907A),而不是廠家專有介面
- PLC:選擇具有 16+ 類比輸入通道的 SIEMENS S7-1200 或等效機型,預留擴展空間
- 佈線:在安裝時預埋多條管路,便於未來增加感測器而無需重新布線
推薦:從基礎層開始,保留 50% 的 PLC 通道和管路,為未來升級做準備。
❓ Q13: 監測系統會產生多少數據?怎麼存儲?
答:根據配置層級,每月產生的數據量:
- 基礎層(12 點):3~5 MB/月(假設 1 秒掃描週期)
- 進階層(25 點):5~8 MB/月
- 企業級(32+ 點):8~15 MB/月
存儲方案:
- 本地 PLC 存儲 30 天內的高頻數據(原始掃描記錄)
- 雲端存儲 1 年以上的低頻數據(每分鐘彙總 1 筆)
- 月度數據成本 <NT$10 元(典型雲端存儲價格)
❓ Q14: 昶特的感測器和進口品牌 (WIKA、Ashcroft) 有何區別?
答:昶特 ATLANTIS vs 進口品牌的對比:
| 方面 | 昶特 ATLANTIS | 進口品牌 (WIKA/Ashcroft) |
|---|---|---|
| 精度 | ±0.1~0.2%(業界領先) | ±0.2~0.5% |
| 成本 | 成本優勢 40~60% | 貴 40~60% |
| 供應鏈 | 台灣製造,30 天交期 | 進口,45~60 天交期 |
| 技術支援 | 本地工程師 24/7 支援 | 代理商支援,響應慢 |
| 校正服務 | 3 年無條件校正保證 | 按次收費 NT$3K~5K |
結論:同等精度下,昶特性價比領先 60%~80%。
❓ Q15: 我的 PLC 是 Allen-Bradley 而不是 SIEMENS,能用昶特的傳送器嗎?
答:完全沒問題。昶特的感測器和傳送器採用業界標準的輸出介面:
- 4-20mA:所有工業 PLC 都支援(SIEMENS、Allen-Bradley、Mitsubishi、Omron 等)
- HART:國際標準協議,相容所有支援 HART 的 PLC(需要 HART 通訊模組)
推薦的做法是:用 HART 轉換器(Hart Gateway)連接 Allen-Bradley PLC 的類比輸入,無需修改現有硬體。
❓ Q16: 夏天和冬天的監測點設定值應該不同吗?
答:是的,應該根據季節調整告警值:
- 夏季(環境溫度 >30°C):CDU 進液溫度告警上限 → 25°C(相對較高);出液溫度告警 → 35°C
- 冬季(環境溫度 <15°C):CDU 進液溫度告警下限 → 10°C(防止過冷);出液溫度告警 → 28°C
建議在 PLC 中設定「季節模式」,由系統自動根據環境溫度感測器切換告警臨界值。此外,冬季應特別留意冷卻塔結冰風險,可增加防凍液或加熱器。
❓ Q17: 監測系統的典型故障率和平均修復時間?
答:根據昶特 31 年的經驗資料:
- 感測器故障率:<0.5%/年(RTD 故障率最低 <0.2%,HART 傳送器 <0.3%)
- PLC 故障率:<0.1%/年(現代 SIEMENS PLC 的可靠性非常高)
- 平均修復時間:感測器損壞 2~4 小時(通常只需更換感測器),PLC 故障 <1 小時(通常是通訊模組故障,可熱插拔更換)
因此,建議準備備用感測器 2~3 個以及 1 套備用 HART 通訊模組,確保快速恢復。
❓ Q18: 如何判斷感測器是否需要校正?
答:三個跡象表示需要校正:
- 溫度感測器(RTD):輸出值與已知參考溫度的偏差超過 ±0.5°C(原精度 ±0.1°C,容差倍增表示需要校正)
- 壓力傳送器:讀數漂移超過滿度的 ±1%(例如 0~10 bar 傳送器,漂移超過 ±0.1 bar)
- 流量計:無法在停止流動時回到零點,或讀數波動幅度 >5%
昶特建議每年進行一次校正,或在懷疑數值異常時立即校正。
❓ Q19: 我能否從雲端直接控制液冷系統(例如調整冷卻液流量、溫度)?
答:可以,但需要特別的架構設計:
- 監測層(只讀):感測器 → PLC → 雲端
- 控制層(可寫):雲端 → PLC → 變頻泵、比例閥等執行器
建議在 PLC 中設置「雙重保護」:
- 本地硬式保護開關(PS-2100X)不受雲端影響,確保極限情況下自動斷電
- 雲端控制只能在「安全範圍」內調整參數,超出範圍時自動切回本地 PLC 控制
這樣既能獲得遠程控制的便利,又能確保系統安全。
❓ Q20: 我的組織還沒有 AI/GPU,但在考慮購置。現在投資監測系統划算嗎?
答:分情況:
- 半年內會購置 GPU:現在投資基礎層(NT$280K~380K)划算,因為可利用率高
- 1~2 年後才購置:先不投資感測器,但現在設計機房佈線和 PLC 架構,為未來預留接口
- 規劃超過 2 年:等待再投資,因為感測器技術進步快,成本會持續下降
關鍵建議:無論何時購置 GPU,都應該在開機前 1 個月內完成監測系統部署,以避免「邊運行邊改造」的高成本。
第 9 章:結論與行動呼籲
本指南為您詳細解析了 AI 資料中心液冷系統的完整監測架構。讓我們回顧核心要點:
核心要點回顧
✅ 監測 30+ 個點是標準配置,不是過度投資 — 每個點都有明確的故障預防或效能優化功能
✅ 三層配置方案滿足不同規模 — 從基礎層(NT$280K)到企業級(NT$1.5M~2.5M)
✅ 投資回本週期短,通常 1~4 個月 — 平均 ROI 超過 400%~1000%
✅ 昶特 ATLANTIS 產品性價比領先 40%~60% — 同等精度下成本最低
✅ HART 智能傳送器值得投資 — 提供預測性維護,提前發現 85%~90% 的故障
下一步行動方案
立即評估您的監測需求
根據第 7 章的決策樹,快速確定適合您的配置層級。昶特 ATLANTIS 提供免費的現場勘查和方案設計服務,幫您精確計算投資規模和 ROI。
聯絡我們的專業團隊:
業務一部 Ian — 公共設施與中小企業
電話:02-2820-3405
信箱:ian@atlantis.com.tw
業務二部 Nori — 工業與超大規模應用
電話:02-2820-3405
信箱:nori@atlantis.com.tw
昶特有限公司 ATLANTIS Co., Ltd.
地址:台北市北投區致遠一路二段 109 號
傳真:02-2827-0646 / 02-2820-3406
官網:re-atlantis.tw
31 年工業測量經驗,為您打造液冷監測完整方案。