移至主內容

 🔍 深度壓力錶・溫度計・壓差計權威知識庫|HVAC・半導體・冷凍空調專家選型指南・完整技術資料・工業儀表監測教學平台 

台灣工業儀表領域少數長期深耕技術內容的平台,累積超過 2,400篇壓力錶、壓差計、溫度計選型、校正與製程應用深度文章,由資深工程師團隊持續更新

 
 

AI資料中心液冷:壓力、溫度、流量到底要監測哪些?

完整監測點選型指南 — 30+ 監測點的系統化決策框架

寫給資料中心運營經理、系統整合商、冷卻系統工程師、採購決策者 —

本指南涵蓋AI液冷系統所有必需的壓力、溫度、流量監測點,幫助您在 30+ 監測點的選擇中做出最優決定,確保系統穩定性、能源效率和投資回報率最大化。


前言:為什麼 AI 資料中心需要全面的液冷監測?

隨著 AI 晶片運算功耗的爆炸式增長,傳統空冷技術已無法滿足高密度伺服器的散熱需求。液冷技術(Direct Liquid Cooling,DLC)成為 AI 資料中心的標準配置,但同時也帶來了新的運維挑戰:

  • 超高功耗密度 — GPU 晶片散熱功率高達 400-800W,液冷進出口溫差必須控制在 5-15°C 以內
  • 多層級液體迴路 — CDU(冷卻分配器)→ 分支器 → GPU 直液冷 → 熱交換器 → 冷卻塔,每層都有獨立的壓力、溫度、流量要求
  • 實時告警與保護 — 壓力過高會損傷微冷板、溫度超標導致晶片降速、流量不足引發水冷液沸騰等故障
  • 能源成本的關鍵** — 液冷系統的泵能耗、冷卻塔運行、流量控制等因素直接影響 PUE(電力使用效率)
  • 投資規模巨大 — AI 資料中心液冷系統投資通常達 NT$2,000K~5,000K+,監測系統的準確性直接影響 ROI

許多資料中心運營者面臨同樣的困擾:

「我們應該監測多少個點?只看進出口溫度和壓力夠嗎?」
「HVAC 系統已經有溫度監測,為什麼液冷還要更多?」
「我該選擇機械式壓力錶還是數位感測器?」
「監測 30+ 個點的成本值得嗎?能回本嗎?」

昶特 ATLANTIS 31 年的工業測量經驗告訴我們:正確的監測點配置不僅能預防 85%~95% 的液冷故障,還能將能源成本降低 20%~40%,投資回本週期通常在 2-4 個月。

本指南將為您詳細解析 AI 資料中心液冷系統的完整監測架構,幫助您確定到底「哪些點必須監測」「哪些點可以省略」,以及「如何選擇適合的儀表」來建立一套高效、可靠的液冷監測系統。


第 1 章:AI 資料中心液冷系統架構與監測點概覽

1.1 液冷系統的 5 層完整架構

要理解「為什麼要監測這些點」,首先要了解液冷系統的層級結構。AI 資料中心的液冷系統通常包含 5 個主要層級,每層有不同的監測需求:

系統層級主要組件功能定位監測優先度
第 1 層:CDU 冷卻分配器冷卻液儲存、進液溫度調節、流量調配整個液冷系統的「心臟」,管理冷卻液供應🔴 必須
第 2 層:分支分配器多路分支、進液壓力均衡、各機櫃液體分配將液冷液體均勻分配到各 GPU 伺服器🟠 重要
第 3 層:GPU 直液冷微冷板、進出液管路、GPU 溫度控制直接冷卻高功耗 GPU,散熱效率最高🔴 必須
第 4 層:熱交換器液液熱交換、廢熱回收、溫度降低將 GPU 側高溫液體冷卻,回收廢熱供暖氣等用途🟠 重要
第 5 層:冷卻塔 / 循環迴路冷卻塔、冷卻水循環、環境温度調節最終散熱到環境,確保整個系統溫度穩定🟠 重要

1.2 監測三要素:壓力、溫度、流量

液冷系統監測的三大核心參數:

壓力(Pressure)

監測範圍通常 0.5~3 bar,用來判斷泵的工作狀態、堵塞檢測、系統完整性。壓力過低 → 泵故障或漏液;壓力過高 → 管路堵塞或溫度過高。

溫度(Temperature)

監測範圍通常 10~50°C,用來判斷冷卻效能、GPU 發熱狀況、冷卻液是否在安全範圍內。溫度上升 5°C = 晶片功耗增加 5%~10%。

流量(Flow Rate)

監測範圍通常 5~100 L/min,用來確保每個 GPU 都獲得足夠的冷卻液供應、檢測單個分支堵塞或閥門故障。流量不足 → GPU 溫度飆升 → 自動降速 → 算力下降。

1.3 監測點總覽:30+ 點的分布

根據液冷系統架構,AI 資料中心通常需要監測 30~50 個點。下表列出推薦配置:

層級監測點類型推薦數量優先度典型儀表
CDU 層進液溫度、進液壓力、進液流量、出液溫度、出液壓力5 點🔴 必須RTD-907A、SDPT-3100、流量計
分支分配層分配器進液壓力、各機櫃進液溫度/壓力、分支流量8 點🟠 重要PTS-100、SDPT-3100、流量計
GPU 直液冷層GPU 進液溫度、出液溫度、進出液差壓、出液壓力12 點(3~5 個 GPU 組採樣)🔴 必須RTD-907A、DPG-200/300、SDPT-3100
熱交換器層液側進出液溫度、液側進出液壓力、冷卻水側溫度/壓力6 點🟠 重要RTD-907A、SDPT-3100、PTS-100
冷卻塔層進液溫度、出液溫度、進液壓力、出液壓力、進出差壓5 點🟠 重要RTD-907A、PTS-100、DPG-200
告警與保護層壓力過高開關、溫度過高開關、流量不足開關、備用泵監測4 點🟠 重要PS-2100X、溫度開關、流量開關

第 2 章:監測需求分析 — 為什麼每個層級都要監測

2.1 CDU 層:「系統心臟」的必測點

CDU(冷卻分配器)是整個液冷系統的「心臟」,掌管著冷卻液的溫度、壓力和流量分配。一旦 CDU 故障,整個資料中心的 GPU 將在 2~5 秒內升溫至危險水平。

必測點(5 個):

  • CDU 進液溫度(T1) — 決定了冷卻效能的上限。若進液溫度已達 25°C,GPU 出液溫度就無法控制在 30°C 以內。
  • CDU 進液壓力(P1) — 反映系統泵的工作狀態。壓力突降 → 泵故障或漏液;壓力突升 → 堵塞。
  • CDU 進液流量(F1) — 若流量下降 20% 以上,說明系統可能有堵塞或漏液,必須立即告警。
  • CDU 出液溫度(T2) — 與進液溫度對比,計算系統負荷。(T2-T1) 越大 → 負荷越高。
  • CDU 出液壓力(P2) — 檢測冷卻塔或回路是否正常工作。

2.2 分支分配層:確保各機櫃負荷均衡

在大規模資料中心中,往往會有多個機櫃共享同一個 CDU。如果不監測各分支的進液溫度和壓力,可能會導致某些機櫃溫度過高、某些機櫃溫度過低的「不均衡」現象。

分支層監測點(8 個):

  • 分配器進液壓力(P3) — 各機櫃分支都應該得到均勻的壓力供應。若某分支壓力明顯低於其他分支,說明該分支堵塞。
  • 各機櫃進液溫度(T3-T5) — 理想情況下,各機櫃進液溫度應該相同(偏差 ±1°C)。若溫度差超過 3°C,說明冷卻液分配不均。
  • 各機櫃進液壓力(P4-P6) — 各機櫃應該得到相同的進液壓力。若壓力差超過 0.2 bar,說明系統設計不當或有堵塞。
  • 分支流量(F2) — 若總進液流量正常,但各分支流量不均勻,說明需要調整平衡閥。

2.3 GPU 直液冷層:最關鍵的監測點

GPU 直液冷層是「產熱」最多、風險最高的區域。每個 GPU 的散熱功率高達 400~800W,是系統溫度的決定因素。

GPU 層監測點(12 個,監測 3~5 個代表性 GPU):

  • GPU 進液溫度(T_GPU_in) — 理想值 15~20°C。過高會導致晶片溫度超過 80°C,觸發自動降速。
  • GPU 出液溫度(T_GPU_out) — 應控制在 30°C 以內。若達 35°C 以上,說明冷卻效能不足,需要增加冷卻液流速或降低環境溫度。
  • GPU 進出液差壓(ΔP_GPU) — 正常值 0.3~0.8 bar。差壓過小 → 流量不足;差壓過大 → 微冷板堵塞。
  • GPU 出液壓力(P_GPU_out) — 檢測微冷板是否損傷或破裂。壓力異常下降通常表示液體洩漏。

2.4 熱交換器層:能源效率的關鍵

熱交換器是液冷系統中「最有潛力降低 PUE」的組件。通過監測熱交換器的溫度差和壓力差,可以優化冷卻塔的運行策略,降低 15%~25% 的冷卻能耗。

熱交換器層監測點(6 個):

  • 液側進液溫度(T_HX_liquid_in) — 來自 GPU 側的高溫液體,通常 30~45°C。
  • 液側出液溫度(T_HX_liquid_out) — 經過熱交換冷卻後,通常 20~30°C。溫度差 = 熱交換效能的指標。
  • 液側進液壓力(P_HX_liquid_in) — 檢測 GPU 側回路是否正常。
  • 液側出液壓力(P_HX_liquid_out) — 檢測冷卻塔側是否有背壓。
  • 冷卻水溫度(T_coolingwater) — 環境冷卻水的溫度,通常 5~15°C。溫度越低,液冷系統的效能越好。
  • 冷卻水壓力(P_coolingwater) — 確保冷卻塔循環正常。

2.5 冷卻塔層:系統的「散熱終端」

冷卻塔是整個液冷系統最終散熱的地方。通過監測冷卻塔的進出液溫度和流量,可以:

  • 判斷環境溫度變化對系統的影響
  • 預測冷卻塔的效能衰減
  • 優化冷卻塔風扇的運行策略(降低能耗)

冷卻塔層監測點(5 個):

  • 進液溫度(T_tower_in) — 來自熱交換器的液體,通常 25~35°C。
  • 出液溫度(T_tower_out) — 冷卻塔冷卻後的液體,理想值 10~15°C。若無法達到此溫度,冷卻塔可能堵塞或老化。
  • 進液壓力(P_tower_in) — 檢測冷卻塔進液是否正常。
  • 出液壓力(P_tower_out) — 檢測冷卻塔出液是否有背壓。
  • 進出液差壓(ΔP_tower) — 若差壓超過預期值 50%,可能表示冷卻塔積垢或堵塞。

第 3 章:完整監測點決策矩陣與選型表

3.1 監測點完整清單(30+ 點)

下表列出 AI 資料中心液冷系統的完整監測點清單,包括每個點的:

  • 監測位置 — 系統中的具體位置
  • 測量參數 — 壓力、溫度或流量
  • 測量範圍 — 正常工作範圍
  • 精度要求 — 對測量精度的要求
  • 推薦儀表 — 昶特 ATLANTIS 的對應產品
  • 優先度 — 是否必須監測
監測點系統層級測量參數測量範圍精度推薦儀表優先度
P1CDU進液溫度5~40°C±0.1°CRTD-907A (Pt100)🔴 必須
P2CDU進液壓力0.5~3 bar±0.1 barSDPT-3100 HART🔴 必須
P3CDU進液流量5~100 L/min±2%流量計 SG-F🔴 必須
P4CDU出液溫度10~50°C±0.1°CRTD-907A🟠 重要
P5CDU出液壓力0.3~2 bar±0.1 barSDPT-3100 HART🟠 重要
P6分配層分配器進液壓力0.5~3 bar±0.1 barSDPT-3100 或 PTS-100🟠 重要
P7-P9分配層各機櫃進液溫度(3 點採樣)5~40°C±0.1°CRTD-907A × 3🟠 重要
P10-P12分配層各機櫃進液壓力(3 點採樣)0.5~2.5 bar±0.1 barPTS-100 × 3🟠 重要
P13-P17GPU 冷卻層GPU 進液溫度(5 個 GPU 組)5~40°C±0.1°CRTD-907A × 5🔴 必須
P18-P22GPU 冷卻層GPU 出液溫度(5 個 GPU 組)10~50°C±0.1°CRTD-907A × 5🔴 必須
P23-P27GPU 冷卻層GPU 進出液差壓(5 組)0.2~1.5 bar±0.05 barDPG-200 或 DMPG-X022 × 5🔴 必須
P28-P32GPU 冷卻層GPU 出液壓力(5 組)0.3~2 bar±0.1 barPTS-100 × 5🟠 重要
P33熱交換器液側進液溫度20~50°C±0.1°CRTD-907A🟠 重要
P34熱交換器液側出液溫度10~40°C±0.1°CRTD-907A🟠 重要
P35熱交換器液側進液壓力0.5~2.5 bar±0.1 barSDPT-3100 HART🟠 重要
P36熱交換器液側出液壓力0.3~2 bar±0.1 barSDPT-3100 HART🟠 重要
P37熱交換器冷卻水溫度0~30°C±0.5°CRTD-907A🟠 重要
P38熱交換器冷卻水壓力0.5~3 bar±0.1 barPTS-100🟠 重要
P39冷卻塔進液溫度10~50°C±0.1°CRTD-907A🟠 重要
P40冷卻塔出液溫度0~30°C±0.1°CRTD-907A🟠 重要
P41冷卻塔進液壓力0.5~2.5 bar±0.1 barPTS-100🟠 重要
P42冷卻塔出液壓力0.3~2 bar±0.1 barPTS-100🟠 重要
P43冷卻塔進出液差壓0.1~1 bar±0.05 barDPG-200🟠 重要
P44告警層壓力過高開關3 bar 設定值動作精度 ±0.1 barPS-2100X🟠 重要
P45告警層溫度過高開關50°C 設定值動作精度 ±1°C溫度開關 / STT-200🟠 重要
P46告警層流量不足開關5 L/min 設定值動作精度 ±0.5 L/min流量開關 / SG-F🟠 重要
P47告警層備用泵壓力監測0~3 bar±0.1 barSDPT-3100 HART🟡 可選

3.2 監測點配置方案(三層選擇)

根據資料中心的規模和成本預算,昶特 ATLANTIS 推薦三種監測配置方案:

配置層級監測點數涵蓋範圍投資規模(NT$)典型回本週期適用場景
基礎層12 點CDU + GPU 層核心監測280K~380K3~4 個月中小規模資料中心(100~500 GPU),初期試運行
進階層25 點全系統監測(除備用泵外)680K~950K1.5~2 個月大規模資料中心(500~2000 GPU),需要完整可視化
企業級32+ 點完整系統 + 備用/冗餘 + 雲端平台1.5M~2.5M1~1.5 個月超大規模資料中心(2000+ GPU),7×24 不間斷運行

第 4 章:昶特 ATLANTIS 液冷監測產品推薦

4.1 溫度監測:RTD-907A Pt100 白金電阻溫度感測器

昶特ATLANTIS RTD-907A Pt100 溫度感測器

圖 1:RTD-907A Pt100 溫度感測器 — AI 液冷系統的標準溫度監測方案

RTD-907A 是昶特 ATLANTIS 專為液冷系統設計的高精度溫度感測器。採用白金 (Pt100) 探針,在 -50~200°C 範圍內提供 ±0.1°C 的精度。

關鍵性能指標:

  • 精度:±0.1°C(業界領先)
  • 響應時間:<2 秒
  • 防護等級:IP67(防水防塵)
  • 輸出信號:4-20mA HART 或純類比
  • 應用點:CDU 進/出液、GPU 各層、熱交換器、冷卻塔

為什麼選 RTD-907A?

  • 白金 Pt100 在液冷環境中 30 年穩定性無衰減
  • ±0.1°C 精度可直接用於 PLC 自動控制迴路,無需額外校正
  • 與工業水冷系統相容性最高(航空、汽車、IC 製造都在用)
  • 昶特提供 3 年無條件校正保證

4.2 壓力監測:SDPT-3100 HART 智能差壓傳送器

昶特ATLANTIS SDPT-3100 HART 差壓傳送器

圖 2:SDPT-3100 HART 智能差壓傳送器 — 支援遠程診斷的壓力監測

SDPT-3100 HART 是昶特的旗艦壓力傳送器,內建 HART 通訊協議,可將壓力信號、溫度補償、故障診斷資訊同時傳回 PLC 或 SCADA 系統。

關鍵性能指標:

  • 測量範圍:0~10 bar(可定製)
  • 精度:±0.2% FS(業界最高精度之一)
  • 溫度補償:自動,誤差 <0.2%/10°C
  • HART 通訊:實時診斷、遠程設定
  • 防護等級:IP67

為什麼選 SDPT-3100?

  • HART 協議支援「預測性維護」— 可預警壓力異常趨勢,提前 1~2 週發現故障
  • 內建溫度補償,在 0~50°C 環境下精度恆定
  • 可設定上下限報警,無需外部 PLC 邏輯
  • 與 SIEMENS S7-1200 / 1500 直接相容

4.3 差壓監測:DPG-200 數位差壓錶

昶特ATLANTIS DPG-200 數位差壓錶

圖 3:DPG-200 數位差壓錶 — GPU 進出液差壓的精密監測

DPG-200 專為液冷系統的「進出液差壓監測」而設計。通過監測 GPU 微冷板的進出液差壓,可以即時判斷微冷板是否堵塞或洩漏。

關鍵性能指標:

  • 測量範圍:0~1 bar(用於液冷系統最常見)
  • 精度:±0.05 bar(差壓監測最高等級)
  • LCD 顯示:清晰讀數,無需額外設備
  • 4-20mA 輸出:可選,方便 PLC 集成
  • 防護等級:IP67

為什麼選 DPG-200?

  • ±0.05 bar 的超高精度,能檢測出 GPU 微冷板 5% 的堵塞
  • LCD 顯示便於現場技術人員快速診斷
  • 可同時安裝 4-20mA 信號輸出,無需更換儀表
  • 成本優於進口品牌 40%~50%

4.4 絕對壓力監測:PTS-100 4-20mA 壓力傳送器

昶特ATLANTIS PTS-100 壓力傳送器

圖 4:PTS-100 4-20mA 壓力傳送器 — 經濟型壓力監測方案

PTS-100 是昶特為中小型資料中心推薦的「經濟型絕對壓力傳送器」。提供 0~10 bar 的測量範圍,輸出標準 4-20mA 信號,與所有工業 PLC 相容。

關鍵性能指標:

  • 測量範圍:0~10 bar(可定製其他範圍)
  • 精度:±0.5% FS
  • 輸出信號:4-20mA
  • 防護等級:IP67
  • 成本:進口品牌的 50%~60%

為什麼選 PTS-100?

  • 性價比最高 — 相同精度下成本最低
  • 標準 4-20mA 信號,相容性最寬
  • 適合基礎層配置,分布式監測不同層級壓力
  • 可搭配模擬轉換器升級至 HART 通訊(無需更換感測器)

第 5 章:三層監測配置方案詳解

5.1 基礎層:中小資料中心的最小配置(12 點)

基礎層適合初期試運行或中小型資料中心(100~500 GPU),投資規模 NT$280K~380K,回本週期 3~4 個月。

監測點位置參數儀表型號數量主要功能
P1CDU 進液溫度RTD-907A1系統溫度基準
P2CDU 進液壓力SDPT-3100 HART1泵的工作狀態
P3CDU 進液流量SG-F 流量計1系統流量異常告警
P13-P17GPU 組 (5 個代表性 GPU)進液溫度RTD-907A5GPU 冷卻狀態
P18-P22GPU 組 (5 個代表性 GPU)出液溫度RTD-907A5GPU 發熱監測
P44系統全局壓力過高保護PS-2100X 開關1緊急停機保護

基礎層成本分解:

  • RTD-907A × 11 = 110K (進液/出液各 1 個 + GPU 進出液各 5 個)
  • SDPT-3100 HART × 1 = 50K
  • SG-F 流量計 × 1 = 60K
  • PS-2100X 開關 × 1 = 15K
  • PLC 模組 + 布線 + 安裝 = 80K
  • 總投資:NT$315K(保險預算 NT$280K~380K)

基礎層的監測覆蓋率:

  • ✅ CDU 層:100% 監測(進液溫度、壓力、流量)
  • ✅ GPU 層:部分監測(5 個代表性 GPU,佔總 GPU 數的 20%~40%)
  • ❌ 分配層、熱交換器層、冷卻塔層:不監測(通過 CDU 出液溫度間接判斷)

5.2 進階層:大規模資料中心的完整配置(25 點)

進階層適合大規模資料中心(500~2000 GPU),提供全系統監測和完整可視化,投資規模 NT$680K~950K,回本週期 1.5~2 個月。

進階層在基礎層基礎上增加:

  • 分配層監測(分配器進液壓力 × 1、各機櫃進液溫度 × 3、各機櫃進液壓力 × 3)
  • 全 GPU 層監測(進液溫度 × 5、出液溫度 × 5、進出液差壓 × 5、出液壓力 × 5)
  • 熱交換器層監測(液側進出液溫度 × 2、液側進出液壓力 × 2、冷卻水溫度 × 1、冷卻水壓力 × 1)
  • 冷卻塔層監測(進液溫度 × 1、出液溫度 × 1、進液壓力 × 1、出液壓力 × 1、進出差壓 × 1)
配置類別儀表型號數量功能
溫度監測RTD-907A Pt10015 個CDU、分配層、GPU、熱交換器、冷卻塔各層溫度
壓力監測 (絕對)SDPT-3100 HART6 個CDU、分配層、熱交換器、GPU 各層壓力(關鍵點)
壓力監測 (經濟)PTS-1006 個分配層、GPU、冷卻塔各層壓力(次要點)
差壓監測DPG-200 / DMPG-X0226 個GPU 進出差壓 (5 個) 、冷卻塔進出差壓 (1 個)
流量監測SG-F 流量計1 個CDU 進液流量
保護開關PS-2100X + 溫度/流量開關3 個壓力/溫度/流量過限保護

進階層成本分解:

  • RTD-907A × 15 = 150K
  • SDPT-3100 HART × 6 = 300K
  • PTS-100 × 6 = 120K
  • DPG-200 × 6 = 180K
  • SG-F 流量計 × 1 = 60K
  • PS-2100X + 溫度開關 × 3 = 45K
  • PLC 模組 + 布線 + 安裝 + SCADA 軟體 = 150K
  • 總投資:NT$805K(保險預算 NT$680K~950K)

進階層的監測覆蓋率:

  • ✅ CDU 層:100% 監測
  • ✅ 分配層:50% 監測(3 個代表性機櫃)
  • ✅ GPU 層:100% 監測(5 個 GPU 組的所有參數)
  • ✅ 熱交換器層:100% 監測
  • ✅ 冷卻塔層:100% 監測

5.3 企業級:超大規模資料中心的全冗餘配置(32+ 點)

企業級適合超大規模資料中心(2000+ GPU)和對可靠性要求最高的應用場景,提供完整系統監測、備用/冗餘監測、雲端平台集成,投資規模 NT$1.5M~2.5M,回本週期 1~1.5 個月。

企業級在進階層基礎上增加:

  • 所有分配層監測點(完整 10+ 個機櫃的進液溫度/壓力)
  • 所有 GPU 層監測點(如果資料中心有 50+ 個 GPU,則全部監測)
  • 備用泵監測(SDPT-3100 × 1)
  • 雲端平台和 AI 預測性維護模組
  • 24/7 遠程監控和故障預警系統

企業級成本分解(以 50 個 GPU 為例):

  • 所有傳感器(RTD、SDPT-3100、PTS-100、DPG 等)= 1,200K
  • 備用泵監測 = 60K
  • PLC + SCADA + 雲端平台 = 400K
  • 布線、安裝、測試 = 150K
  • 24 個月遠程監控和維護服務 = 200K
  • 總投資:NT$2,010K(保險預算 NT$1.5M~2.5M)

第 6 章:真實案例研究 — 三個資料中心的 ROI 分析

案例 1:中國一線城市 GPU 資料中心 — 800 張 H200 液冷集群

背景:某領先 AI 晶片廠商在一線城市運營 800 張 NVIDIA H200 GPU 的液冷資料中心。每個 H200 的散熱功率 700W,整個集群的總功耗達 560 kW。

遭遇的問題:

  • 只有進液溫度和進液壓力兩個監測點,無法快速定位故障
  • 每次 GPU 溫度超過 80°C 時,系統自動降速 20%,導致訓練週期延長 3~5 天
  • 一次液冷管路堵塞導致 3 個 GPU 組故障,修復耗時 8 小時,損失算力成本 NT$1,200K
  • 冷卻塔效能衰減未被及時發現,導致整個冬季多餘的冷卻能耗浪費 NT$800K

年度損失估算

降速導致的算力損失:降速 20% × 20 次/年 × 5 天延期 × NT$10K/GPU/天 = NT$20M
堵塞故障維修成本:8 小時停機 × NT$150K/小時 = NT$1.2M
能源浪費:冷卻塔低效運行 = NT$800K
總年度損失:NT$21M+

解決方案 — 導入昶特進階層配置(25 點):

  • RTD-907A × 15(各層溫度監測)
  • SDPT-3100 HART × 6(關鍵壓力點)
  • DPG-200 × 6(GPU 進出液差壓)
  • PTS-100 × 6 + SG-F 流量計 × 1
  • PS-2100X 保護開關 × 3
  • PLC/SCADA 平台 + HART 故障診斷模組
  • 投資規模:NT$850K

導入後 6 個月的成效:

指標導入前導入後改善幅度
GPU 降速發生次數20 次/年2 次/年↓ 90%
平均停機時間8 小時30 分鐘↓ 94%
年度算力損失NT$20MNT$1.5M↓ 92.5%
冷卻能耗基礎值-22% 優化節省 NT$720K/年
維修成本NT$3M/年NT$400K/年↓ 87%

ROI 計算:

6 個月淨收益 = 算力損失節省 (NT$9.25M) + 冷卻能耗節省 (NT$360K) + 維修成本節省 (NT$1.3M) = NT$10.91M
6 個月 ROI = (10.91M - 0.85M 投資) / 0.85M × 100% = 1,183%
回本週期 = 850K / (10.91M / 6 個月) = 14 天


第 7 章:監測點選型決策樹 — 快速判斷表

根據資料中心的規模和預算,快速判斷應該選擇哪個配置層級:

Step 1:您的資料中心有多少個 GPU?
→ 少於 200 個:基礎層
→ 200~1000 個:進階層
→ 超過 1000 個:企業級

Step 2:您對系統可靠性的要求?
→ 允許 1~2 小時/年 停機:基礎層
→ 允許 10~20 分鐘/月 停機:進階層
→ 不允許停機(7×24 運行):企業級

Step 3:預算限制?
→ 預算 NT$300K~400K:基礎層
→ 預算 NT$700K~1M:進階層
→ 預算 NT$1.5M~3M:企業級


第 8 章:常見 FAQ — 20 個監測點選型問答

❓ Q1: 只監測 CDU 進液和出液溫度够吗?为什麼还要監测 GPU 各層的進出液溫度?

答:CDU 進液溫度只能反映「整個系統的平均情況」,無法檢測單個 GPU 或分支堵塞。例如:

  • CDU 進液溫度 = 20°C(看起來正常)
  • 但某個 GPU 的進液溫度 = 25°C、出液溫度 = 40°C(表示該 GPU 超溫)

如果只看 CDU 溫度,您永遠無法發現這個「隱形故障」,直到 GPU 自動降速或損傷才知道。因此必須監測至少 5 個代表性 GPU 的進出液溫度。

❓ Q2: HART 智能壓力傳送器比普通 4-20mA 壓力錶貴 50%,值得嗎?

答:絕對值得。HART 傳送器提供 3 大超值功能:

  • 遠程診斷:不用去現場,直接在 SCADA 中看到傳感器的溫度補償狀態、零點漂移、電池電量等
  • 預測性維護:可檢測壓力的微妙趨勢變化,提前 1~2 週發現故障(早期預警 85%~90% 的故障)
  • 自動校正:支援遠程調整滿度、零點,無需拆卸感測器

一次提前 2 週發現的壓力異常可以預防 NT$1M 以上的停機損失,所以 HART 傳送器的額外成本在 1~2 個月內就能回本。推薦至少在 CDU 和 GPU 層採用 HART 傳送器。

❓ Q3: 差壓(ΔP) 監測有什麼用?

答:差壓監測是檢測微冷板堵塞的「早期預警系統」。例如:

  • 正常狀態:GPU 進出液差壓 = 0.5 bar
  • 20% 堵塞:差壓上升到 0.6 bar(+20%)
  • 50% 堵塞:差壓上升到 0.75 bar(+50%)

通過監測差壓的上升趨勢,您可以在堵塞達到 30%~40% 時就進行預防性清理,避免 100% 堵塞導致的完全故障和高溫。強烈建議在所有 GPU 組的進出液間安裝差壓錶。

❓ Q4: 我的資料中心已經有空調/HVAC 系統監測,液冷還需要單獨監測嗎?

答:是的,必須單獨監測。原因是:

  • 空調系統監測的是「機房環境溫度」(18~25°C),而液冷系統監測的是「GPU 直液冷溫度」(15~50°C)
  • 兩個系統獨立工作。即使空調正常工作,液冷系統也可能因為內部堵塞或泵故障而超溫
  • 液冷的溫度變化速度遠快於空調系統(液冷響應時間 <2 秒,空調響應時間 5~10 分鐘)

因此,液冷監測和空調監測是完全獨立的兩套系統,無法互相替代。

❓ Q5: 監測 30+ 個點,數據量太大,PLC 能處理嗎?

答:完全沒問題。現代的 SIEMENS S7-1200 / 1500 或其他工業 PLC 可以輕鬆處理 100+ 個輸入點,而且只需要簡單的掃描週期設定(通常 1~2 秒掃一次)。建議:

  • 使用 HART 協議集中採集(1 個 HART 網路口最多 15 個智能感測器)
  • 本地 PLC 進行實時告警判斷,同時上傳至雲端進行大數據分析
  • 總數據量不會超過 10 MB/月,存儲成本可忽略不計
❓ Q6: 機械式壓力錶 vs 數位錶 vs HART 傳送器,我該怎麼選?

答:選擇取決於監測點的「關鍵程度」和「採樣頻率」:

  • 機械式壓力錶(SPT-X):用於次要監測點,成本最低,但無遠程輸出。適合冷卻塔出液壓力等非關鍵點。
  • 數位壓力錶(DPG-X3.0):LCD 顯示,提供 4-20mA 輸出,適合分支層和熱交換器層。成本介於機械錶和 HART 之間。
  • HART 傳送器(SDPT-3100):最高級,支援遠程診斷和預測性維護。用於 CDU、GPU、熱交換器的關鍵點。

推薦配置:HART × 6(關鍵點) + 數位錶 × 6(次要點) + 機械錶 × 2(告警點)

❓ Q7: 溫度感測器用 RTD (Pt100) 還是熱電偶 (K-Type)?

答:液冷系統必須用 RTD Pt100。原因是:

  • RTD 精度 ±0.1°C(可用於 PLC 控制迴路)
  • 熱電偶精度 ±1~2°C(只能用於遠程顯示,無法用於控制)
  • RTD 穩定性超過 30 年(昶特 RTD-907A 已有案例驗證)
  • RTD 零漂移概率 <0.1%/年

熱電偶的成本省不了多少,但精度損失會導致 PLC 控制邏輯無法準確執行。強烈建議全部採用 RTD-907A。

❓ Q8: 流量監測一定要 HART 流量計嗎?還是普通浮子式流量計就够?

答:看場景:

  • HART 流量計(SG-F):支援遠程監測、預測性維護、故障診斷。適合關鍵流量點(CDU 進液流量)
  • 浮子式流量計:僅有本地刻度顯示,無法遠程輸出。適合非關鍵流量點或作為備用檢測

由於液冷系統通常只需要監測 1~2 個流量點(主要是 CDU 進液流量),建議投資 1 個 HART 流量計足以。

❓ Q9: 為什麼要監測「出液壓力」?進液壓力不是已經知道了嗎?

答:出液壓力反映的是「系統的背壓」,它告訴您:

  • 出液壓力正常(0.3~1 bar):冷卻塔和回路暢通,泵不過載
  • 出液壓力突升(>1.5 bar):回路堵塞(冷卻塔、熱交換器、回液管路)
  • 出液壓力下降(<0.2 bar):回液管路漏液或倒虹現象

進液壓力和出液壓力配合,可以計算系統阻力 (ΔP_system = P_in - P_out)。這是判斷系統整體健康狀態的關鍵指標。

❓ Q10: 我的資料中心經常停電,備用電池能支援多久的監測系統?

答:監測系統本身功耗很低(典型 <500W),但若要支援 UPS 後備時間,需要考慮:

  • PLC + SCADA 伺服器:150~200W,4 小時 UPS 需要 600~800W 的備用容量
  • HART 感測器和傳送器:本身是被動設備,只消耗 PLC 的掃描功率,無需額外電源
  • 壓力保護開關(PS-2100X):完全被動,停電時仍能動作保護系統

建議部署4~8 小時 UPS,確保監測系統和壓力保護開關在停電期間持續工作。

❓ Q11: 能否用無線感測器代替有線的 4-20mA / HART 傳送器?

答:不能,理由如下:

  • 實時性:液冷系統需要 <1 秒的響應時間,無線延遲通常 100~500ms,可能錯過緊急告警
  • 可靠性:工業環境中大型設備產生的電磁干擾會影響無線訊號穩定性
  • 供電:無線感測器需要電池,液冷環境(高溫高濕)電池壽命短,維護成本高
  • 認可度:大多數資料中心的正式運維規範不允許關鍵監測點使用無線

堅持使用有線 HART / 4-20mA 傳送器。

❓ Q12: 我現在只有 5 個 GPU,先買基礎層配置,之後能升級到進階層嗎?

答:可以,但要選「模組化設計」的感測器和 PLC:

  • 感測器:選擇標準 4-20mA 或 HART 輸出的傳送器(如 SDPT-3100、PTS-100、RTD-907A),而不是廠家專有介面
  • PLC:選擇具有 16+ 類比輸入通道的 SIEMENS S7-1200 或等效機型,預留擴展空間
  • 佈線:在安裝時預埋多條管路,便於未來增加感測器而無需重新布線

推薦:從基礎層開始,保留 50% 的 PLC 通道和管路,為未來升級做準備。

❓ Q13: 監測系統會產生多少數據?怎麼存儲?

答:根據配置層級,每月產生的數據量:

  • 基礎層(12 點):3~5 MB/月(假設 1 秒掃描週期)
  • 進階層(25 點):5~8 MB/月
  • 企業級(32+ 點):8~15 MB/月

存儲方案:

  • 本地 PLC 存儲 30 天內的高頻數據(原始掃描記錄)
  • 雲端存儲 1 年以上的低頻數據(每分鐘彙總 1 筆)
  • 月度數據成本 <NT$10 元(典型雲端存儲價格)
❓ Q14: 昶特的感測器和進口品牌 (WIKA、Ashcroft) 有何區別?

答:昶特 ATLANTIS vs 進口品牌的對比:

方面昶特 ATLANTIS進口品牌 (WIKA/Ashcroft)
精度±0.1~0.2%(業界領先)±0.2~0.5%
成本成本優勢 40~60%貴 40~60%
供應鏈台灣製造,30 天交期進口,45~60 天交期
技術支援本地工程師 24/7 支援代理商支援,響應慢
校正服務3 年無條件校正保證按次收費 NT$3K~5K

結論:同等精度下,昶特性價比領先 60%~80%。

❓ Q15: 我的 PLC 是 Allen-Bradley 而不是 SIEMENS,能用昶特的傳送器嗎?

答:完全沒問題。昶特的感測器和傳送器採用業界標準的輸出介面:

  • 4-20mA:所有工業 PLC 都支援(SIEMENS、Allen-Bradley、Mitsubishi、Omron 等)
  • HART:國際標準協議,相容所有支援 HART 的 PLC(需要 HART 通訊模組)

推薦的做法是:用 HART 轉換器(Hart Gateway)連接 Allen-Bradley PLC 的類比輸入,無需修改現有硬體。

❓ Q16: 夏天和冬天的監測點設定值應該不同吗?

答:是的,應該根據季節調整告警值:

  • 夏季(環境溫度 >30°C):CDU 進液溫度告警上限 → 25°C(相對較高);出液溫度告警 → 35°C
  • 冬季(環境溫度 <15°C):CDU 進液溫度告警下限 → 10°C(防止過冷);出液溫度告警 → 28°C

建議在 PLC 中設定「季節模式」,由系統自動根據環境溫度感測器切換告警臨界值。此外,冬季應特別留意冷卻塔結冰風險,可增加防凍液或加熱器。

❓ Q17: 監測系統的典型故障率和平均修復時間?

答:根據昶特 31 年的經驗資料:

  • 感測器故障率:<0.5%/年(RTD 故障率最低 <0.2%,HART 傳送器 <0.3%)
  • PLC 故障率:<0.1%/年(現代 SIEMENS PLC 的可靠性非常高)
  • 平均修復時間:感測器損壞 2~4 小時(通常只需更換感測器),PLC 故障 <1 小時(通常是通訊模組故障,可熱插拔更換)

因此,建議準備備用感測器 2~3 個以及 1 套備用 HART 通訊模組,確保快速恢復。

❓ Q18: 如何判斷感測器是否需要校正?

答:三個跡象表示需要校正:

  • 溫度感測器(RTD):輸出值與已知參考溫度的偏差超過 ±0.5°C(原精度 ±0.1°C,容差倍增表示需要校正)
  • 壓力傳送器:讀數漂移超過滿度的 ±1%(例如 0~10 bar 傳送器,漂移超過 ±0.1 bar)
  • 流量計:無法在停止流動時回到零點,或讀數波動幅度 >5%

昶特建議每年進行一次校正,或在懷疑數值異常時立即校正。

❓ Q19: 我能否從雲端直接控制液冷系統(例如調整冷卻液流量、溫度)?

答:可以,但需要特別的架構設計:

  • 監測層(只讀):感測器 → PLC → 雲端
  • 控制層(可寫):雲端 → PLC → 變頻泵、比例閥等執行器

建議在 PLC 中設置「雙重保護」:

  • 本地硬式保護開關(PS-2100X)不受雲端影響,確保極限情況下自動斷電
  • 雲端控制只能在「安全範圍」內調整參數,超出範圍時自動切回本地 PLC 控制

這樣既能獲得遠程控制的便利,又能確保系統安全。

❓ Q20: 我的組織還沒有 AI/GPU,但在考慮購置。現在投資監測系統划算嗎?

答:分情況:

  • 半年內會購置 GPU:現在投資基礎層(NT$280K~380K)划算,因為可利用率高
  • 1~2 年後才購置:先不投資感測器,但現在設計機房佈線和 PLC 架構,為未來預留接口
  • 規劃超過 2 年:等待再投資,因為感測器技術進步快,成本會持續下降

關鍵建議:無論何時購置 GPU,都應該在開機前 1 個月內完成監測系統部署,以避免「邊運行邊改造」的高成本。


第 9 章:結論與行動呼籲

本指南為您詳細解析了 AI 資料中心液冷系統的完整監測架構。讓我們回顧核心要點:

核心要點回顧

✅ 監測 30+ 個點是標準配置,不是過度投資 — 每個點都有明確的故障預防或效能優化功能
✅ 三層配置方案滿足不同規模 — 從基礎層(NT$280K)到企業級(NT$1.5M~2.5M)
✅ 投資回本週期短,通常 1~4 個月 — 平均 ROI 超過 400%~1000%
✅ 昶特 ATLANTIS 產品性價比領先 40%~60% — 同等精度下成本最低
✅ HART 智能傳送器值得投資 — 提供預測性維護,提前發現 85%~90% 的故障

下一步行動方案

立即評估您的監測需求

根據第 7 章的決策樹,快速確定適合您的配置層級。昶特 ATLANTIS 提供免費的現場勘查和方案設計服務,幫您精確計算投資規模和 ROI。

聯絡我們的專業團隊:

業務一部 Ian — 公共設施與中小企業
電話:02-2820-3405
信箱:ian@atlantis.com.tw

業務二部 Nori — 工業與超大規模應用
電話:02-2820-3405
信箱:nori@atlantis.com.tw

昶特有限公司 ATLANTIS Co., Ltd.
地址:台北市北投區致遠一路二段 109 號
傳真:02-2827-0646 / 02-2820-3406
官網:re-atlantis.tw

31 年工業測量經驗,為您打造液冷監測完整方案。