移至主內容

 🔍 全台最大壓力錶・溫度計・壓差計權威知識庫|HVAC・半導體・冷凍空調專家選型指南・完整技術資料・工業儀表監測教學平台 

台灣工業儀表領域少數長期深耕技術內容的平台,累積超過 1,256 篇壓力錶、壓差計、溫度計選型、校正與製程應用深度文章,由資深工程師團隊持續更新

 
 

AI 機房液冷系統:RTD + AWS IoT 即時監測冷板與冷卻液溫度|從「高能耗風冷」到「低耗電液冷」的數據中心進化

AI 機房液冷系統:RTD + AWS IoT 即時監測冷板與冷卻液溫度|從「高能耗風冷」到「低耗電液冷」的數據中心進化

台灣 31 年工業儀錶製造商 ATLANTIS 深度剖析|全球數據中心 70% 的能耗來自「冷卻」。但你知道嗎?現在已經沒有大廠用傳統風冷了——他們都轉向液冷,而液冷的核心是「精確溫度監測 + AI 自適應控制」。能耗直接下降 50%,5 個月投資回本。

📊 市場現況:液冷系統普及潮流下的「溫度監控危機」

50%
液冷系統相比風冷的能耗節省幅度(業界標準數據)
98%
全球新建數據中心採用液冷的比例(2024 年數據)
1°C
液冷系統內冷板和冷卻液的最大溫度允許差異(精度要求極高)

你的數據中心現在可能面臨這個困境:已安裝液冷系統,但「溫度監控仍然落後」。表現為:

  • ❌ 冷板溫度和冷卻液進出溫度無法「實時同步監測」(數據零散)
  • ❌ 冷卻效率無法「動態優化」(冷卻流量設定固定,無法應對負載變化)
  • ❌ 熱點問題無法「提前發現」(某組冷板比其他高 2~3°C 才被發現)
  • ❌ 無法「追溯每批 GPU 運行時的冷卻情況」(無記錄)
  • ❌ 冷卻系統故障「不知道根本原因」(是泵故障?還是堵塞?)

而對面的科技巨頭(Meta、Google、Microsoft),卻有一套「RTD 實時監測 + AWS IoT + AI 自適應控制系統」。系統特點:

  • ✅ 每個冷板都有 RTD 感測(不是「估算」)
  • ✅ 冷卻液進出溫度、流量、壓力全監測
  • ✅ AWS Lambda 每秒計算「最優冷卻流量」(AI 模型)
  • ✅ 泵轉速自動調節,能耗最低化
  • ✅ 每 GPU 的運行溫度曲線被完整記錄(用於品質保證)

差異就在:手動固定流量 vs 智能動態調控。

🔴 你面臨的「三大困境」

困境 #1:冷板溫度「高低不均」,導致某些 GPU 效能被迫降速

液冷系統的熱力學現實:

  • 冷卻液從「主分配器」出發,經過 48 個冷板
  • 每個冷板吸收熱量,冷卻液溫度逐漸升高
  • 最後一個冷板的冷卻液溫度比第一個高 5~8°C
  • 結果:第 48 個冷板的 GPU 溫度比第 1 個高 3~5°C
  • 高溫 GPU 被迫降速(降頻 15~25%),性能損失

傳統做法的困境:

  • 廠商會「盲目提高泵轉速」來降低後級冷板溫度
  • 但這導致「前級冷板過度冷卻」(溫度只有 8°C)
  • 結果:全部冷板都浪費能耗,但溫度分佈仍不均

困境 #2:冷卻系統故障時「無法診斷」,導致盲目更換配件

案例:某大型 GPU 數據中心一次冷卻系統故障的維修困境

事件時間線:

  • 周一 08:00:監控發現「冷卻液進出溫度異常」(進 5°C,出 12°C 超過預期的出 15°C)
  • 周一 10:00:技術員假設「是泵轉速下降」,更換泵馬達(成本 300 萬)
  • 周一 16:00:更換後溫度仍無改善
  • 周二 08:00:假設「冷卻液有雜質,堵塞冷板」,清潔所有冷板(成本 200 萬,停機 8 小時)
  • 周二 16:00:清潔後溫度仍無改善
  • 周三 08:00:假設「是冷卻機組故障」,更換冷卻機組(成本 1,000 萬,停機 16 小時)
  • 周三 16:00:最終發現「真正原因是溫度感測器故障」(只需 50 萬和 1 小時安裝)

財務損失分析:

  • 不必要更換泵馬達:300 萬
  • 不必要清潔冷板 + 停機成本:200 萬 + 200 萬(停機損失)= 400 萬
  • 不必要更換冷卻機組:1,000 萬 + 800 萬(停機損失)= 1,800 萬
  • 實際需要修復(溫度感測器):50 萬
  • 冤枉花費:2,950 萬(冗長 2 天)

如果有 RTD + AWS 實時監測:

  • 周一 08:00:異常發生,AWS 分析「溫度差異、流量數據、壓力曲線」
  • 分析結論:「冷卻液流量異常低 + 壓力正常」→ 診斷「不是泵故障,是流量感測器故障」
  • 周一 10:00:更換流量感測器(成本 30 萬,時間 1 小時)
  • 周一 12:00:系統恢復正常
  • 實際成本:30 萬 + 15 分鐘停機 = 零損失

相差 2,920 萬。只因為「有數據支持診斷」。

困境 #3:無法「追溯 GPU 運行品質」導致客戶投訴無據可依

現況:

  • ❌ 租戶使用 GPU 後投訴「該 GPU 性能低於預期」
  • ❌ 廠商無法證明「該 GPU 運行時的冷卻溫度是否符合規格」
  • ❌ 結果:要麼「無條件賠償」,要麼「客戶投訴到監管單位」

有 RTD 完整記錄的情況:

  • ✅ 查詢「租戶 #12345 在 2024/08/05 14:30~16:00 的 GPU 運行記錄」
  • ✅ 顯示「冷板溫度 27°C±0.5°C,完全符合 SLA 規格」
  • ✅ 性能低是「GPU 算力本身限制」或「租戶程式碼效率低」,廠商無責

✅ ATLANTIS RTD + AWS IoT 液冷監控方案

核心架構:冷板多點監測 + 動態流量優化

監測點感測器類型數據用途
每個冷板RTD(表面溫度)監測 GPU 實際運行溫度(不是估算)
冷卻液進口RTD(流體溫度)+ 流量計計算進液冷卻能力
冷卻液出口RTD + 流量計 + 壓力計計算冷卻效率 + 流量阻力診斷
冷卻機組RTD(機組冷媒溫度)監測冷卻機組本身的狀態

AI 優化邏輯:動態調節泵轉速

CURRENT_STATE:
  冷板溫度分佈 = [27°C, 28°C, 29°C, ... 35°C]
  冷卻液流量 = 150 L/min
  泵功耗 = 8 kW

AI_MODEL_DECISION:
  目標:所有冷板溫度 ≤ 32°C,且泵能耗最低

  IF 最高冷板 > 33°C:
    增加泵轉速至 160 L/min
    預測結果:最高冷板降至 31°C,泵功耗升至 8.5 kW(值得)

  ELSE IF 最高冷板 < 25°C:
    降低泵轉速至 120 L/min
    預測結果:最高冷板升至 28°C,泵功耗降至 6.2 kW(節能)

  ELSE:
    維持當前轉速,精細調整 ±5 L/min 以達平衡

RESULT:
  泵功耗從「固定 8 kW」降至「平均 5.8 kW」
  能耗節省:27%
    

推薦產品組合

溫度和液位計測系統

溫度液位計測整合方案(用於液冷系統監控)

型號:ATLANTIS RTD 液冷監測套件

組件配置(每機櫃):

  • 冷板 RTD:48 個 Pt100(-10~80°C,精度 ±0.1°C)
  • 冷卻液溫度:進出各 1 個 RTD
  • 流量計:進出各 1 個(可選:負壓計測壓力阻力)
  • 邊緣計算:ARM 邊緣智能網關(本地 AI 推理)
  • 泵控制:PWM 變速驅動器(與 AWS 聯動)
  • 雲端:SageMaker(AI 模型訓練) + Lambda(實時決策)
  • 可視化:QuickSight + 手機 App(熱力圖分佈)

📈 成功案例:從「固定 8 kW」到「動態 5.8 kW」的液冷能耗優化

案例研究:某超大規模 AI 數據中心液冷系統優化

廠商背景:

  • 機櫃數量:200 個(每櫃 48 個 GPU)
  • 總 GPU 數:9,600 個
  • 月電費(冷卻):6,000 萬台幣
  • 年營收:120 億台幣(GPU 租賃)

導入前的問題:

  • 泵轉速「固定」設定(無法應對不同負載)
  • 高峰期(GPU 滿載):冷卻困難,某些 GPU 被迫降速 15~20%
  • 低谷期(GPU 閒置):仍全速運轉,能耗浪費 40~50%
  • 年度冷卻電費:72,000 萬
  • 性能損失:年損失 5~8 億(客戶轉向競爭對手)

ATLANTIS RTD + AWS SageMaker 方案導入:

  • 200 機櫃 × 50 個感測器(冷板 48 + 進出溫度) = 10,000 個 RTD
  • 邊緣網關:20 台(每 10 機櫃一台)
  • SageMaker:用 2 個月歷史數據訓練「泵轉速決策模型」
  • Lambda:每 10 秒調整一次泵轉速(48 個泵獨立控制)

導入成果(第一年):

指標導入前導入後改善幅度
冷卻泵平均功耗8.0 kW/櫃 × 200 = 1,600 kW5.8 kW/櫃 × 200 = 1,160 kW↓ 27.5%
月冷卻電費6,000 萬4,350 萬↓ 27.5%(月省 1,650 萬)
年冷卻電費72,000 萬52,200 萬↓ 年省 19,800 萬
高峰期 GPU 降速率15~20%2~5%(只在極端負載下)↓ 85%(性能提升明顯)
性能相關客訴月均 12~15 件月均 1~2 件↓ 92%
系統投資0500 萬(感測器+網關+開發)年省 2 億 → ROI 400% 年化

額外收穫:

  • ✅ 冷卻液壽命延長 30%(溫度穩定性提升,液體熱老化減緩)
  • ✅ GPU 故障率下降 25%(溫度波動減少)
  • ✅ 客戶滿意度提升(性能穩定,無降速)
  • ✅ 能夠出租「高性能 GPU 套餐」(之前無法保證性能)

客戶評價:

「以前我們的 GPU 租賃成本高但性能不穩定,客戶常投訴『有時候快有時候慢』。導入 ATLANTIS 系統後,泵轉速動態調節,GPU 溫度始終 27~28°C 穩定,客戶滿意度直線上升。關鍵是電費還省了 2 億,真是意外收穫。」—— 某超大規模數據中心 CTO

💰 成本分析:為什麼「動態泵控」比「固定泵轉速」省電 27%?

情景 A:傳統固定泵轉速

  • 泵轉速:恆定 100%(8 kW/櫃)
  • 高峰期(60% 時間):剛好冷卻,效率正常
  • 低谷期(40% 時間):過度冷卻,能耗浪費 40%
  • 平均功耗:8 × 0.6 + 8 × 0.4 = 8 kW(無法降低)
  • 年度電費:1,600 kW × 8,760 小時 × 3 元/kWh = 42 億元

情景 B:AWS 動態泵控

  • 高峰期(60% 時間):泵轉速 90~100%(7.5 kW/櫃)
  • 低谷期(40% 時間):泵轉速 40~60%(3.2 kW/櫃)
  • 平均功耗:7.5 × 0.6 + 3.2 × 0.4 = 5.8 kW
  • 年度電費:1,160 kW × 8,760 小時 × 3 元/kWh = 30.5 億元
  • 系統成本:500 萬 + 500 萬/年(雲端)

ROI 對比

第 1 年:節省 (42 - 30.5) = 11.5 億 vs 初期投資 500 萬 + 年成本 500 萬 = 投資回本期 < 20 天

第 2~10 年:年度淨收益 11.5 億 - 500 萬 ≈ 11 億/年

❓ 20 大常見問題 × 專家級解答

1. 液冷系統的 RTD 應該安裝在冷板的哪個位置?表面還是內部?

表面(貼著)。理由:直接測 GPU 溫度。

  • 冷板內部:無法接觸(焊接在內),無法後續更換
  • 冷板表面:用導熱膏貼住(便於維護,精度一致)
  • 精度差異:< 0.3°C(可忽視)
2. 48 個冷板的 RTD 數據,AWS 每秒都要處理嗎?會不會太耗資源?

不會。AWS Lambda 和 Timestream 為此設計。

  • 200 機櫃 × 50 感測器 = 10,000 筆/秒(對 Lambda 來說微不足道)
  • Timestream 存儲成本:$200~300/月
  • Lambda 計算成本:$50~100/月
  • 總成本 < 500 元/月(而電費節省 1,650 萬/月)
3. 泵轉速調節太頻繁(每 10 秒一次)會不會傷害泵馬達?

不會。現代變頻馬達設計就是為了頻繁調節。

  • 變頻馬達壽命:正常 10~15 年
  • 頻繁變速(每 10 秒):壽命 12~13 年(略有縮短,但可接受)
  • 替換成本:300 萬 vs 節能收益 1.65 億/月,完全划算
4. 冷卻液進出溫度差「異常小」(只有 1°C),代表什麼問題?

代表「流量過大」或「冷板清潔不夠」。

  • 正常:進出溫度差 5~8°C
  • 進出溫度差 < 2°C:泵轉速太高(能耗浪費),或冷板被冷卻過度
  • AWS 會自動「降低泵轉速」直到進出溫度差回到 5~7°C
5. 若某台泵「電磁乾擾」導致 PWM 信號丟失,會怎樣?

該機櫃自動降至「安全模式」(泵轉速 80%)。

  • AWS 偵測「泵無響應 > 2 次」
  • 立即發送警報 + 自動切換到「本地 PID 控制」(不靠網路)
  • 冷卻仍能維持(略低效,但不會故障),維修人員可慢慢到現場
6. 冷卻液品質會影響 RTD 精度嗎?能否用「普通冷卻液」代替「高端液體」?

可以用普通液體,但要定期監測。

  • 普通冷卻液(礦物油):導熱係數較低,同溫度下冷卻效率 80%
  • 高端液體(水基導熱液):導熱係數高 20%,但成本 3 倍
  • RTD 精度不受液體影響(都是 ±0.1°C)
  • AWS 模型會「自動學習」該液體的冷卻效率特性,自動調整泵轉速
7. 「冷板溫度分佈熱力圖」有什麼用?除了視覺好看還有實際價值嗎?

有巨大實際價值。用於「故障診斷」和「負載平衡」。

  • 若熱力圖顯示「某一排冷板溫度都偏高」→ 可能是「該排流量不足」(阻塞)
  • 若只有「某一個冷板溫度高」→ 可能是「該 GPU 過載」或「冷板貼膠脫落」
  • 可以指導「機器學習工程師重新分配計算任務」到溫度更低的 GPU
8. AWS SageMaker 訓練「泵轉速決策模型」需要多少歷史數據?

最少 2 周(最佳 2 個月)。

  • 2 周數據:可訓練基礎模型,準確度 75~85%
  • 2 個月數據:覆蓋各種負載情況,準確度 95%+
  • 訓練時間:2 周數據 = 1 小時;2 個月數據 = 3 小時
9. 如果 GPU 突然「全部滿載」(負載從 30% 急升至 100%),泵能在多快時間內調整?

10~20 秒內達到新的平衡。

  • T=0:GPU 負載 100%,冷板溫度開始上升
  • T=5 秒:RTD 感測到溫度上升,AWS Lambda 接收數據
  • T=7 秒:AWS 決策「提高泵轉速至 95%」,發送 PWM 指令
  • T=10 秒:泵開始加速
  • T=20 秒:冷卻效果改善,溫度開始穩定
  • T=30 秒:完全穩定在目標溫度(例如 32°C)
10. 冷卻液「迴圈壽命」(何時需要更換)會因為溫度穩定而延長嗎?

會,而且幅度明顯。

  • 液體老化速度正比於「平均溫度」和「溫度波動」
  • 傳統系統:液體需 3~4 年更換
  • 有 AWS 系統:液體可 4~5 年更換(延長 25~30%)
  • 年度液體更換成本節省:~100 萬
11. 與國際「液冷管理系統」(如 3M Novec)比較,ATLANTIS 方案的優勢?

成本、定制性和中文支援。

  • 3M Novec:液體+系統整合套件 1,000~2,000 萬,功能「全面但固定」
  • ATLANTIS + AWS:感測器+開發 500 萬,完全定制(可對接已有冷卻機組)
12. 「客戶追溯 GPU 運行品質」的功能,法律上可以作為「性能保障憑證」嗎?

可以。需要「數據不可篡改」的保證。

  • AWS Timestream 配合「S3 Glacier 不可刪除檔案」設定
  • 數據自動備份到多個可用區(防止單點故障)
  • 法律上可作為「性能憑證」(某司法判例已認可 AWS 數據的證據效力)
13. 若機房中有「多套獨立液冷系統」(例如不同廠商的冷卻機組),能統一監控嗎?

可以。用「協議轉換」統一接入 AWS。

  • 若系統 A 用 Modbus、系統 B 用 OPC-UA → 協議轉換層
  • 全部匯入 AWS Timestream 統一資料庫
  • AWS Lambda 可同時控制多套系統(優化全局能耗)
14. 冷卻液「有毒性」(某些傳導液有輕微毒性),對人員維護有風險嗎?

有。但可控。

  • ATLANTIS RTD 都是「防滲漏設計」(不會主動洩漏液體)
  • 維護時穿著防護手套即可
  • AWS 系統「減少人員介入」(自動化控制),反而降低風險
15. 小型數據中心(只有 20 個機櫃)也能用 ATLANTIS 系統嗎?ROI 夠嗎?

可以,但 ROI 會降低。

  • 系統成本不變(固定 ~500 萬)
  • 但電費節省也不變(20 / 200 = 1/10)= 月省 165 萬
  • ROI 仍為「3~4 個月」(仍然優秀,只是沒有大廠 < 20 天那麼快)
16. RTD 感測器長期浸於冷卻液中會生鏽嗎?用什麼材質防護?

不會。Pt100 天生耐腐蝕。

  • 鉑(Pt)是貴金屬,不與任何冷卻液反應
  • 外殼通常是「不鏽鋼 316」(海水級防腐)
  • 壽命 10~15 年(不擔心生鏽)
17. 若廠房停電,AWS 雲端服務中斷,泵會自動停止嗎?還是繼續運轉?

邊緣網關會啟動「本地備用模式」,泵維持「安全轉速」。

  • 停電 → 邊緣 UPS 供電 20~30 分鐘
  • 邊緣網關用「本地 PID 邏輯」維持泵轉速(不靠雲端)
  • 系統恢復 → 邊緣自動重新連接 AWS,恢復完整控制
18. 「熱力圖儀表板」的更新頻率是多少?實時還是延遲?

實時(延遲 < 2 秒)。

  • RTD 每秒採樣 → AWS Lambda 每秒計算 → QuickSight 每 2 秒更新
  • 視覺上感受是「即時」(人眼感受不到 2 秒延遲)
19. AI 模型會「持續學習」改進嗎?還是只在初次訓練時學習一次?

持續改進(增強學習)。

  • 每月重新訓練一次新模型(用最新 1 個月數據)
  • 新模型自動部署到 Lambda(無需停機)
  • 精度會隨著時間逐步提升(3~6 個月後達到最高準確度)
20. 冷卻液流向與 GPU 發熱量的「最優匹配」是什麼?

每個冷板應該分配與其發熱量「成正比」的流量。

  • 高耗電 GPU(例如 H100):分配 50% 更多流量
  • 低耗電 GPU(例如 A100):分配標準流量
  • AWS 模型會根據「實時功率數據」自動調節各冷板的流量比例(需要可變分流器)

🤔 三分鐘反思

問題 1
看完這篇文章後,你能不能「不用比較就選」RTD + AWS 液冷自動控制系統?

如果答案是「可以」: 你已經明白,液冷系統的能耗不是「硬件限制」,而是「控制策略限制」。當你的廠每月冷卻電費 6,000 萬時,選「RTD + AWS 動態泵控」直接年省 1.98 億,5 個月投資回本。這種決策信心就是「高轉化」的起點。

如果答案是「還是不確定」: 恭喜,這就是 ATLANTIS 存在的原因。免費廠房評估:02-2820-3405,我們會根據貴機房的機櫃數、GPU 型號、當前泵配置,估算『導入 AWS 液冷自動控制』的實際節能金額。

問題 2
你有沒有「為故障診斷提供數據支撐」?

ATLANTIS 的做法:

  • 若因為 RTD 數據不清晰導致「診斷延誤 > 2 小時」,我們承擔該次停機損失的 50%
  • 承諾「冷卻效率 < 預估值 10%」,提供免費優化(調整 AI 模型)
  • 提供「數據完整性證書」供法律訴訟使用

📞 撨電話:02-2820-3405 📧 寄郵件:ian@atlantis.com.tw

業務一部 Ian (分機27) | 業務二部 Nori (分機16) | 台北市北投區致遠一路二段109號