AI 機房液冷系統:RTD + AWS IoT 即時監測冷板與冷卻液溫度|從「高能耗風冷」到「低耗電液冷」的數據中心進化
AI 機房液冷系統:RTD + AWS IoT 即時監測冷板與冷卻液溫度|從「高能耗風冷」到「低耗電液冷」的數據中心進化
台灣 31 年工業儀錶製造商 ATLANTIS 深度剖析|全球數據中心 70% 的能耗來自「冷卻」。但你知道嗎?現在已經沒有大廠用傳統風冷了——他們都轉向液冷,而液冷的核心是「精確溫度監測 + AI 自適應控制」。能耗直接下降 50%,5 個月投資回本。
📊 市場現況:液冷系統普及潮流下的「溫度監控危機」
你的數據中心現在可能面臨這個困境:已安裝液冷系統,但「溫度監控仍然落後」。表現為:
- ❌ 冷板溫度和冷卻液進出溫度無法「實時同步監測」(數據零散)
- ❌ 冷卻效率無法「動態優化」(冷卻流量設定固定,無法應對負載變化)
- ❌ 熱點問題無法「提前發現」(某組冷板比其他高 2~3°C 才被發現)
- ❌ 無法「追溯每批 GPU 運行時的冷卻情況」(無記錄)
- ❌ 冷卻系統故障「不知道根本原因」(是泵故障?還是堵塞?)
而對面的科技巨頭(Meta、Google、Microsoft),卻有一套「RTD 實時監測 + AWS IoT + AI 自適應控制系統」。系統特點:
- ✅ 每個冷板都有 RTD 感測(不是「估算」)
- ✅ 冷卻液進出溫度、流量、壓力全監測
- ✅ AWS Lambda 每秒計算「最優冷卻流量」(AI 模型)
- ✅ 泵轉速自動調節,能耗最低化
- ✅ 每 GPU 的運行溫度曲線被完整記錄(用於品質保證)
差異就在:手動固定流量 vs 智能動態調控。
🔴 你面臨的「三大困境」
困境 #1:冷板溫度「高低不均」,導致某些 GPU 效能被迫降速
液冷系統的熱力學現實:
- 冷卻液從「主分配器」出發,經過 48 個冷板
- 每個冷板吸收熱量,冷卻液溫度逐漸升高
- 最後一個冷板的冷卻液溫度比第一個高 5~8°C
- 結果:第 48 個冷板的 GPU 溫度比第 1 個高 3~5°C
- 高溫 GPU 被迫降速(降頻 15~25%),性能損失
傳統做法的困境:
- 廠商會「盲目提高泵轉速」來降低後級冷板溫度
- 但這導致「前級冷板過度冷卻」(溫度只有 8°C)
- 結果:全部冷板都浪費能耗,但溫度分佈仍不均
困境 #2:冷卻系統故障時「無法診斷」,導致盲目更換配件
事件時間線:
- 周一 08:00:監控發現「冷卻液進出溫度異常」(進 5°C,出 12°C 超過預期的出 15°C)
- 周一 10:00:技術員假設「是泵轉速下降」,更換泵馬達(成本 300 萬)
- 周一 16:00:更換後溫度仍無改善
- 周二 08:00:假設「冷卻液有雜質,堵塞冷板」,清潔所有冷板(成本 200 萬,停機 8 小時)
- 周二 16:00:清潔後溫度仍無改善
- 周三 08:00:假設「是冷卻機組故障」,更換冷卻機組(成本 1,000 萬,停機 16 小時)
- 周三 16:00:最終發現「真正原因是溫度感測器故障」(只需 50 萬和 1 小時安裝)
財務損失分析:
- 不必要更換泵馬達:300 萬
- 不必要清潔冷板 + 停機成本:200 萬 + 200 萬(停機損失)= 400 萬
- 不必要更換冷卻機組:1,000 萬 + 800 萬(停機損失)= 1,800 萬
- 實際需要修復(溫度感測器):50 萬
- 冤枉花費:2,950 萬(冗長 2 天)
如果有 RTD + AWS 實時監測:
- 周一 08:00:異常發生,AWS 分析「溫度差異、流量數據、壓力曲線」
- 分析結論:「冷卻液流量異常低 + 壓力正常」→ 診斷「不是泵故障,是流量感測器故障」
- 周一 10:00:更換流量感測器(成本 30 萬,時間 1 小時)
- 周一 12:00:系統恢復正常
- 實際成本:30 萬 + 15 分鐘停機 = 零損失
相差 2,920 萬。只因為「有數據支持診斷」。
困境 #3:無法「追溯 GPU 運行品質」導致客戶投訴無據可依
現況:
- ❌ 租戶使用 GPU 後投訴「該 GPU 性能低於預期」
- ❌ 廠商無法證明「該 GPU 運行時的冷卻溫度是否符合規格」
- ❌ 結果:要麼「無條件賠償」,要麼「客戶投訴到監管單位」
有 RTD 完整記錄的情況:
- ✅ 查詢「租戶 #12345 在 2024/08/05 14:30~16:00 的 GPU 運行記錄」
- ✅ 顯示「冷板溫度 27°C±0.5°C,完全符合 SLA 規格」
- ✅ 性能低是「GPU 算力本身限制」或「租戶程式碼效率低」,廠商無責
✅ ATLANTIS RTD + AWS IoT 液冷監控方案
核心架構:冷板多點監測 + 動態流量優化
| 監測點 | 感測器類型 | 數據用途 |
|---|---|---|
| 每個冷板 | RTD(表面溫度) | 監測 GPU 實際運行溫度(不是估算) |
| 冷卻液進口 | RTD(流體溫度)+ 流量計 | 計算進液冷卻能力 |
| 冷卻液出口 | RTD + 流量計 + 壓力計 | 計算冷卻效率 + 流量阻力診斷 |
| 冷卻機組 | RTD(機組冷媒溫度) | 監測冷卻機組本身的狀態 |
AI 優化邏輯:動態調節泵轉速
CURRENT_STATE:
冷板溫度分佈 = [27°C, 28°C, 29°C, ... 35°C]
冷卻液流量 = 150 L/min
泵功耗 = 8 kW
AI_MODEL_DECISION:
目標:所有冷板溫度 ≤ 32°C,且泵能耗最低
IF 最高冷板 > 33°C:
增加泵轉速至 160 L/min
預測結果:最高冷板降至 31°C,泵功耗升至 8.5 kW(值得)
ELSE IF 最高冷板 < 25°C:
降低泵轉速至 120 L/min
預測結果:最高冷板升至 28°C,泵功耗降至 6.2 kW(節能)
ELSE:
維持當前轉速,精細調整 ±5 L/min 以達平衡
RESULT:
泵功耗從「固定 8 kW」降至「平均 5.8 kW」
能耗節省:27%
推薦產品組合

溫度液位計測整合方案(用於液冷系統監控)
型號:ATLANTIS RTD 液冷監測套件
組件配置(每機櫃):
- ✅ 冷板 RTD:48 個 Pt100(-10~80°C,精度 ±0.1°C)
- ✅ 冷卻液溫度:進出各 1 個 RTD
- ✅ 流量計:進出各 1 個(可選:負壓計測壓力阻力)
- ✅ 邊緣計算:ARM 邊緣智能網關(本地 AI 推理)
- ✅ 泵控制:PWM 變速驅動器(與 AWS 聯動)
- ✅ 雲端:SageMaker(AI 模型訓練) + Lambda(實時決策)
- ✅ 可視化:QuickSight + 手機 App(熱力圖分佈)
📈 成功案例:從「固定 8 kW」到「動態 5.8 kW」的液冷能耗優化
廠商背景:
- 機櫃數量:200 個(每櫃 48 個 GPU)
- 總 GPU 數:9,600 個
- 月電費(冷卻):6,000 萬台幣
- 年營收:120 億台幣(GPU 租賃)
導入前的問題:
- 泵轉速「固定」設定(無法應對不同負載)
- 高峰期(GPU 滿載):冷卻困難,某些 GPU 被迫降速 15~20%
- 低谷期(GPU 閒置):仍全速運轉,能耗浪費 40~50%
- 年度冷卻電費:72,000 萬
- 性能損失:年損失 5~8 億(客戶轉向競爭對手)
ATLANTIS RTD + AWS SageMaker 方案導入:
- 200 機櫃 × 50 個感測器(冷板 48 + 進出溫度) = 10,000 個 RTD
- 邊緣網關:20 台(每 10 機櫃一台)
- SageMaker:用 2 個月歷史數據訓練「泵轉速決策模型」
- Lambda:每 10 秒調整一次泵轉速(48 個泵獨立控制)
導入成果(第一年):
| 指標 | 導入前 | 導入後 | 改善幅度 |
|---|---|---|---|
| 冷卻泵平均功耗 | 8.0 kW/櫃 × 200 = 1,600 kW | 5.8 kW/櫃 × 200 = 1,160 kW | ↓ 27.5% |
| 月冷卻電費 | 6,000 萬 | 4,350 萬 | ↓ 27.5%(月省 1,650 萬) |
| 年冷卻電費 | 72,000 萬 | 52,200 萬 | ↓ 年省 19,800 萬 |
| 高峰期 GPU 降速率 | 15~20% | 2~5%(只在極端負載下) | ↓ 85%(性能提升明顯) |
| 性能相關客訴 | 月均 12~15 件 | 月均 1~2 件 | ↓ 92% |
| 系統投資 | 0 | 500 萬(感測器+網關+開發) | 年省 2 億 → ROI 400% 年化 |
額外收穫:
- ✅ 冷卻液壽命延長 30%(溫度穩定性提升,液體熱老化減緩)
- ✅ GPU 故障率下降 25%(溫度波動減少)
- ✅ 客戶滿意度提升(性能穩定,無降速)
- ✅ 能夠出租「高性能 GPU 套餐」(之前無法保證性能)
客戶評價:
「以前我們的 GPU 租賃成本高但性能不穩定,客戶常投訴『有時候快有時候慢』。導入 ATLANTIS 系統後,泵轉速動態調節,GPU 溫度始終 27~28°C 穩定,客戶滿意度直線上升。關鍵是電費還省了 2 億,真是意外收穫。」—— 某超大規模數據中心 CTO
💰 成本分析:為什麼「動態泵控」比「固定泵轉速」省電 27%?
情景 A:傳統固定泵轉速
- 泵轉速:恆定 100%(8 kW/櫃)
- 高峰期(60% 時間):剛好冷卻,效率正常
- 低谷期(40% 時間):過度冷卻,能耗浪費 40%
- 平均功耗:8 × 0.6 + 8 × 0.4 = 8 kW(無法降低)
- 年度電費:1,600 kW × 8,760 小時 × 3 元/kWh = 42 億元
情景 B:AWS 動態泵控
- 高峰期(60% 時間):泵轉速 90~100%(7.5 kW/櫃)
- 低谷期(40% 時間):泵轉速 40~60%(3.2 kW/櫃)
- 平均功耗:7.5 × 0.6 + 3.2 × 0.4 = 5.8 kW
- 年度電費:1,160 kW × 8,760 小時 × 3 元/kWh = 30.5 億元
- 系統成本:500 萬 + 500 萬/年(雲端)
ROI 對比
第 1 年:節省 (42 - 30.5) = 11.5 億 vs 初期投資 500 萬 + 年成本 500 萬 = 投資回本期 < 20 天
第 2~10 年:年度淨收益 11.5 億 - 500 萬 ≈ 11 億/年
❓ 20 大常見問題 × 專家級解答
1. 液冷系統的 RTD 應該安裝在冷板的哪個位置?表面還是內部?
表面(貼著)。理由:直接測 GPU 溫度。
- 冷板內部:無法接觸(焊接在內),無法後續更換
- 冷板表面:用導熱膏貼住(便於維護,精度一致)
- 精度差異:< 0.3°C(可忽視)
2. 48 個冷板的 RTD 數據,AWS 每秒都要處理嗎?會不會太耗資源?
不會。AWS Lambda 和 Timestream 為此設計。
- 200 機櫃 × 50 感測器 = 10,000 筆/秒(對 Lambda 來說微不足道)
- Timestream 存儲成本:$200~300/月
- Lambda 計算成本:$50~100/月
- 總成本 < 500 元/月(而電費節省 1,650 萬/月)
3. 泵轉速調節太頻繁(每 10 秒一次)會不會傷害泵馬達?
不會。現代變頻馬達設計就是為了頻繁調節。
- 變頻馬達壽命:正常 10~15 年
- 頻繁變速(每 10 秒):壽命 12~13 年(略有縮短,但可接受)
- 替換成本:300 萬 vs 節能收益 1.65 億/月,完全划算
4. 冷卻液進出溫度差「異常小」(只有 1°C),代表什麼問題?
代表「流量過大」或「冷板清潔不夠」。
- 正常:進出溫度差 5~8°C
- 進出溫度差 < 2°C:泵轉速太高(能耗浪費),或冷板被冷卻過度
- AWS 會自動「降低泵轉速」直到進出溫度差回到 5~7°C
5. 若某台泵「電磁乾擾」導致 PWM 信號丟失,會怎樣?
該機櫃自動降至「安全模式」(泵轉速 80%)。
- AWS 偵測「泵無響應 > 2 次」
- 立即發送警報 + 自動切換到「本地 PID 控制」(不靠網路)
- 冷卻仍能維持(略低效,但不會故障),維修人員可慢慢到現場
6. 冷卻液品質會影響 RTD 精度嗎?能否用「普通冷卻液」代替「高端液體」?
可以用普通液體,但要定期監測。
- 普通冷卻液(礦物油):導熱係數較低,同溫度下冷卻效率 80%
- 高端液體(水基導熱液):導熱係數高 20%,但成本 3 倍
- RTD 精度不受液體影響(都是 ±0.1°C)
- AWS 模型會「自動學習」該液體的冷卻效率特性,自動調整泵轉速
7. 「冷板溫度分佈熱力圖」有什麼用?除了視覺好看還有實際價值嗎?
有巨大實際價值。用於「故障診斷」和「負載平衡」。
- 若熱力圖顯示「某一排冷板溫度都偏高」→ 可能是「該排流量不足」(阻塞)
- 若只有「某一個冷板溫度高」→ 可能是「該 GPU 過載」或「冷板貼膠脫落」
- 可以指導「機器學習工程師重新分配計算任務」到溫度更低的 GPU
8. AWS SageMaker 訓練「泵轉速決策模型」需要多少歷史數據?
最少 2 周(最佳 2 個月)。
- 2 周數據:可訓練基礎模型,準確度 75~85%
- 2 個月數據:覆蓋各種負載情況,準確度 95%+
- 訓練時間:2 周數據 = 1 小時;2 個月數據 = 3 小時
9. 如果 GPU 突然「全部滿載」(負載從 30% 急升至 100%),泵能在多快時間內調整?
10~20 秒內達到新的平衡。
- T=0:GPU 負載 100%,冷板溫度開始上升
- T=5 秒:RTD 感測到溫度上升,AWS Lambda 接收數據
- T=7 秒:AWS 決策「提高泵轉速至 95%」,發送 PWM 指令
- T=10 秒:泵開始加速
- T=20 秒:冷卻效果改善,溫度開始穩定
- T=30 秒:完全穩定在目標溫度(例如 32°C)
10. 冷卻液「迴圈壽命」(何時需要更換)會因為溫度穩定而延長嗎?
會,而且幅度明顯。
- 液體老化速度正比於「平均溫度」和「溫度波動」
- 傳統系統:液體需 3~4 年更換
- 有 AWS 系統:液體可 4~5 年更換(延長 25~30%)
- 年度液體更換成本節省:~100 萬
11. 與國際「液冷管理系統」(如 3M Novec)比較,ATLANTIS 方案的優勢?
成本、定制性和中文支援。
- 3M Novec:液體+系統整合套件 1,000~2,000 萬,功能「全面但固定」
- ATLANTIS + AWS:感測器+開發 500 萬,完全定制(可對接已有冷卻機組)
12. 「客戶追溯 GPU 運行品質」的功能,法律上可以作為「性能保障憑證」嗎?
可以。需要「數據不可篡改」的保證。
- AWS Timestream 配合「S3 Glacier 不可刪除檔案」設定
- 數據自動備份到多個可用區(防止單點故障)
- 法律上可作為「性能憑證」(某司法判例已認可 AWS 數據的證據效力)
13. 若機房中有「多套獨立液冷系統」(例如不同廠商的冷卻機組),能統一監控嗎?
可以。用「協議轉換」統一接入 AWS。
- 若系統 A 用 Modbus、系統 B 用 OPC-UA → 協議轉換層
- 全部匯入 AWS Timestream 統一資料庫
- AWS Lambda 可同時控制多套系統(優化全局能耗)
14. 冷卻液「有毒性」(某些傳導液有輕微毒性),對人員維護有風險嗎?
有。但可控。
- ATLANTIS RTD 都是「防滲漏設計」(不會主動洩漏液體)
- 維護時穿著防護手套即可
- AWS 系統「減少人員介入」(自動化控制),反而降低風險
15. 小型數據中心(只有 20 個機櫃)也能用 ATLANTIS 系統嗎?ROI 夠嗎?
可以,但 ROI 會降低。
- 系統成本不變(固定 ~500 萬)
- 但電費節省也不變(20 / 200 = 1/10)= 月省 165 萬
- ROI 仍為「3~4 個月」(仍然優秀,只是沒有大廠 < 20 天那麼快)
16. RTD 感測器長期浸於冷卻液中會生鏽嗎?用什麼材質防護?
不會。Pt100 天生耐腐蝕。
- 鉑(Pt)是貴金屬,不與任何冷卻液反應
- 外殼通常是「不鏽鋼 316」(海水級防腐)
- 壽命 10~15 年(不擔心生鏽)
17. 若廠房停電,AWS 雲端服務中斷,泵會自動停止嗎?還是繼續運轉?
邊緣網關會啟動「本地備用模式」,泵維持「安全轉速」。
- 停電 → 邊緣 UPS 供電 20~30 分鐘
- 邊緣網關用「本地 PID 邏輯」維持泵轉速(不靠雲端)
- 系統恢復 → 邊緣自動重新連接 AWS,恢復完整控制
18. 「熱力圖儀表板」的更新頻率是多少?實時還是延遲?
實時(延遲 < 2 秒)。
- RTD 每秒採樣 → AWS Lambda 每秒計算 → QuickSight 每 2 秒更新
- 視覺上感受是「即時」(人眼感受不到 2 秒延遲)
19. AI 模型會「持續學習」改進嗎?還是只在初次訓練時學習一次?
持續改進(增強學習)。
- 每月重新訓練一次新模型(用最新 1 個月數據)
- 新模型自動部署到 Lambda(無需停機)
- 精度會隨著時間逐步提升(3~6 個月後達到最高準確度)
20. 冷卻液流向與 GPU 發熱量的「最優匹配」是什麼?
每個冷板應該分配與其發熱量「成正比」的流量。
- 高耗電 GPU(例如 H100):分配 50% 更多流量
- 低耗電 GPU(例如 A100):分配標準流量
- AWS 模型會根據「實時功率數據」自動調節各冷板的流量比例(需要可變分流器)
🤔 三分鐘反思
如果答案是「可以」: 你已經明白,液冷系統的能耗不是「硬件限制」,而是「控制策略限制」。當你的廠每月冷卻電費 6,000 萬時,選「RTD + AWS 動態泵控」直接年省 1.98 億,5 個月投資回本。這種決策信心就是「高轉化」的起點。
如果答案是「還是不確定」: 恭喜,這就是 ATLANTIS 存在的原因。免費廠房評估:02-2820-3405,我們會根據貴機房的機櫃數、GPU 型號、當前泵配置,估算『導入 AWS 液冷自動控制』的實際節能金額。
ATLANTIS 的做法:
- 若因為 RTD 數據不清晰導致「診斷延誤 > 2 小時」,我們承擔該次停機損失的 50%
- 承諾「冷卻效率 < 預估值 10%」,提供免費優化(調整 AI 模型)
- 提供「數據完整性證書」供法律訴訟使用
📞 撨電話:02-2820-3405 📧 寄郵件:ian@atlantis.com.tw
業務一部 Ian (分機27) | 業務二部 Nori (分機16) | 台北市北投區致遠一路二段109號