根據生命週期階段 (例如小規模原型設計、即時推論和大規模分散式訓練),使用這份文件為人工智慧 (AI) 和機器學習 (ML) 工作負載找出最佳加速器基礎架構。AI Hypercomputer 將加速器產品分為兩類:一般 GPU 和叢集 GPU。
GPU 基礎架構
AI Hypercomputer 提供兩種不同的 GPU 類別。每個類別都有不同的管理模型,決定系統如何處理生命週期事件、管理維護作業,以及為工作負載最佳化網路:
一般 GPU 管理模型
一般 GPU 管理模型適用於優先考量資源獨立性和高可用性的工作負載。這個模型使用標準 Google Cloud 管理平面,因此對於已使用 Compute Engine 或 GKE 的團隊來說,操作體驗十分熟悉。
維護:非同步。個別執行個體會獨立更新。在多節點服務機群中,一個節點的維護事件不會影響其他節點的可用性,因此流量可以重新導向至正常節點,不會導致整個作業停滯。
主要用途:建議用於主流工作,例如即時推論、模型服務、小規模原型設計,以及不需要超級電腦規模的開發環境。
一般 GPU 機器系列
下列機器系列為一般 GPU:
- G2 (L4)
- G4 (RTX PRO 6000)
- A2 (A100)
- N1+T4
- A3 Edge
- A3 High (1 個、2 個或 4 個 GPU)
如要瞭解各個一般 GPU 機器的技術資訊,請參閱「GPU 機器類型」。
叢集 GPU 管理模型
叢集式 GPU 管理模型是專為大規模分散式訓練設計的超級電腦級環境。使用叢集式 GPU 堆疊,即可將資源管理為單一緊密耦合的系統。
維護:協調。這個模型會協調維護事件,以支援緊密耦合的工作負載。如要進行分散式訓練,可以使用同步維護作業,同時在所有節點套用更新。這種做法可避免節點重新啟動時工作停滯,並盡可能提高有效輸送量。這款機型也會在維修保養到期前 90 天發出通知。
主要用途:專為訓練具有數兆個參數的 Exascale 基礎模型,或執行複雜的高效能運算 (HPC) 模擬而設計,例如藥物研發和蛋白質摺疊。
叢集 GPU 機器系列
下列機器系列為叢集 GPU:
- A4X
- A4 (Blackwell)
- A3 Ultra
- A3 Mega
- A3 High (8 個 GPU)
如要瞭解各個叢集 GPU 機器的技術資訊,請參閱「GPU 機器類型」。
能力矩陣
比較一般 GPU 和叢集 GPU 管理模型的技術和運作特徵:
| 特性 | 一般 GPU 管理模型 | 叢集 GPU 管理模型 |
|---|---|---|
| 主要應用實例 | 推論、提供模型、原型設計和開發 | 大規模分散式訓練和 HPC |
| 維護 | 非同步:獨立節點更新可重新導向流量,不會導致工作停滯 | 協調式:支援叢集範圍的協調 (同步) 更新,確保節點保持同步,並盡量提高有效輸送量 |
| 目標硬體 | G2 (L4)、G4 (RTX PRO 6000)、A2 (A100)、N1+T4、A3 Edge 和 A3 High (1、2 或 4 個 GPU) | A4X、A4 (Blackwell)、A3 Ultra、A3 Mega 和 A3 High (8 個 GPU) |
| 網路 | 透過 gVNIC 介面的標準 VPC 網路 (A3 Edge 除外,該介面會透過多個 VPC 使用 GPUDirect-TCPX) | 專用的低延遲結構 (RDMA、RoCE、TCPX 或 NVIDIA NVLink) |
| 管理堆疊 | 標準 Google Cloud 層級 (Compute Engine 或 GKE) | 專門的管理堆疊 (例如 Cluster Director) |
| 可靠性 | 標準節點自動修復和 Pod 層級正常運作時間 | 專用資源和復原套件 |
決策矩陣
請使用這份矩陣,找出符合特定工作負載意圖的硬體系列:
| 如果工作負載涉及... | 建議的 GPU 基礎架構 | 建議的機器系列 |
|---|---|---|
| 原型設計與開發 | 一般 GPU | G2、G4、A2、N1+T4、A3 Edge |
| 即時推論 (參數 < 1000 億) | 一般 GPU | G2、G4、A2、N1+T4、A3 Edge |
| 跨多個 GPU 進行推論 | 叢集 GPU | A3、A4 |
| 大規模訓練與推論 | 叢集 GPU | A4、A3 系列 |
| 大規模訓練 (超過 5,000 億個參數) 和分離式推論 | 叢集 GPU | A4X Max、A4X、A4 |
如要查看將模型架構直接對應至硬體的詳細決策樹狀圖,請參閱「選擇加速器」。
確立這些主要條件後,請選擇自動化調度管理平台。 這項選擇取決於團隊偏好自動管理,還是要精細控管作業系統和驅動程式。
後續步驟
- 如要選取自動調度管理工具和部署選項,請參閱「挑選自動調度管理工具和部署選項」。
- 如要部署推論工作負載或執行大規模訓練,請參閱 AI Hypercomputer 教學課程。
- 如要提升系統效率,請參閱 Goodput 最佳化做法。