選擇加速器基礎架構

根據生命週期階段 (例如小規模原型設計、即時推論和大規模分散式訓練),使用這份文件為人工智慧 (AI) 和機器學習 (ML) 工作負載找出最佳加速器基礎架構。AI Hypercomputer 將加速器產品分為兩類:一般 GPU叢集 GPU

GPU 基礎架構

AI Hypercomputer 提供兩種不同的 GPU 類別。每個類別都有不同的管理模型,決定系統如何處理生命週期事件、管理維護作業,以及為工作負載最佳化網路:

一般 GPU 管理模型

一般 GPU 管理模型適用於優先考量資源獨立性和高可用性的工作負載。這個模型使用標準 Google Cloud 管理平面,因此對於已使用 Compute Engine 或 GKE 的團隊來說,操作體驗十分熟悉。

  • 維護:非同步。個別執行個體會獨立更新。在多節點服務機群中,一個節點的維護事件不會影響其他節點的可用性,因此流量可以重新導向至正常節點,不會導致整個工作停滯。

  • 主要用途:建議用於主流工作,例如即時推論、模型服務、小規模原型設計,以及不需要超級電腦規模的開發環境。

一般 GPU 機器系列

下列機器系列為一般 GPU:

  • A3 High,配備 1、2 或 4 個 GPU
  • A3 Edge
  • A2
  • G4
  • G2
  • N1+T4
  • N1+V100

如要瞭解各個一般 GPU 機器的技術資訊,請參閱「GPU 機器類型」。

叢集 GPU 管理模型

叢集式 GPU 管理模型是專為大規模分散式訓練設計的超級電腦級環境。使用叢集 GPU 堆疊,即可將資源當做單一緊密耦合的系統進行管理。

  • 維護:協調。這個模型會協調維護事件,以支援緊密耦合的工作負載。如要進行分散式訓練,可以使用同步維護,同時在所有節點套用更新。這種做法可避免節點重新啟動時工作停滯,並盡可能提高有效輸送量。這款機型也會在維修保養到期前 90 天發出通知。

  • 主要用途:專為訓練具有數兆個參數的 Exascale 基礎模型,或執行複雜的高效能運算 (HPC) 模擬而設計,例如藥物研發和蛋白質摺疊。

叢集 GPU 機器系列

下列機器系列是叢集 GPU:

  • A4X Max
  • A4X
  • A4
  • A3 Ultra
  • A3 Mega
  • 配備 8 個 GPU 的 A3 High

如要瞭解各個叢集 GPU 機器的技術資訊,請參閱「GPU 機器類型」。

能力矩陣

比較一般 GPU 和叢集 GPU 管理模型的技術和運作特徵:

特性 一般 GPU 管理模型 叢集 GPU 管理模型
主要應用實例 推論、提供模型、原型設計和開發 大規模分散式訓練和 HPC
維護 非同步:獨立節點更新可重新導向流量,不會導致工作停滯 協調式:支援叢集範圍的協調式 (同步) 更新,確保節點保持同步,並盡量提高有效輸送量
目標硬體 A3 High (1、2 或 4 個 GPU)A3 EdgeG4G2A2N1+T4N1+V100 A4XA4A3 UltraA3 MegaA3 High (8 個 GPU)
網路 透過 gVNIC 介面的標準 VPC 網路 (A3 Edge 除外,該介面會透過多個 VPC 使用 GPUDirect-TCPX) 專用的低延遲結構 (RDMA、RoCE、TCPX 或 NVIDIA NVLink)
管理堆疊 標準 Google Cloud 層級 (Compute Engine 或 GKE) 專門的管理堆疊 (例如叢集總監)
可靠性 標準節點自動修復和 Pod 層級正常運作時間 專用資源和復原套件

決策矩陣

請使用這份矩陣,找出符合特定工作負載意圖的硬體系列:

如果工作負載涉及... 建議的 GPU 基礎架構 建議的機器系列
原型設計與開發 一般 GPU A3 High (1、2 或 4 個 GPU)A3 EdgeA2G4G2N1+T4N1+V100
即時推論 (參數 < 1000 億) 一般 GPU A3 High (1、2 或 4 個 GPU)A3 EdgeA2G4G2N1+T4N1+V100
跨多個 GPU 進行推論 叢集 GPU A4A3 UltraA3 MegaA3 High (8 個 GPU)
大規模訓練與推論 叢集 GPU A4A3 UltraA3 MegaA3 High (8 個 GPU)
大規模訓練 (超過 5,000 億個參數) 和分離式推論 叢集 GPU A4X MaxA4XA4

如要查看將模型架構直接對應至硬體的詳細決策樹狀圖,請參閱「選擇加速器」。

確立這些主要條件後,請選擇自動化調度管理平台。 這項選擇取決於團隊偏好自動管理,還是要細部控管作業系統和驅動程式。

後續步驟