選擇加速器基礎架構

根據生命週期階段 (例如小規模原型設計、即時推論和大規模分散式訓練),使用這份文件為人工智慧 (AI) 和機器學習 (ML) 工作負載找出最佳加速器基礎架構。AI Hypercomputer 將加速器產品分為兩類:一般 GPU叢集 GPU

GPU 基礎架構

AI Hypercomputer 提供兩種不同的 GPU 類別。每個類別都有不同的管理模型,決定系統如何處理生命週期事件、管理維護作業,以及為工作負載最佳化網路:

一般 GPU 管理模型

一般 GPU 管理模型適用於優先考量資源獨立性和高可用性的工作負載。這個模型使用標準 Google Cloud 管理平面,因此對於已使用 Compute Engine 或 GKE 的團隊來說,操作體驗十分熟悉。

  • 維護:非同步。個別執行個體會獨立更新。在多節點服務機群中,一個節點的維護事件不會影響其他節點的可用性,因此流量可以重新導向至正常節點,不會導致整個作業停滯。

  • 主要用途:建議用於主流工作,例如即時推論、模型服務、小規模原型設計,以及不需要超級電腦規模的開發環境。

一般 GPU 機器系列

下列機器系列為一般 GPU:

  • G2 (L4)
  • G4 (RTX PRO 6000)
  • A2 (A100)
  • N1+T4
  • A3 Edge
  • A3 High (1 個、2 個或 4 個 GPU)

如要瞭解各個一般 GPU 機器的技術資訊,請參閱「GPU 機器類型」。

叢集 GPU 管理模型

叢集式 GPU 管理模型是專為大規模分散式訓練設計的超級電腦級環境。使用叢集式 GPU 堆疊,即可將資源管理為單一緊密耦合的系統。

  • 維護:協調。這個模型會協調維護事件,以支援緊密耦合的工作負載。如要進行分散式訓練,可以使用同步維護作業,同時在所有節點套用更新。這種做法可避免節點重新啟動時工作停滯,並盡可能提高有效輸送量。這款機型也會在維修保養到期前 90 天發出通知。

  • 主要用途:專為訓練具有數兆個參數的 Exascale 基礎模型,或執行複雜的高效能運算 (HPC) 模擬而設計,例如藥物研發和蛋白質摺疊。

叢集 GPU 機器系列

下列機器系列為叢集 GPU:

  • A4X
  • A4 (Blackwell)
  • A3 Ultra
  • A3 Mega
  • A3 High (8 個 GPU)

如要瞭解各個叢集 GPU 機器的技術資訊,請參閱「GPU 機器類型」。

能力矩陣

比較一般 GPU 和叢集 GPU 管理模型的技術和運作特徵:

特性 一般 GPU 管理模型 叢集 GPU 管理模型
主要應用實例 推論、提供模型、原型設計和開發 大規模分散式訓練和 HPC
維護 非同步:獨立節點更新可重新導向流量,不會導致工作停滯 協調式:支援叢集範圍的協調 (同步) 更新,確保節點保持同步,並盡量提高有效輸送量
目標硬體 G2 (L4)G4 (RTX PRO 6000)A2 (A100)N1+T4A3 EdgeA3 High (1、2 或 4 個 GPU) A4XA4 (Blackwell)A3 UltraA3 MegaA3 High (8 個 GPU)
網路 透過 gVNIC 介面的標準 VPC 網路 (A3 Edge 除外,該介面會透過多個 VPC 使用 GPUDirect-TCPX) 專用的低延遲結構 (RDMA、RoCE、TCPX 或 NVIDIA NVLink)
管理堆疊 標準 Google Cloud 層級 (Compute Engine 或 GKE) 專門的管理堆疊 (例如 Cluster Director)
可靠性 標準節點自動修復和 Pod 層級正常運作時間 專用資源和復原套件

決策矩陣

請使用這份矩陣,找出符合特定工作負載意圖的硬體系列:

如果工作負載涉及... 建議的 GPU 基礎架構 建議的機器系列
原型設計與開發 一般 GPU G2G4A2N1+T4A3 Edge
即時推論 (參數 < 1000 億) 一般 GPU G2G4A2N1+T4A3 Edge
跨多個 GPU 進行推論 叢集 GPU A3A4
大規模訓練與推論 叢集 GPU A4A3 系列
大規模訓練 (超過 5,000 億個參數) 和分離式推論 叢集 GPU A4X MaxA4XA4

如要查看將模型架構直接對應至硬體的詳細決策樹狀圖,請參閱「選擇加速器」。

確立這些主要條件後,請選擇自動化調度管理平台。 這項選擇取決於團隊偏好自動管理,還是要精細控管作業系統和驅動程式。

後續步驟