部署作業的網路服務

您設定的網路服務取決於所選的部署選項 (VM 或叢集) 和基礎架構。

本文適用於想瞭解 AI Hypercomputer 部署作業網路服務的架構師、網路工程師和開發人員。本文假設您熟悉雲端網路和分散式運算概念。如要進一步瞭解部署選項,請參閱部署選項總覽

如要詳細瞭解網路架構、通訊協定和硬體拓撲,請參閱 GPU 網路總覽

使用預設設定,為 AI 最佳化 GKE 部署項目建立網路

使用預設設定建立 AI 最佳化 GKE 叢集時,Cluster Toolkit 藍圖會依下列方式設定網路:

  • 藍圖會使用預設的虛擬私有雲網路,做為主要的 GKE 叢集。
  • 這項作業會建立兩個額外的虛擬私有雲:一個用於第二個主機網路介面卡 (NIC),另一個用於 GPU 對 GPU 的遠端直接記憶體存取 (RDMA) 流量。
  • 藍圖會將預先設定的 Google 管理網路設定檔套用至用於 GPU 流量的 VPC。這個設定檔會自動設定網路,以提供高速、低延遲的 RDMA 效能。
  • 藍圖會自動在 RDMA 虛擬私有雲內建立八個專屬子網路,分別供加速器 VM 的 RDMA NIC 使用。
  • 這項功能會設定防火牆規則,允許叢集內節點之間的所有 TCP、UDP 和 ICMP 流量。

為採用自訂設定的 GKE 部署項目建立網路

自訂 GKE 設定的網路設定取決於工作負載類型和基礎架構:

  • 如要使用一般 GPU 或非分散式工作負載,請建立不含 GPUDirect RDMA 的 GKE 叢集。這項設定會為所有通訊使用單一虛擬私有雲網路。
  • 如要使用叢集 GPU 或分散式工作負載,請建立啟用 GPUDirect RDMA 的 GKE 叢集。這項設定會使用多重虛擬私有雲環境,將一般用途流量與高頻寬 GPU 對 GPU 通訊隔離。

為 Slurm 叢集部署項目建立網路

透過 Cluster Toolkit 部署 AI 和機器學習工作負載,並使用可自訂的藍圖,例如 A4 或 A3 Ultra 系列。

藍圖為叢集 GPU Slurm 部署作業設定的網路元件如下:

  • 藍圖會建立三個不同的虛擬私有雲:用於 Slurm 控制層的主要虛擬私有雲、用於一般主機層級流量的次要虛擬私有雲,以及用於 GPU 對 GPU 通訊的專屬高效能虛擬私有雲。
  • 對於 GPU 資料平面,藍圖會套用預先設定的 Google 管理網路設定檔,並針對 RoCE 進行最佳化。
  • 藍圖會設定 Filestore 服務所需的專屬 IP 位址範圍,為叢集提供共用的 /home 目錄。
  • 這個程序會建立臨時的獨立映像檔建構 VPC,僅在為叢集節點建構自訂 VM 映像檔時使用。

Compute Engine 執行個體的網路

您可以使用 Compute Engine 建立獨立 VM、大量運算執行個體,以及代管執行個體群組 (MIG)。具體的網路需求取決於機型的基礎架構模型:

  • 叢集 GPU:這些機器系列 (A4X Max、A4X、A4、A3 Ultra、A3 Mega 和 A3 High,配備 8 個 GPU) 需要多重虛擬私有雲網路設定,才能將一般主機對主機流量,從高頻寬 GPU 對 GPU 通訊中隔離出來。
  • 一般 GPU:這些機器系列 (G2、G4、A2 和 N1,搭配 T4 或 V100) 會透過 gVNIC 介面,使用單一 VPC 架構進行所有通訊。A3 Edge 是例外狀況,需要四個資料 VPC 和 GPUDirect-TCPX。

如要詳細瞭解機型的 NIC 和網路設定,請參閱「網路和 GPU 機器」。

後續步驟