本文將摘要說明如何在 AI Hypercomputer 上,為 AI 工作負載建立叢集。具體來說,這份文件會引導您完成啟動叢集時的程序和選擇。除了手動評估,您也可以在 Google Cloud 控制台中提示 Gemini,比較工作負載和預算的用量選項。詳情請參閱「使用 Compute Advisor 設計 AI 基礎架構」。
這份文件假設您熟悉 AI 和機器學習工作負載的常用術語,例如模型訓練和推論。此外,本文也假設您已找出需要判斷最佳機型和部署容量的特定 AI 工作負載,例如基礎模型預先訓練、微調或推論。
啟動叢集
啟動叢集需要完成下列步驟:
判斷工作負載並選擇機型
為 AI 工作負載選取機型。AI Hypercomputer 支援建立叢集式 GPU 和一般 GPU 的叢集。
為協助您選擇,請先判斷工作負載需求,然後比對建議的機型和 GPU 類型:
- 叢集 GPU:最適合大規模、高效能的工作負載,例如預先訓練基礎模型、微調大型模型,以及跨多個主機進行推論。
- 一般 GPU:最適合主流推論和服務、檢索增強生成 (RAG),以及符合成本效益的中小型模型訓練和微調。
如要根據工作負載選擇建議的機型,請參閱下表:
| GPU 類型 | 工作負載或用途 | 建議的機型 |
|---|---|---|
| 叢集式 GPU | 預先訓練基礎模型,並在多部主機上進行推論 | A4X Max (NVIDIA GB300)*、A4X (NVIDIA GB200)* |
| 大型模型訓練、微調和推論 | A4 (NVIDIA B200)、A3 Ultra (NVIDIA H200 141GB) | |
| 主流模型推論和微調 | A3 Mega (NVIDIA H100 80GB)、A3 High (NVIDIA H100 80GB) | |
| 一般 GPU | 高處理量的邊緣服務和推論 | A3 Edge (NVIDIA H100 80GB) |
| 高效能單一節點服務和小型微調 | A2 (NVIDIA A100) | |
| 最具成本效益的入門級推論 | G4 (NVIDIA RTX PRO 6000)、N1 (NVIDIA T4 或 V100) | |
| 主流推論、檢索增強生成,以及中小型模型訓練 | G2 (NVIDIA L4) |
如要詳細瞭解各個機器系列,請參閱「關於 GPU 加速器」。
選擇用量方案並取得容量
請根據所選機型,以及您使用的是一般 GPU 或叢集 GPU,選擇 GPU 資源的計費方案。
一般 GPU 的用量選項
| 計費方案 | 適用的裝置 | 適用情境 | 如何提出要求 |
|---|---|---|---|
| 以量計價 | 所有一般 GPU。 | 不需要保證容量的工作負載。 | 建立運算執行個體或叢集,並指定標準佈建模型。如需相關操作說明,請參閱「建立 VM 執行個體」。 提示:如要提高取得一般 GPU 容量的機率,請使用彈性啟動或 Spot。 |
| 標準預訂和標準未來預留項目 | 所有一般 GPU。 | 需要立即確保容量的工作負載 (標準預留項目),或需要確保特定未來日期的容量 (標準未來預留項目)。 | 建立隨需預留項目或未來預留項目要求。如需操作說明,請參閱「預留容量」一節。 |
| 彈性啟動 | 所有 GPU 機型,但 A4X Max 和 A4X 除外。 | 需要短期密集叢集 (最長七天) 的工作負載。提供密集資源配置,支援的機型可享最高 53% 的折扣;否則適用標準以量計價費率。 | 使用 Compute Engine、Cluster Director、Cluster Toolkit 或 GKE 建立要求。資源一經啟用 (不會立即啟動),系統就會立即佈建。如需操作說明,請參閱「取得容量」一文。 |
| Spot | 所有 GPU 機型,但 A4X Max 和 A4X 除外。 | 容錯、批次或短期工作負載。提供最高折扣 (61% 至 90%),但運算資源隨時可能遭到搶占。 | 使用 Spot 佈建模式立即建立執行個體或節點集區。如需操作說明,請參閱「取得容量」一文。 |
叢集式 GPU 的使用選項
| 計費方案 | 適用的裝置 | 適用情境 | 如何提出要求 |
|---|---|---|---|
| 容量區塊的未來預留項目 | 所有叢集式 GPU 和 A3 Edge 機型。 | 需要長時間穩定性的工作負載,例如預先訓練基礎模型,或在多個主機上進行基礎模型推論。這種預留方法可提供密集資源分配和選用的 Hyperdisk 集區,如果您預留資源 365 天以上,還可享有 vCPU、記憶體、GPU、本機 SSD 磁碟和 Hyperdisk 集區的折扣。 | 透過 Google 帳戶團隊要求日後 90 天以上的資源。 |
| 日曆模式的未來預留項目 | 所有叢集式 GPU,但 A4X Max 和 A4X 除外。 | 時長最長 90 天且需要穩定性的工作負載,例如預先訓練或微調模型。提供密集資源配置,折扣最高可達 53%。 | 對未來日期和時間提出自助預留要求; Google Cloud 必須核准要求。如需操作說明,請參閱「預留容量」一節。 |
| 彈性啟動 | 所有 GPU 機型,A4X Max 和 A4X 除外。 | 需要短期密集叢集 (最長七天) 的工作負載。提供密集資源配置,支援的機型可享最高 53% 的折扣;否則適用標準以量計價費率。 | 使用 Compute Engine、Cluster Director、Cluster Toolkit 或 GKE 建立要求。資源一經啟用 (不會立即啟動),系統就會佈建資源。如需操作說明,請參閱「取得容量」。 |
| Spot | 所有 GPU 機型,但 A4X Max 和 A4X 除外。 | 容錯、批次或短期工作負載。提供最高折扣 (61% 至 90%),但運算資源隨時可能遭到搶占。 | 使用 Spot 佈建模式立即建立執行個體或節點集區。如需操作說明,請參閱「取得容量」一文。 |
選擇部署選項
視叢集部署作業的控管程度而定,請選擇下列其中一個選項:
- 高度管理的部署作業:管理服務會自動設定、調度及設定運算、網路和儲存空間資源。
- 減少管理,增加部署控制權:您可以手動建立及管理 VM、自訂環境和協調層。
高度管理
高度代管的部署選項可自動設定及調度運算、網路和儲存空間資源,減少叢集管理作業的負擔。如要部署及設定基礎架構,請使用 Cluster Director、Cluster Toolkit 或 GKE。
Cluster Director:這項Google Cloud 產品可自動完成叢集的複雜設定和配置,協助您為叢集設定運算、網路和儲存空間資源,盡可能提升效能並減少停機時間。Cluster Director 專為 IT 管理員和 AI 研究人員設計,可避免管理叢集的額外負擔,讓他們專注於執行工作負載。
Cluster Toolkit:Google 提供的開放原始碼工具,可簡化 GKE 或 Compute Engine 的叢集設定和部署作業。您可以使用預先定義的藍圖部署常見設定,例如搭配 Slurm 的 A4 機型。您可以修改藍圖,自訂部署作業和軟體堆疊。
GKE: 代管式 Kubernetes 服務和開放原始碼容器自動化調度管理平台。GKE 提供自動調度資源和高可用性等功能。此外,它還能自動化調度管理容器化應用程式、支援專用硬體,並與 Google Cloud生態系統相容,因此非常適合部署及管理 AI 或機器學習工作負載。您可以直接使用 GKE 或 Cluster Toolkit 部署 GKE 叢集。
減少管理,增加控制權
如要更精細地控管叢集和安裝在叢集上的軟體,請使用代管 Compute Engine 執行個體群組 (MIG) 建立 Compute Engine 叢集,或大量建立執行個體。然後在執行個體上,手動安裝所需的任何重要軟體。
選擇自動調度管理工具
調度管理工具會自動管理叢集。有了協調器,您就不必管理叢集中的每個運算執行個體。自動調度管理工具 (例如 Slurm 或 GKE) 會處理工作佇列、資源分配、自動調度資源 (適用於 GKE) 等工作,以及其他日常叢集管理工作。
Slurm:Slurm 是開放原始碼協調器,通常用於 HPC、AI 或 ML 工作負載。如要使用受管理的 Slurm 服務,可以選擇 Cluster Director。如要原生使用 Slurm,可以透過 Cluster Toolkit (提供叢集藍圖,可在叢集上自動安裝 Slurm),或在 Compute Engine 叢集上安裝 Slurm。
GKE:GKE 是以 Kubernetes 為基礎建構的代管服務,Kubernetes 則是開放原始碼容器自動化調度管理平台。GKE 能夠自動化調度管理容器化應用程式、支援專用硬體,並在 Google Cloud 生態系統中扮演重要角色,因此非常適合部署及管理 AI 或機器學習工作負載。您可以直接使用 GKE 或 Cluster Toolkit 部署 GKE 叢集。
使用自有的自動調度管理工具:如要使用其他自動調度管理工具,請使用 Compute Engine 叢集。建立 Compute Engine 叢集是 Google Cloud提供的最少管理選項。選擇這個選項表示您要負責設定、維護及更新執行個體。
選擇作業系統映像檔
您應使用的映像檔取決於所用的 GPU 基礎架構 (叢集 GPU 或一般 GPU),以及叢集的部署方式 (GKE、Slurm 或 Compute Engine)。如果是 GKE 叢集,請使用 Container-Optimized OS。如果是 Compute Engine 和 Slurm 叢集,請選取針對加速器 (例如 GPU) 最佳化的作業系統映像檔。此外,您也可以為工作負載選取深度學習軟體層 (DLSL) 容器映像檔。
如需詳細資訊,請參閱 AI Hypercomputer 圖片。
GKE 叢集適用的映像檔
如要建立 GKE 叢集,請使用 Standard 和 Autopilot 模式的預設容器 OS 映像檔。不過,在標準模式中,您也可以選擇使用其他可用映像檔,例如 Ubuntu。
如果您使用 Cluster Toolkit 部署叢集,則只能使用容器 OS 映像檔,因為這些映像檔內建於叢集藍圖。如要進一步瞭解各節點映像檔,請參閱 GKE 說明文件中的「節點映像檔」。
GKE 也提供深度學習軟體層 (DLSL) 容器映像檔,可安裝 NVIDIA CUDA 和 NCCL 等套件,以及 PyTorch 等機器學習架構,為深度學習工作負載提供隨即可用的環境。這些預先建構的 DLSL 容器映像檔經過測試和驗證,可在 GKE 叢集上順暢運作。
Compute Engine 叢集適用的 OS 映像檔
AI Hypercomputer 提供最佳化映像檔,可透過 Compute Engine 執行 AI 和 ML 工作負載。選擇你最熟悉的作業系統:
- Rocky Linux 9 加速器
- Rocky Linux 8 加速器
- Ubuntu 24.04 LTS 加速器
- Ubuntu 22.04 LTS 加速器
如果您使用 Cluster Toolkit,這些加速器映像檔已併入 Cluster Toolkit 藍圖,因為 Cluster Toolkit 會建立擴充 Ubuntu LTS Accelerator OS 映像檔的自訂映像檔。
如要進一步瞭解各個 OS 映像檔,請參閱 Compute Engine 說明文件的「作業系統詳細資料」一節。
建立叢集
查看叢集建立程序並為工作負載做出初步決定後,請使用下列其中一個選項建立叢集:
- 建立 GKE 叢集:
- 建立 Slurm 叢集:
- 建立 VM 執行個體 (單一、大量或 MIG)
為工作負載佈建儲存空間
根據效能、成本和儲存架構需求,選擇要佈建的儲存空間服務。