本文將摘要說明如何在 AI Hypercomputer 上建立叢集,以執行 AI 工作負載。具體來說,這份文件會引導您完成啟動叢集時的程序,並說明可選擇的項目。除了手動評估,您也可以在 Google Cloud 控制台中提示 Gemini,比較工作負載和預算的用量選項。詳情請參閱「使用 Compute Advisor 設計 AI 基礎架構」。
本文假設您熟悉 AI 和 ML 工作負載的常用術語,例如模型訓練和推論。此外,本文也假設您已找出需要判斷最佳機型和部署容量的特定 AI 工作負載,例如基礎模型預先訓練、微調或推論。
啟動叢集
啟動叢集需要完成下列步驟:
判斷工作負載並選擇機型
為 AI 工作負載選取機型。AI Hypercomputer 支援建立叢集 GPU 和一般 GPU 的叢集。
為協助您選擇,請先判斷工作負載需求,然後比對建議的機型和 GPU 類型:
- 叢集 GPU:最適合大規模、高效能的工作負載,例如預先訓練基礎模型、微調大型模型,以及跨多個主機進行推論。
- 一般 GPU:最適合主流推論和服務、檢索增強生成 (RAG),以及符合成本效益的中小型模型訓練和微調。
如要為工作負載選擇建議的機型,請參考下表:
| GPU 類型 | 工作負載或用途 | 建議的機器類型 |
|---|---|---|
| 叢集 GPU | 預先訓練基礎模型,並在多個主機上進行推論 | A4X Max (NVIDIA GB300)*、A4X (NVIDIA GB200)* |
| 大型模型訓練、微調和推論 | A4 (NVIDIA B200)、A3 Ultra (NVIDIA H200 141GB) | |
| 主流模型推論和微調 | A3 Mega (NVIDIA H100 80GB)、A3 High (NVIDIA H100 80GB) | |
| 一般 GPU | 高處理量的邊緣服務和推論 | A3 Edge (NVIDIA H100 80GB) |
| 高效能單一節點服務和小型微調 | A2 (NVIDIA A100) | |
| 最具成本效益的入門級推論 | G4 (NVIDIA RTX PRO 6000)、N1 (NVIDIA T4 或 V100) | |
| 主流推論、RAG 和中小型模型訓練 | G2 (NVIDIA L4) |
如要瞭解各個機器系列的詳細資訊,請參閱「關於 GPU 加速器」。
選擇用量方案並取得容量
請根據所選機器類型,以及您使用一般 GPU 或叢集 GPU,選擇 GPU 資源的計費方案。
一般 GPU 的用量選項
| 計費方案 | 適用的裝置 | 適用情境 | 如何要求 |
|---|---|---|---|
| 以量計價 | 所有一般 GPU。 | 不需要保證容量的工作負載。 | 建立運算執行個體或叢集,並指定標準佈建模型。如需相關操作說明,請參閱「建立 VM 執行個體」。 提示:如要提高取得一般 GPU 容量的機會,請使用彈性啟動或 Spot。 |
| 標準預訂和標準未來預留項目 | 所有一般 GPU。 | 需要立即確保容量的工作負載 (標準預留項目),或需要確保特定未來日期的容量 (標準未來預留項目)。 | 建立隨需預留項目或未來預留項目要求。如需操作說明,請參閱「預留容量」。 |
| 彈性啟動 | 所有 GPU 機器類型,但 A4X Max 和 A4X 除外。 | 需要短期密集叢集 (最長七天) 的工作負載。提供密集資源配置,支援的機型最高可享 53% 折扣,否則適用標準以量計價費率。 | 使用 Compute Engine、Cluster Director、Cluster Toolkit 或 GKE 建立要求。資源一經啟用 (不會立即啟動),系統就會佈建資源。如需操作說明,請參閱「取得容量」一節。 |
| Spot | 所有 GPU 機型,但 A4X Max 和 A4X 除外。 | 容錯、批次或短期工作負載。提供最高折扣 (61% 至 90%),但運算資源隨時可能遭到搶占。 | 使用 Spot 佈建模式立即建立執行個體或節點集區。如需操作說明,請參閱「取得容量」一節。 |
叢集 GPU 的使用選項
| 計費方案 | 適用的裝置 | 適用情境 | 如何要求 |
|---|---|---|---|
| AI Hypercomputer 的未來預留項目 | 所有叢集式 GPU 和 A3 Edge 機型。 | 需要長時間穩定性的工作負載,例如預先訓練基礎模型,或在多個主機上進行基礎模型推論。提供密集資源分配,vCPU 和 GPU 最高可享 53% 折扣。 | 透過 Google 帳戶團隊,要求在未來的開始日期和時間提供容量。 |
| 日曆模式的未來預留項目 | 所有叢集 GPU,A4X Max 和 A4X 除外。 | 時長固定 (最長 90 天) 且需要穩定性的工作負載,例如預先訓練或微調模型。提供密集資源配置,折扣最高可達 53%。 | 自行提出未來時段的預留要求; Google Cloud 必須核准要求。如需操作說明,請參閱「預留容量」。 |
| 彈性啟動 | 所有 GPU 機器類型,但 A4X Max 和 A4X 除外。 | 需要短期密集叢集 (最長七天) 的工作負載。提供密集資源分配,支援的機型最高可享 53% 折扣;否則適用標準以量計價費率。 | 使用 Compute Engine、Cluster Director、Cluster Toolkit 或 GKE 建立要求。資源一經啟用 (並非立即啟動),系統就會開始佈建。如需操作說明,請參閱「取得容量」一文。 |
| Spot | 所有 GPU 機型,但 A4X Max 和 A4X 除外。 | 容錯、批次或短期工作負載。提供最高折扣 (61% 至 90%),但運算資源隨時可能遭到搶占。 | 使用 Spot 佈建模式立即建立執行個體或節點集區。如需操作說明,請參閱「取得容量」一節。 |
選擇部署選項
請根據叢集部署作業所需的控制層級,選擇下列其中一個選項:
- 高度管理的部署作業:管理服務會自動設定、調度及設定運算、網路和儲存空間資源。
- 減少管理,增加部署控制權:您可以手動建立及管理 VM、自訂環境和協調層。
高度管理
高度代管的部署選項可自動設定及調度運算、網路和儲存空間資源,減少叢集管理作業的負擔。如要部署及設定基礎架構,請使用 Cluster Director、Cluster Toolkit 或 GKE。
Cluster Director:這項Google Cloud 產品可自動執行叢集的複雜設定和配置作業,協助您為叢集設定運算、網路和儲存空間資源,盡可能提升效能並減少停機時間。Cluster Director 專為 IT 管理員和 AI 研究人員設計,可避免管理叢集的額外負擔,讓他們專注於執行工作負載。
Cluster Toolkit:Google 提供的開放原始碼工具,可簡化 GKE 或 Compute Engine 的叢集設定和部署作業。您可以使用預先定義的藍圖部署常見設定,例如搭配 Slurm 的 A4 機型。您可以修改藍圖,自訂部署作業和軟體堆疊。
GKE: 代管式 Kubernetes 服務和開放原始碼容器自動化調度管理平台。GKE 提供自動調度資源和高可用性等功能。此外,它還能自動化調度管理容器化應用程式、支援專用硬體,並與 Google Cloud生態系統相容,因此非常適合部署及管理 AI 或機器學習工作負載。您可以直接使用 GKE 或 Cluster Toolkit 部署 GKE 叢集。
減少管理,增加控制權
如要更精細地控管叢集和安裝在叢集上的軟體,請使用代管 Compute Engine 執行個體群組 (MIG) 建立 Compute Engine 叢集,或大量建立執行個體。然後在執行個體上,手動安裝所需的任何金鑰軟體。
選擇自動調度管理工具
自動調度管理工具可自動管理叢集。有了協調器,您就不必管理叢集中的每個運算執行個體。自動調度管理工具 (例如 Slurm 或 GKE) 會處理工作佇列、資源分配、自動調度資源 (適用於 GKE) 等工作,以及其他日常叢集管理工作。
Slurm:Slurm 是開放原始碼協調器,通常用於 HPC、AI 或 ML 工作負載。如要使用代管 Slurm 服務,可以改用 Cluster Director。如要原生使用 Slurm,可以採用 Cluster Toolkit (提供叢集藍圖,可在叢集上自動安裝 Slurm),或在 Compute Engine 叢集上手動安裝 Slurm。
GKE:GKE 是以 Kubernetes 為基礎建構的代管服務,Kubernetes 是一種開放原始碼容器自動化調度管理平台。GKE 能夠自動化調度管理容器化應用程式、支援專用硬體,並在 Google Cloud 生態系統中扮演重要角色,因此非常適合部署及管理 AI 或機器學習工作負載。您可以直接使用 GKE 或 Cluster Toolkit 部署 GKE 叢集。
使用自有的自動調度管理工具:如要使用其他自動調度管理工具,請使用 Compute Engine 叢集。建立 Compute Engine 叢集是 Google Cloud提供的最少管理選項。選擇這項服務表示您要負責設定、維護及更新執行個體。
選擇作業系統映像檔
您應使用的映像檔取決於所用的 GPU 基礎架構 (叢集 GPU 或一般 GPU),以及叢集的部署方式 (GKE、Slurm 或 Compute Engine)。如果是 GKE 叢集,請使用 Container-Optimized OS。如果是 Compute Engine 和 Slurm 叢集,請選取已針對加速器 (例如 GPU) 最佳化的作業系統映像檔。此外,您也可以為工作負載選取深度學習軟體層 (DLSL) 容器映像檔。
如需詳細資訊,請參閱 AI Hypercomputer 圖片。
GKE 叢集適用的映像檔
如要建立 GKE 叢集,請使用 Standard 和 Autopilot 模式的預設容器 OS 映像檔。不過,在標準模式中,您也可以選擇使用其他可用的映像檔,例如 Ubuntu。
如果使用 Cluster Toolkit 部署叢集,則只能使用容器 OS 映像檔,因為這些映像檔內建於叢集藍圖。如要進一步瞭解各個節點映像檔,請參閱 GKE 說明文件中的「節點映像檔」。
GKE 也提供深度學習軟體層 (DLSL) 容器映像檔,可安裝 NVIDIA CUDA 和 NCCL 等套件,以及 PyTorch 等機器學習框架,為深度學習工作負載提供即時可用的環境。這些預先建構的 DLSL 容器映像檔經過測試和驗證,可在 GKE 叢集上順暢運作。
Compute Engine 叢集適用的 OS 映像檔
AI Hypercomputer 提供最佳化映像檔,可透過 Compute Engine 執行 AI 和 ML 工作負載。選擇你最熟悉的作業系統:
- Rocky Linux 9 加速器
- Rocky Linux 8 加速器
- Ubuntu 24.04 LTS 加速器
- Ubuntu 22.04 LTS 加速器
如果您使用 Cluster Toolkit,這些加速器映像檔已與 Cluster Toolkit 藍圖一併封裝,因為 Cluster Toolkit 會建立擴充 Ubuntu LTS Accelerator OS 映像檔的自訂映像檔。
如要進一步瞭解各個 OS 映像檔,請參閱 Compute Engine 說明文件中的「作業系統詳細資料」。
建立叢集
查看叢集建立程序並為工作負載做出初步決策後,請使用下列其中一個選項建立叢集:
- 建立 GKE 叢集:
- 建立 Slurm 叢集:
- 建立 VM 執行個體 (單一、大量或 MIG)
為工作負載佈建儲存空間
根據效能、成本和儲存空間架構需求,選擇要佈建的儲存空間服務。