選擇一般 GPU 或叢集 GPU

本文提供建議,說明最適合不同人工智慧 (AI)、機器學習 (ML) 和高效能運算 (HPC) 工作負載的加速器、用量選項和部署工具。請參閱這份文件,找出最適合工作負載的部署方式。

如要瞭解 AI、機器學習和 HPC 工作負載的基礎架構支柱,以及相關建議,請參閱下列文件:

工作負載總覽

AI Hypercomputer 架構支援下列用途:

工作負載 說明 建議
預先訓練基礎模型 這包括使用大型資料集建構語言模型。預先訓練基礎模型後,會產生擅長執行一般工作的全新模型。
模型會依大小分類如下:
  • 前沿模型:參數數達數千億到數兆以上或更高的機器學習模型。包括 Gemini 等大型語言模型 (LLM)。
  • 大型模型參數數量達數百億至數千億個以上的機器學習模型。
請參閱 預先訓練模型的建議做法
微調 這項程序會使用專用資料集或其他技術,調整訓練好的模型,讓模型執行特定工作。微調通常是在大型模型上進行。 請參閱 微調模型建議
推論或服務 這包括採用經過訓練或微調的模型,並開放使用者或應用程式使用。
推論工作負載會依模型大小分類,如下所示:
  • 跨多個主機的基礎模型推論:使用訓練好的機器學習模型執行推論,這些模型包含數千億到數兆個以上的參數。對於這些推論工作負載,運算負載會分散到多部主機。
  • 單一主機基礎模型推論: 使用訓練好的機器學習模型執行推論,這些模型包含數十到數千億個參數。對於這些推論工作負載,運算負載僅限於單一主體機器。
  • 大型模型推論使用經過訓練或微調的 ML 模型執行推論,這些模型包含數十到數千億個參數。
查看 推論建議
適用於小型或中型模型的 ML 這包括訓練及提供較小且較不複雜的機器學習模型,通常用於更專業的工作。 請參閱 小型或中型模型的機器學習建議
HPC 這種做法是匯總運算資源,以獲得比單一工作站、伺服器或電腦更高的效能。HPC 可用來解決學術研究、科學、設計、模擬和商業智慧中的問題。 查看 HPC 建議

預先訓練模型的建議做法

如要預先訓練基礎模型,大型加速器叢集會持續讀取大量資料。這些加速器會透過正向和反向傳遞調整權重,從資料中學習。這些訓練工作一次執行數週,甚至數月。

以下各節將說明建議用於預先訓練基礎模型的加速器和用量選項。

建議的加速器

如要在 Google Cloud上預先訓練基礎模型,建議使用A4X Max (NVIDIA GB300)、A4X (NVIDIA GB200)、A4 (NVIDIA B200)、A3 Ultra (NVIDIA H200 141GB)、A3 Mega (NVIDIA H100 80GB) 或 A3 High (NVIDIA H100 80GB) 加速器最佳化機型,並使用協調器部署叢集。

如要部署這些加速器叢集,我們也建議使用 Cluster DirectorCluster Toolkit。詳情請參閱下表,瞭解所選機型的叢集部署指南。

工作負載 建議 叢集部署指南
機型 自動調度管理工具
預先訓練基礎模型
  • A4X Max (NVIDIA GB300)
  • A4X (NVIDIA GB200)
  • A4 (NVIDIA B200)
GKE 使用預設設定建立 AI 最佳化 GKE 叢集
Slurm
大型模型訓練 A3 Ultra (NVIDIA H200 141GB) GKE 使用預設設定建立 AI 最佳化 GKE 叢集
Slurm
大型模型訓練
  • A3 Mega (NVIDIA H100 80GB)
  • A3 High (NVIDIA H100 80GB)
GKE 在標準模式叢集中,盡量提高 GPU 網路頻寬
Slurm

建議的計費方案

如要確保取得大量加速器叢集,建議使用預留項目。具體來說,為盡量減少預留資源的費用,建議您要求足夠長的預留時間,以獲得已承諾用量折扣。如要進一步瞭解用量選項,請參閱「選擇用量選項」。

微調模型的建議做法

如要微調大型基礎模型,較小的加速器叢集會讀取適量的資料。這些加速器會調整模型,以執行特定工作。這些微調作業會執行數天,甚至數週。

以下各節將說明微調模型時,建議使用的加速器和計費模式。

如要在 Google Cloud上微調模型,建議使用A3 Ultra (NVIDIA H200 141GB)、A3 Mega (NVIDIA H100 80GB) 或 A3 High (NVIDIA H100 80GB) 加速器最佳化機型,並使用協調器部署叢集。

如要部署這些加速器叢集,我們也建議使用 Cluster DirectorCluster Toolkit。詳情請參閱下表,瞭解所選機型的叢集部署指南。

工作負載 建議 叢集部署指南
機型 自動調度管理工具
微調大型模型 A3 Ultra (NVIDIA H200 141GB) GKE 使用預設設定建立 AI 最佳化 GKE 叢集
Slurm
微調大型模型
  • A3 Mega (NVIDIA H100 80GB)
  • A3 High (NVIDIA H100 80GB)
GKE 在標準模式叢集中,盡量提高 GPU 網路頻寬
Slurm

建議的計費方案

如要微調工作負載,請使用日曆模式的未來預留項目來佈建資源。如要進一步瞭解用量選項,請參閱「選擇用量選項」。

建議推論工具

以下各節將說明執行推論時建議使用的加速器和計費選項。

建議的加速器

建議用於推論的加速器取決於您執行的是多主機前沿或大型模型推論,還是單一主機前沿推論。

建議使用的加速器 (多主機)

如要在 Google Cloud上執行多主機 Frontier 或大型模型推論,請使用 A4X Max (NVIDIA GB300)、A4X (NVIDIA GB200)、A4 (NVIDIA B200)、A3 Ultra (NVIDIA H200 141GB)、A3 Mega (NVIDIA H100 80GB) 或 A3 High (NVIDIA H100 80GB) 加速器最佳化機型,並使用協調器部署機器。如要部署這些加速器叢集,我們也建議使用 Cluster Director Cluster Toolkit。下表提供每個建議機型的叢集部署指南連結。

工作負載 建議 叢集部署指南
機型 自動調度管理工具
多主機 Frontier 推論
  • A4X Max (NVIDIA GB300)
  • A4X (NVIDIA GB200)
  • A4 (NVIDIA B200)
GKE 使用預設設定建立 AI 最佳化 GKE 叢集
Slurm
大型模型推論 A3 Ultra (NVIDIA H200 141GB) GKE 使用預設設定建立 AI 最佳化 GKE 叢集
Slurm
大型模型推論
  • A3 Mega (NVIDIA H100 80GB)
  • A3 High (NVIDIA H100 80GB)
GKE 在標準模式叢集中,盡量提高 GPU 網路頻寬
Slurm

建議使用的加速器 (單一主機)

下表列出建議用於執行單一主機前沿推論的加速器。下表提供各建議機型的 VM 部署指南連結。

工作負載 建議 VM 部署指南
機型 自動調度管理工具
單一主機前沿和主流推論
  • A4 (NVIDIA B200)
  • A3 Ultra (NVIDIA H200 141GB)
不適用 建立 A4 或 A3 Ultra 執行個體
  • A3 High (NVIDIA H100 80GB)
  • A3 Edge (NVIDIA H100 80GB)
建立 A3 High 或 A3 Edge 執行個體
G4 (NVIDIA RTX PRO 6000) 建立 G4 執行個體
A2 (NVIDIA A100) 建立 A2 執行個體
G2 (NVIDIA L4) 建立 G2 執行個體
N1 (NVIDIA T4 或 V100) 建立 N1 執行個體

建議的計費方案

如要進行推論,請使用長期預留項目或日曆模式的未來預留項目。如要進一步瞭解消耗量選項,請參閱「選擇消耗量選項」。

小型或中型模型的建議做法

對於涉及中小型模型的機器學習工作負載,在價格和效能之間取得最佳平衡是主要考量。

建議的加速器

下表列出建議用於中小型模型機器學習工作負載的加速器。

工作負載 建議 VM 部署指南
機型 自動調度管理工具
適用於中小型模型的機器學習 G4 (NVIDIA RTX PRO 6000) 不適用 建立 G4 執行個體
G2 (NVIDIA L4) 建立 G2 執行個體
A2 (NVIDIA A100) 建立 A2 執行個體
A3 Edge (NVIDIA H100 80GB) 建立 A3 Edge 執行個體
N1 (NVIDIA T4 或 V100) 建立 N1 執行個體

高效能運算 (HPC) 最佳化建議

對於 HPC 工作負載,任何加速器最佳化機器系列運算最佳化機器系列都適用。 如果使用加速器最佳化機器系列,最佳方案取決於必須卸載至 GPU 的運算量。如需 HPC 工作負載的詳細建議清單,請參閱「執行 HPC 工作負載的最佳做法」。

建議摘要

下表摘要列出各工作負載的建議加速器和消耗量選項。

資源 建議
模型預先訓練
機器家族 使用下列其中一種加速器最佳化機型:A4X Max (NVIDIA GB300)、A4X (NVIDIA GB200)、A4 (NVIDIA B200)、A3 Ultra (NVIDIA H200 141GB)、A3 Mega (NVIDIA H100 80GB) 或 A3 High (NVIDIA H100 80GB)
計費方案 「使用標準未來預留項目
模型微調
機器家族 使用A3 Ultra (NVIDIA H200 141GB)、A3 Mega (NVIDIA H100 80GB) 或 A3 High (NVIDIA H100 80GB) 加速器最佳化機型
計費方案 「使用標準未來預留項目
推論
機器家族 使用下列任一機型:A4X Max (NVIDIA GB300)、A4X (NVIDIA GB200)、A4 (NVIDIA B200)、A3 Ultra (NVIDIA H200 141GB)、A3 Mega (NVIDIA H100 80GB)、A3 High (NVIDIA H100 80GB)、G2 (NVIDIA L4)、G4 (NVIDIA RTX PRO 6000)、A2 (NVIDIA A100)、A3 Edge (NVIDIA H100 80GB) 或 N1 (NVIDIA T4 或 V100)
計費方案 使用預留項目、隨需或 Spot
適用於中小型模型的機器學習
機器家族 使用下列任一機型:G2 (NVIDIA L4)、G4 (NVIDIA RTX PRO 6000)、A2 (NVIDIA A100)、A3 Edge (NVIDIA H100 80GB) 或 N1 (NVIDIA T4 或 V100)
計費方案 使用隨需、Spot 或標準預留項目
儲存空間 使用 Cloud Storage FUSE
HPC
請參閱執行 HPC 工作負載最佳做法的摘要部分

後續步驟