AI Hypercomputer 提供垂直整合式基礎架構,可支援嚴苛的人工智慧 (AI) 和機器學習 (ML) 工作負載。高效能 NVIDIA GPU 的分類依據是系統處理生命週期事件和維護作業的方式:一般 GPU 和叢集 GPU。
如要找出最適合工作負載的基礎架構類別,請參閱「選擇加速器基礎架構」。
一般 GPU
一般 GPU 會做為獨立的運算單元進行管理,方法是使用標準的 Compute Engine 和 Google Kubernetes Engine (GKE) API,直接與 Google Cloud的控制層整合。
一般 GPU 包含下列機器系列:
- A3 High,搭載 1、2 或 4 個 (NVIDIA H100) GPU: 經過最佳化,適合不需要 8 個 GPU 同步叢集的標準訓練和推論工作負載。
- A3 Edge (NVIDIA H100): 經過最佳化,可使用標準 VPC 網路,在多部主機之間分配推論作業,並提供高輸送量。
- A2 (NVIDIA A100): 經過最佳化,適合高效能單一節點服務和小型微調。
- G4 (NVIDIA RTX PRO 6000): 經過最佳化,可經濟實惠地執行入門級推論和圖形工作負載。
- G2 (NVIDIA L4): 專為主流推論和 RAG 最佳化。
- N1 (NVIDIA T4 或 V100): 專為入門級推論和研究工作最佳化,著重成本效益,而非高效能互連。
叢集 GPU
叢集 GPU 會透過 Cluster Director 管理,成為數千個互連加速器的單一緊密耦合系統。
叢集式 GPU 包含下列機器系列:
- A4X Max (NVIDIA GB300): 專為裸機百億級訓練和高效能運算而設計, 搭載 NVIDIA GB300 Grace Blackwell Ultra Superchip。
- A4X (NVIDIA GB200) 和 A4 (NVIDIA B200): 專為基礎模型訓練和百京級基礎模型訓練而設計。
- A3 Ultra (NVIDIA H200)、A3 Mega (NVIDIA H100) 和 A3 High (8 個 NVIDIA H100 GPU): 經過最佳化,適合大規模分散式訓練和多主機推論, 涉及大量資料表。
GPU 效能注意事項
如要評估及提升工作負載的效能,您可以追蹤 CUDA 核心和 Tensor 核心使用率等硬體層級指標。如要監控資源並評估一般和叢集環境的成效,請參閱下列文章:
後續步驟
- 如要評估基礎架構需求,請參閱「選擇加速器基礎架構」。
- 如要查看啟動叢集時的程序和選擇,請參閱「規劃及建立 AI 基礎架構」。