關於 GPU 加速器

AI Hypercomputer 提供垂直整合式基礎架構,可支援嚴苛的人工智慧 (AI) 和機器學習 (ML) 工作負載。高效能 NVIDIA GPU 的分類依據是系統處理生命週期事件和維護作業的方式:一般 GPU 和叢集 GPU。

如要找出最適合工作負載的基礎架構類別,請參閱「選擇加速器基礎架構」。

一般 GPU

一般 GPU 會做為獨立的運算單元進行管理,方法是使用標準的 Compute Engine 和 Google Kubernetes Engine (GKE) API,直接與 Google Cloud的控制層整合。

一般 GPU 包含下列機器系列:

叢集 GPU

叢集 GPU 會透過 Cluster Director 管理,成為數千個互連加速器的單一緊密耦合系統。

叢集式 GPU 包含下列機器系列:

GPU 效能注意事項

如要評估及提升工作負載的效能,您可以追蹤 CUDA 核心和 Tensor 核心使用率等硬體層級指標。如要監控資源並評估一般和叢集環境的成效,請參閱下列文章:

  • 監控資訊主頁:追蹤個別獨立執行個體或協調式叢集機群的即時 GPU 使用率和記憶體用量。
  • 有效處理量指標配方: 測量加速器執行有效運算的時間百分比與系統負荷,非常適合在叢集硬體上進行大規模分散式訓練。

後續步驟