瞭解 GPU

圖形處理器 (GPU) 是專門的硬體加速器,可同時處理大量平行工作負載。在 Google Cloud,您可以將 NVIDIA GPU 附加至 Compute Engine 執行個體和裸機執行個體,加速處理要求嚴苛的工作負載,例如人工智慧 (AI) 和機器學習 (ML) 訓練、高效能運算 (HPC)、圖形算繪和影片轉碼。

本文將概略介紹 Google Cloud中的 GPU,包括可用的 GPU 型號、機器系列對應、效能特徵、理想用途和價格考量。

什麼是 GPU?

GPU 是大規模平行處理器,原本是為電腦繪圖而設計,後來演變成 AI、機器學習和科學運算的重要運算引擎。中央處理器 (CPU) 包含幾個強大的核心,專為循序單一執行緒處理作業進行最佳化,而 GPU 則由數千個小型高效核心組成,可對大型資料集同時執行數學運算。

GPU 系統的主要架構元件如下:

  • CUDA 核心:一般用途向量處理單元,可使用單指令多執行緒 (SIMT) 架構,同時在多個平行執行緒中執行指令。CUDA 核心可處理標準向量和浮點運算 (例如 FP32 和 FP64),以及一般圖形算繪和物理模擬。

  • 張量核心:專門的矩陣乘法累加 (MMA) 處理單元,可加快類神經網路運算速度。Tensor Core 可為 AI 訓練和推論提供指數級的加速效果,支援多種專用數值精確度格式,包括 FP4、FP8、INT8、TF32 和 FP16/BF16。

  • 高頻寬記憶體:裝置端專用的記憶體,可提供高達數 TB/秒的頻寬,例如高頻寬記憶體 (HBM) 或繪圖雙倍資料率 (GDDR)。在密集的矩陣運算期間,這項高處理量可為數千個 GPU 核心提供資料。

  • 高速互連網路 (NVLink 和 NVSwitch):高頻寬、低延遲的互連網路技術,可連線至同一部伺服器或節點上的多個 GPU。NVLink 可直接在 GPU 之間通訊,繞過速度較慢的 PCIe 匯流排,讓 GPU 叢集做為單一連貫的加速器記憶體集區運作。

  • 虛擬工作站軟體 (NVIDIA RTX vWS):企業軟體,可為遠端視覺工作站、電腦輔助設計 (CAD)、數位內容創作和 3D 建模提供虛擬化圖形加速功能。

GPU 型號和機器系列

Google Cloud 提供多代 NVIDIA GPU,滿足不同工作負載和預算需求。在 Compute Engine 中,GPU 可做為預先設定的加速器最佳化機器系列 (A 和 G 系列),或做為一般用途 N1 機器系列的可附加加速器。

下表彙整了 Compute Engine 上可用 GPU 型號的硬體規格、機器系列對應、網路頻寬和儲存空間功能:

GPU 模型 機器系列 架構 GPU 記憶體和頻寬 每個運算執行個體的 GPU 數量 網路頻寬上限 本機 SSD 互連網路 支援 NVIDIA RTX 虛擬工作站 (vWS)
NVIDIA GB300 A4X Max Blackwell Ultra 279 GB HBM3e (8 TBps) 4 (NVL72) 3,600 Gbps 12,000 GiB NVLink 全網格 (1,800 GBps) 否
NVIDIA GB200 A4X Blackwell 186 GB HBM3e (8 TBps) 4 (NVL72) 2,000 Gbps 12,000 GiB NVLink 全網格 (1,800 GBps) 否
NVIDIA B200 A4 Blackwell 180 GB HBM3e (8 TBps) 8 3,600 Gbps 12,000 GiB NVLink 全網格 (1,800 GBps) 否
NVIDIA H200 A3 Ultra 漏斗 141 GB HBM3e (4.8 TBps) 8 3,600 Gbps 12,000 GiB NVLink 全網格 (900 GBps) 否
NVIDIA H100 A3 Mega、High、Edge 漏斗 80 GB HBM3 (3.35 TBps) 1、2、4、8 最多 1,000 Gbps 最多 6,000 GiB NVLink 全網格 (900 GBps) 否
NVIDIA A100 (80GB) A2 Ultra 安培 80 GB HBM2e (1.9 TBps) 1、2、4、8 100 Gbps 最多 3,000 GiB NVLink 全網格 (600 GBps) 否
NVIDIA A100 (40GB) A2 Standard 安培 40 GB HBM2 (1.6 TBps) 1、2、4、8、16 100 Gbps 最多 3,000 GiB NVLink 全網格 (600 GBps) 否
NVIDIA RTX PRO 6000 G4 Blackwell 96 GB GDDR7 (1.597 TBps) 1/8、1/4、1/2、1、2、4、8 200 Gbps 最多 3,000 GiB PCIe Gen 5 是
NVIDIA L4 G2 Ada Lovelace 24 GB GDDR6 (300 GBps) 1、2、4、8 100 Gbps 最多 3,000 GiB PCIe Gen 4 是
NVIDIA T4
(即將終止支援)
N1+T4 Turing 16 GB GDDR6 (320 GBps) 1、2、4 100 Gbps 支援 PCIe Gen 3 是
NVIDIA V100 N1+V100 Volta 16 GB HBM2 (900 GBps) 1、2、4、8 100 Gbps 支援 NVLink 環狀拓撲 (300 GBps) 否
NVIDIA P100
(即將終止支援)
N1+P100 Pascal 16 GB HBM2 (732 GBps) 1、2、4 100 Gbps 支援 PCIe Gen 3 是
NVIDIA P4
(即將終止支援)
N1+P4 Pascal 8 GB GDDR5 (192 GBps) 1、2、4 100 Gbps 支援 PCIe Gen 3 是

GPU 效能特徵

選擇合適的 GPU 模型取決於工作負載的運算特性、記憶體需求、精確度格式和擴充性需求。

理想用途和工作負載需求

GPU 可加速處理 AI、視覺運算和科學模型等各種運算工作負載。如要瞭解各工作負載類別的架構需求,請選取下列任一分頁標籤:

AI/機器學習訓練

AI/機器學習推論

  • 大型模型推論 (超過 700 億個參數):服務 大量 大型語言模型 (LLM) 可受益於高 高頻寬記憶體 (HBM3e) 容量 (每個 GPU 141 到 186 GB),在較少的 GPU 中容納模型權重,減少晶片間的通訊負擔。建議的機型系列:

  • 高處理量和即時服務:低延遲互動式查詢、串流回應和圖像生成功能會使用硬體加速量化數值格式,例如 8 位元浮點 (FP8)、8 位元整數 (INT8) 和 4 位元整數 (INT4),盡可能提高每美元的請求處理量。建議的機器系列:

    詳情請參閱 AI Hypercomputer 說明文件中的「Recommendations for serving inference」。

圖形和視覺運算

HPC 和模擬

  • 科學模擬和建模:應用程式 (例如分子動力學 (如 GROMACS 和 AMBER)、計算流體力學 (CFD)、量子化學、天體物理學和天氣預報,都需要高 64 位元雙精度 (FP64) 浮點效能和高記憶體頻寬。建議的機器系列:

    • A4X (NVIDIA GB200)
    • A4 (NVIDIA B200)
    • A3 (NVIDIA H100)
    • A2 (NVIDIA A100)

    詳情請參閱 AI Hypercomputer 說明文件中的「HPC 建議」。

工作負載考量事項

GPU 通常不適合下列工作負載:

  • 循序和單一執行緒邏輯:如果工作以循序決策分支或序列執行管道為主,則在單一核心時脈頻率較高的 CPU 上執行,效能會更好。
  • 標準網頁應用程式和微服務:一般用途的網頁伺服器、關聯式資料庫管理系統 (RDBMS) 和標準 API 後端,若沒有 AI 或圖形處理需求,就不會受益於 GPU 加速。這類工作負載更適合以一般用途或運算最佳化 CPU 執行個體代管,可節省更多成本。
  • 針對 XLA 和圖形編譯架構最佳化的工作負載:如果您的深層學習模型是使用 JAX、PyTorch/XLA 或 TensorFlow 等架構建構而成,就能運用編譯器驅動的圖形最佳化 (XLA)。如果您的模型也受益於自訂矩陣收縮陣列和光學電路交換,請考慮評估專為這些特定執行模式設計的替代加速器架構。

費用考量事項

Google Cloud的 GPU 價格取決於下列因素:

  • 特定 GPU 型號。

  • 已連結的 GPU 數量。

  • 佈建的資源,例如 vCPU、系統記憶體和儲存空間。

  • 您選取的計費模式。

以下各節概述 Google Cloud中 GPU 的可用計費模式和折扣選項。

使用和購買模式

您可以根據可用性需求和成本容許度,使用多種消耗量選項佈建 GPU 執行個體:

  • 隨選:標準即付即用 (PAYG) 定價,以秒為單位計費,無需長期承諾。隨選執行個體提供完整的生命週期彈性,適用於開發、測試和可變動的正式環境工作負載。

  • Spot VM:大幅折扣的運算執行個體 (最高可享隨選價格 60% 至 91% 的折扣),取用自剩餘Google Cloud 容量。由於 Google Cloud 可以停止或刪除 Spot VM,並在 30 秒內回收運算資源,因此這類運算執行個體非常適合容錯批次機器學習訓練、具檢查點的批次工作,以及分散式資料處理。

  • 彈性啟動型 VM:由 Dynamic Workload Scheduler (DWS) 提供的動態排程選項,可在指定期間內以折扣費率,為固定時長的工作負載 (最多 7 天) 佈建 GPU 資源。

  • 預訂:

    • 預留項目:您可以預留標準 GPU 運算資源,並立即使用預留的運算資源。
    • 未來預留項目 (日曆模式 和 AI Hypercomputer): 您可以要求預留未來時段的叢集式 GPU 容量。如果 Google Cloud 核准您的要求,您就能在指定時間開始使用容量,並保留專屬存取權,直到預留項目結束為止。

折扣選項

  • 承諾使用折扣 (CUD):只要承諾在特定區域維持一定程度的資源用量,即可享有大幅折扣 (3 年期承諾使用合約最高可享 55% 折扣,1 年期承諾使用合約最高可享 37% 折扣)。如為加速器最佳化機型和連接的 GPU,CUD 必須購買與預留項目連結的資源承諾使用合約。

  • 續用折扣 (SUD):如果 N1 運算執行個體和附加的 GPU 在帳單月份中,有超過 25% 的時間都在執行,系統就會自動套用折扣。加速器最佳化機器系列 (A 和 G 系列) 不會收到 SUD。

如要查看所有區域的詳細小時和每月價格,請參閱 GPU 定價頁面和 VM 執行個體定價頁面。

如需所有加速器機型的詳細功能矩陣,請參閱「依機型列出的用量選項適用情形」。

後續步驟