GPU を理解する

グラフィック プロセッシング ユニット(GPU)は、超並列ワークロードを同時に処理するように設計された特殊なハードウェア アクセラレータです。Google Cloudでは、NVIDIA GPU を Compute Engine インスタンスとベアメタル インスタンスにアタッチして、人工知能(AI)や機械学習(ML)トレーニング、ハイ パフォーマンス コンピューティング(HPC)、グラフィック レンダリング、動画のコード変換などの要求の厳しいワークロードを高速化できます。

このドキュメントでは、使用可能な GPU モデル、マシンシリーズのマッピング、パフォーマンス特性、理想的なユースケース、料金に関する考慮事項など、 Google Cloudの GPU の概要について説明します。

GPU とは

GPU は、元々コンピュータ グラフィック用に設計された大規模な並列プロセッサですが、AI、ML、科学技術計算に不可欠なコンピューティング エンジンに進化しました。中央処理装置(CPU)には、シーケンシャルなシングル スレッド処理用に最適化された強力なコアがいくつか含まれていますが、GPU は大規模なデータセットで数学的計算を同時に実行するように設計された、効率性の高い小さなコアが数千個含まれています。

GPU システムの主なアーキテクチャ コンポーネントは次のとおりです。

  • CUDA コア: 単一命令複数スレッド(SIMT)アーキテクチャを使用して、複数の並列スレッドで同時に命令を実行する汎用ベクトル処理ユニット。CUDA コアは、標準のベクトル計算と浮動小数点計算(FP32 や FP64 など)だけでなく、一般的なグラフィック レンダリングや物理シミュレーションも処理します。

  • Tensor コア: ニューラル ネットワーク計算を高速化するように設計された特殊な行列乗算累算(MMA)処理ユニット。Tensor コアは、FP4、FP8、INT8、TF32、FP16/BF16 などの特殊な数値精度形式で、AI トレーニングと推論の速度を飛躍的に向上させます。

  • 高帯域幅メモリ: 高帯域幅メモリ(HBM)やグラフィック ダブル データレート(GDDR)など、最大数テラバイト/秒(TBps)の帯域幅を実現する専用のオンデバイス メモリ。この高スループットにより、集中的な行列演算中に数千の GPU コアにデータが供給されます。

  • 高速相互接続(NVLink と NVSwitch): 同じサーバーまたはノード間で複数の GPU を接続する高帯域幅、低レイテンシの相互接続テクノロジー。NVLink は、低速の PCIe バスをバイパスする GPU 間の直接通信を提供し、GPU クラスタを単一のコヒーレントなアクセラレータ メモリプールとして機能させます。

  • 仮想ワークステーション ソフトウェア(NVIDIA RTX vWS): リモート ビジュアル ワークステーション、コンピュータ支援設計(CAD)、デジタル コンテンツ作成、3D モデリングに仮想化されたグラフィック アクセラレーションを提供するエンタープライズ ソフトウェア。

GPU モデルとマシンシリーズ

Google Cloud は、さまざまなワークロードと予算のニーズを満たすために、複数の世代の NVIDIA GPU を提供しています。Compute Engine では、GPU は事前構成されたアクセラレータ最適化マシンシリーズ(A シリーズと G シリーズ)として、または汎用 N1 マシンシリーズにアタッチ可能なアクセラレータとして使用できます。

次の表に、Compute Engine で使用可能な GPU モデルのハードウェア仕様、マシンシリーズのマッピング、ネットワーキング帯域幅、ストレージ機能をまとめます。

GPU モデル マシンシリーズ アーキテクチャ GPU メモリと帯域幅 コンピューティング インスタンスあたりの GPU 数 最大ネットワーク帯域幅 ローカル SSD 相互接続 NVIDIA RTX 仮想ワークステーション(vWS)のサポート
NVIDIA GB300 A4X Max Blackwell Ultra 279 GB HBM3e(8 TBps) 4(NVL72) 3,600 Gbps 12,000 GiB NVLink Full Mesh(1,800 GBps) いいえ
NVIDIA GB200 A4X Blackwell 186 GB HBM3e(8 TBps) 4(NVL72) 2,000 Gbps 12,000 GiB NVLink Full Mesh(1,800 GBps) いいえ
NVIDIA B200 A4 Blackwell 180 GB HBM3e(8 TBps) 8 3,600 Gbps 12,000 GiB NVLink Full Mesh(1,800 GBps) いいえ
NVIDIA H200 A3 Ultra ホッパー 141 GB HBM3e(4.8 TBps) 8 3,600 Gbps 12,000 GiB NVLink Full Mesh(900 GBps) いいえ
NVIDIA H100 A3 Mega、High、Edge ホッパー 80 GB HBM3(3.35 TBps) 1、2、4、8 最大 1,000 Gbps 最大 6,000 GiB NVLink Full Mesh(900 GBps) いいえ
NVIDIA A100(80 GB) A2 Ultra Ampere 80 GB HBM2e(1.9 TBps) 1、2、4、8 100 Gbps 最大 3,000 GiB NVLink Full Mesh(600 GBps) いいえ
NVIDIA A100(40 GB) A2 標準 Ampere 40 GB HBM2(1.6 TBps) 1、2、4、8、16 100 Gbps 最大 3,000 GiB NVLink Full Mesh(600 GBps) いいえ
NVIDIA RTX PRO 6000 G4 Blackwell 96 GB GDDR7(1.597 TBps) 1/8、1/4、1/2、1、2、4、8 200 Gbps 最大 3,000 GiB PCIe Gen 5 ○
NVIDIA L4 G2 エイダ ラブレス 24 GB GDDR6(300 GBps) 1、2、4、8 100 Gbps 最大 3,000 GiB PCIe Gen 4 ○
NVIDIA T4
(サポート終了が近づいています)
N1+T4 Turing 16 GB GDDR6(320 GBps) 1、2、4 100 Gbps サポート対象 PCIe Gen 3 ○
NVIDIA V100 N1+V100 Volta 16 GB HBM2(900 GBps) 1、2、4、8 100 Gbps サポート対象 NVLink Ring(300 Gbps) いいえ
NVIDIA P100
(サポート終了が近づいています)
N1+P100 Pascal 16 GB HBM2(732 GBps) 1、2、4 100 Gbps サポート対象 PCIe Gen 3 ○
NVIDIA P4
(サポート終了が近づいています)
N1+P4 Pascal 8 GB GDDR5(192 GBps) 1、2、4 100 Gbps サポート対象 PCIe Gen 3 ○

GPU のパフォーマンス特性

適切な GPU モデルを選択するには、ワークロードのコンピューティング特性、メモリ要件、精度形式、スケーラビリティのニーズを考慮する必要があります。

理想的なユースケースとワークロード要件

GPU は、AI、ビジュアル コンピューティング、科学モデリングなど、さまざまなコンピューティング ワークロードを高速化します。各ワークロード カテゴリのアーキテクチャ要件を確認するには、次のいずれかのタブを選択します。

AI / ML トレーニング

AI / ML 推論

  • 大規模モデル推論(700 億を超えるパラメータ): 大規模な大規模言語モデル(LLM)のサービングでは、モデルの重みをより少ない GPU に収容してチップ間通信のオーバーヘッドを削減するために、大容量の高帯域幅メモリ(HBM3e)(GPU あたり 141 ~ 186 GB)が役立ちます。推奨マシンシリーズ:

    • A4X(NVIDIA GB200)
    • A4(NVIDIA B200)
    • A3 Ultra(NVIDIA H200)
  • 高スループットとリアルタイム サービング: 低レイテンシのインタラクティブ クエリ、ストリーミング レスポンス、画像生成では、8 ビット浮動小数点(FP8)、8 ビット整数(INT8)、4 ビット整数(INT4)などのハードウェア アクセラレーションによる量子化された数値形式を使用して、1 ドルあたりのリクエスト スループットを最大化します。推奨されるマシンシリーズ:

    詳細については、AI Hypercomputer のドキュメントで推論のサービングに関する推奨事項をご覧ください。

グラフィックとビジュアル コンピューティング

HPC とシミュレーション

  • 科学シミュレーションとモデリング: 分子動力学(GROMACS や AMBER など)、計算流体力学(CFD)、量子化学、天体物理学、気象予報のアプリケーションでは、高い 64 ビット倍精度(FP64)浮動小数点パフォーマンスと高いメモリ帯域幅が必要です。推奨されるマシンシリーズ:

    • A4X(NVIDIA GB200)
    • A4(NVIDIA B200)
    • A3(NVIDIA H100)
    • A2(NVIDIA A100)

    詳細については、AI Hypercomputer のドキュメントで HPC の推奨事項をご覧ください。

ワークロードの考慮事項

通常、GPU は次のワークロードには適していません。

  • シーケンシャルでシングル スレッドのロジック: シーケンシャルな決定分岐やシリアル実行パイプラインが支配するタスクは、シングルコアのクロック周波数が高い CPU でより優れたパフォーマンスを発揮します。
  • 標準のウェブ アプリケーションとマイクロサービス: 汎用ウェブサーバー、リレーショナル データベース管理システム(RDBMS)、AI やグラフィック処理の要件のない標準 API バックエンドは、GPU アクセラレーションのメリットを享受できません。これらのワークロードは、汎用またはコンピューティング最適化 CPU インスタンスでより費用対効果の高いホスティングが可能です。
  • XLA とグラフ コンパイル フレームワーク用に最適化されたワークロード: ディープ ラーニング モデルが JAX、PyTorch/XLA、TensorFlow などのフレームワークを使用して構築されている場合、コンパイラ駆動のグラフ最適化(XLA)を利用できます。モデルがカスタム マトリックス シストリック アレイと光回路スイッチングの恩恵を受ける場合は、それらの特定の実行パラダイム用に設計された代替アクセラレータ アーキテクチャの評価を検討してください。

料金に関する考慮事項

Google Cloudでの GPU の料金は、次の要因によって決まります。

  • 特定の GPU モデル。

  • 接続されている GPU の数。

  • プロビジョニングされたリソース(vCPU、システム メモリ、ストレージなど)。

  • 選択した使用量モデル。

以降のセクションでは、 Google Cloudの GPU で利用可能な使用量モデルと割引オプションについて説明します。

使用量モデルと購入モデル

可用性の要件と費用の許容度に応じて、次の複数の使用オプションを使用して GPU インスタンスをプロビジョニングできます。

  • オンデマンド: 標準の従量課金制(PAYG)料金。長期契約なしで秒単位で課金されます。オンデマンド インスタンスは、開発、テスト、変動する本番環境のワークロードに対して、ライフサイクル全体の柔軟性を提供します。

  • Spot VM: 余剰のGoogle Cloud 容量を利用する、大幅な割引が適用されたコンピューティング インスタンス(オンデマンド料金の 60 ~ 91% 割引)。 Google Cloud は 30 秒の通知で Spot VM を停止または削除して容量を再利用できるため、これらのコンピューティング インスタンスは、フォールト トレラントなバッチ ML トレーニング、チェックポイント バッチジョブ、分散データ処理に最適です。

  • Flex Start VM: Dynamic Workload Scheduler(DWS)を活用した動的スケジューリング オプション。固定期間のワークロード(最大 7 日間)に対して、指定された期間内に GPU リソースを割引料金でプロビジョニングします。

  • 予約:

    • 予約: 標準 GPU の容量を予約し、予約した容量をすぐに使用できます。
    • 将来の予約(カレンダー モードと AI Hypercomputer): 将来の日付と時刻にクラスタ化された GPU 容量を予約するリクエストを送信できます。 Google Cloud がリクエストを承認すると、指定した時間に容量の使用を開始し、予約が終了するまで排他的アクセスを維持できます。

割引オプション

  • 確約利用割引(CUD): 特定のリージョンでリソース使用量を継続的に維持することを確約すると、大幅な割引(3 年間のコミットメントで最大 55%、1 年間のコミットメントで最大 37%)が適用されます。アクセラレータ最適化マシンタイプとアタッチされた GPU の場合、CUD には予約に関連付けられたリソースベースのコミットメントの購入が必要です。

  • 継続利用割引(SUD): 請求月の 25% を超えて実行された場合に、N1 コンピューティング インスタンスとアタッチされた GPU に自動的に適用される割引。アクセラレータ最適化マシンシリーズ(A シリーズと G シリーズ)は SUD を受け取りません。

すべてのリージョンの時間単位と月単位の料金の詳細については、GPU の料金ページと VM インスタンスの料金ページをご覧ください。

すべてのアクセラレータ マシンタイプで使用可能な消費オプションの詳細な機能マトリックスについては、各マシンタイプで利用可能な消費オプションをご覧ください。

次のステップ