グラフィック プロセッシング ユニット(GPU)は、超並列ワークロードを同時に処理するように設計された特殊なハードウェア アクセラレータです。Google Cloudでは、NVIDIA GPU を Compute Engine インスタンスとベアメタル インスタンスにアタッチして、人工知能(AI)や機械学習(ML)トレーニング、ハイ パフォーマンス コンピューティング(HPC)、グラフィック レンダリング、動画のコード変換などの要求の厳しいワークロードを高速化できます。
このドキュメントでは、使用可能な GPU モデル、マシンシリーズのマッピング、パフォーマンス特性、理想的なユースケース、料金に関する考慮事項など、 Google Cloudの GPU の概要について説明します。
GPU とは
GPU は、元々コンピュータ グラフィック用に設計された大規模な並列プロセッサですが、AI、ML、科学技術計算に不可欠なコンピューティング エンジンに進化しました。中央処理装置(CPU)には、シーケンシャルなシングル スレッド処理用に最適化された強力なコアがいくつか含まれていますが、GPU は大規模なデータセットで数学的計算を同時に実行するように設計された、効率性の高い小さなコアが数千個含まれています。
GPU システムの主なアーキテクチャ コンポーネントは次のとおりです。
CUDA コア: 単一命令複数スレッド(SIMT)アーキテクチャを使用して、複数の並列スレッドで同時に命令を実行する汎用ベクトル処理ユニット。CUDA コアは、標準のベクトル計算と浮動小数点計算(FP32 や FP64 など)だけでなく、一般的なグラフィック レンダリングや物理シミュレーションも処理します。
Tensor コア: ニューラル ネットワーク計算を高速化するように設計された特殊な行列乗算累算(MMA)処理ユニット。Tensor コアは、FP4、FP8、INT8、TF32、FP16/BF16 などの特殊な数値精度形式で、AI トレーニングと推論の速度を飛躍的に向上させます。
高帯域幅メモリ: 高帯域幅メモリ(HBM)やグラフィック ダブル データレート(GDDR)など、最大数テラバイト/秒(TBps)の帯域幅を実現する専用のオンデバイス メモリ。この高スループットにより、集中的な行列演算中に数千の GPU コアにデータが供給されます。
高速相互接続(NVLink と NVSwitch): 同じサーバーまたはノード間で複数の GPU を接続する高帯域幅、低レイテンシの相互接続テクノロジー。NVLink は、低速の PCIe バスをバイパスする GPU 間の直接通信を提供し、GPU クラスタを単一のコヒーレントなアクセラレータ メモリプールとして機能させます。
仮想ワークステーション ソフトウェア(NVIDIA RTX vWS): リモート ビジュアル ワークステーション、コンピュータ支援設計(CAD)、デジタル コンテンツ作成、3D モデリングに仮想化されたグラフィック アクセラレーションを提供するエンタープライズ ソフトウェア。
GPU モデルとマシンシリーズ
Google Cloud は、さまざまなワークロードと予算のニーズを満たすために、複数の世代の NVIDIA GPU を提供しています。Compute Engine では、GPU は事前構成されたアクセラレータ最適化マシンシリーズ(A シリーズと G シリーズ)として、または汎用 N1 マシンシリーズにアタッチ可能なアクセラレータとして使用できます。
次の表に、Compute Engine で使用可能な GPU モデルのハードウェア仕様、マシンシリーズのマッピング、ネットワーキング帯域幅、ストレージ機能をまとめます。
| GPU モデル | マシンシリーズ | アーキテクチャ | GPU メモリと帯域幅 | コンピューティング インスタンスあたりの GPU 数 | 最大ネットワーク帯域幅 | ローカル SSD | 相互接続 | NVIDIA RTX 仮想ワークステーション(vWS)のサポート |
|---|---|---|---|---|---|---|---|---|
| NVIDIA GB300 | A4X Max | Blackwell Ultra | 279 GB HBM3e(8 TBps) | 4(NVL72) | 3,600 Gbps | 12,000 GiB | NVLink Full Mesh(1,800 GBps) | いいえ |
| NVIDIA GB200 | A4X | Blackwell | 186 GB HBM3e(8 TBps) | 4(NVL72) | 2,000 Gbps | 12,000 GiB | NVLink Full Mesh(1,800 GBps) | いいえ |
| NVIDIA B200 | A4 | Blackwell | 180 GB HBM3e(8 TBps) | 8 | 3,600 Gbps | 12,000 GiB | NVLink Full Mesh(1,800 GBps) | いいえ |
| NVIDIA H200 | A3 Ultra | ホッパー | 141 GB HBM3e(4.8 TBps) | 8 | 3,600 Gbps | 12,000 GiB | NVLink Full Mesh(900 GBps) | いいえ |
| NVIDIA H100 | A3 Mega、High、Edge | ホッパー | 80 GB HBM3(3.35 TBps) | 1、2、4、8 | 最大 1,000 Gbps | 最大 6,000 GiB | NVLink Full Mesh(900 GBps) | いいえ |
| NVIDIA A100(80 GB) | A2 Ultra | Ampere | 80 GB HBM2e(1.9 TBps) | 1、2、4、8 | 100 Gbps | 最大 3,000 GiB | NVLink Full Mesh(600 GBps) | いいえ |
| NVIDIA A100(40 GB) | A2 標準 | Ampere | 40 GB HBM2(1.6 TBps) | 1、2、4、8、16 | 100 Gbps | 最大 3,000 GiB | NVLink Full Mesh(600 GBps) | いいえ |
| NVIDIA RTX PRO 6000 | G4 | Blackwell | 96 GB GDDR7(1.597 TBps) | 1/8、1/4、1/2、1、2、4、8 | 200 Gbps | 最大 3,000 GiB | PCIe Gen 5 | ○ |
| NVIDIA L4 | G2 | エイダ ラブレス | 24 GB GDDR6(300 GBps) | 1、2、4、8 | 100 Gbps | 最大 3,000 GiB | PCIe Gen 4 | ○ |
| NVIDIA T4 (サポート終了が近づいています) |
N1+T4 | Turing | 16 GB GDDR6(320 GBps) | 1、2、4 | 100 Gbps | サポート対象 | PCIe Gen 3 | ○ |
| NVIDIA V100 | N1+V100 | Volta | 16 GB HBM2(900 GBps) | 1、2、4、8 | 100 Gbps | サポート対象 | NVLink Ring(300 Gbps) | いいえ |
| NVIDIA P100 (サポート終了が近づいています) |
N1+P100 | Pascal | 16 GB HBM2(732 GBps) | 1、2、4 | 100 Gbps | サポート対象 | PCIe Gen 3 | ○ |
| NVIDIA P4 (サポート終了が近づいています) |
N1+P4 | Pascal | 8 GB GDDR5(192 GBps) | 1、2、4 | 100 Gbps | サポート対象 | PCIe Gen 3 | ○ |
GPU のパフォーマンス特性
適切な GPU モデルを選択するには、ワークロードのコンピューティング特性、メモリ要件、精度形式、スケーラビリティのニーズを考慮する必要があります。
理想的なユースケースとワークロード要件
GPU は、AI、ビジュアル コンピューティング、科学モデリングなど、さまざまなコンピューティング ワークロードを高速化します。各ワークロード カテゴリのアーキテクチャ要件を確認するには、次のいずれかのタブを選択します。
AI / ML トレーニング
フロンティア基盤モデルと Mixture-of-Experts(MoE): 大規模な Transformer モデル、マルチモーダル アーキテクチャ、Mixture-of-Experts(MoE)ネットワークの事前トレーニングには、高い Tensor Core スループット、大容量の High Bandwidth Memory(HBM)(GPU あたり最大 279 GB)、超高速の NVLink 相互接続帯域幅(最大 1,800 Gbps)が必要です。これにより、マルチノード同期レイテンシを最小限に抑えることができます。推奨されるマシンシリーズ:
- A4X Max (NVIDIA GB300)
- A4X(NVIDIA GB200)
- A4(NVIDIA B200)
- A3 Ultra(NVIDIA H200)
- A3 Mega (NVIDIA H100)
詳細については、AI Hypercomputer のドキュメントのモデルの事前トレーニングに関する推奨事項をご覧ください。
ファインチューニングと中程度のモデル トレーニング: パラメータ エフィシエント ファインチューニング(PEFT)や Low-Rank Adaptation(LoRA)などの手法を使用して既存の基盤モデルを適応させるには、エクサスケールのマルチノード クラスタリングを必要とせずに、モデルの重みとグラデーションを保持するのに十分な GPU メモリが必要です。推奨マシンシリーズ:
詳細については、AI Hypercomputer のドキュメントでモデルのファインチューニングに関する推奨事項をご覧ください。
AI / ML 推論
大規模モデル推論(700 億を超えるパラメータ): 大規模な大規模言語モデル(LLM)のサービングでは、モデルの重みをより少ない GPU に収容してチップ間通信のオーバーヘッドを削減するために、大容量の高帯域幅メモリ(HBM3e)(GPU あたり 141 ~ 186 GB)が役立ちます。推奨マシンシリーズ:
高スループットとリアルタイム サービング: 低レイテンシのインタラクティブ クエリ、ストリーミング レスポンス、画像生成では、8 ビット浮動小数点(FP8)、8 ビット整数(INT8)、4 ビット整数(INT4)などのハードウェア アクセラレーションによる量子化された数値形式を使用して、1 ドルあたりのリクエスト スループットを最大化します。推奨されるマシンシリーズ:
- G2(NVIDIA L4)
- G4(NVIDIA RTX PRO 6000)
- A3 Edge と High(NVIDIA H100)
詳細については、AI Hypercomputer のドキュメントで推論のサービングに関する推奨事項をご覧ください。
グラフィックとビジュアル コンピューティング
3D CAD、デジタル ツイン、仮想ワークステーション: インタラクティブな 3D モデリング、コンピュータ支援設計(CAD)、建築レンダリング、デジタル ツイン(NVIDIA Omniverse など)は、専用のレイ トレーシング(RT)コアと、リモート ビジュアル ワークステーションとフラクショナル仮想 GPU(vGPU)用の NVIDIA RTX 仮想ワークステーション(vWS)を使用します。推奨されるマシンシリーズ:
動画の処理とトランスコーディング: ライブ ストリーミング パイプライン、動画のトランスコーディング、メディア処理では、AV1、高効率動画コーディング(HEVC)、H.264 コーデックをサポートする専用ハードウェアの NVIDIA エンコーダ(NVENC)と NVIDIA デコーダ(NVDEC)動画エンジンを使用します。推奨されるマシンシリーズ:
HPC とシミュレーション
ワークロードの考慮事項
通常、GPU は次のワークロードには適していません。
- シーケンシャルでシングル スレッドのロジック: シーケンシャルな決定分岐やシリアル実行パイプラインが支配するタスクは、シングルコアのクロック周波数が高い CPU でより優れたパフォーマンスを発揮します。
- 標準のウェブ アプリケーションとマイクロサービス: 汎用ウェブサーバー、リレーショナル データベース管理システム(RDBMS)、AI やグラフィック処理の要件のない標準 API バックエンドは、GPU アクセラレーションのメリットを享受できません。これらのワークロードは、汎用またはコンピューティング最適化 CPU インスタンスでより費用対効果の高いホスティングが可能です。
- XLA とグラフ コンパイル フレームワーク用に最適化されたワークロード: ディープ ラーニング モデルが JAX、PyTorch/XLA、TensorFlow などのフレームワークを使用して構築されている場合、コンパイラ駆動のグラフ最適化(XLA)を利用できます。モデルがカスタム マトリックス シストリック アレイと光回路スイッチングの恩恵を受ける場合は、それらの特定の実行パラダイム用に設計された代替アクセラレータ アーキテクチャの評価を検討してください。
料金に関する考慮事項
Google Cloudでの GPU の料金は、次の要因によって決まります。
特定の GPU モデル。
接続されている GPU の数。
プロビジョニングされたリソース(vCPU、システム メモリ、ストレージなど)。
選択した使用量モデル。
以降のセクションでは、 Google Cloudの GPU で利用可能な使用量モデルと割引オプションについて説明します。
使用量モデルと購入モデル
可用性の要件と費用の許容度に応じて、次の複数の使用オプションを使用して GPU インスタンスをプロビジョニングできます。
オンデマンド: 標準の従量課金制(PAYG)料金。長期契約なしで秒単位で課金されます。オンデマンド インスタンスは、開発、テスト、変動する本番環境のワークロードに対して、ライフサイクル全体の柔軟性を提供します。
Spot VM: 余剰のGoogle Cloud 容量を利用する、大幅な割引が適用されたコンピューティング インスタンス(オンデマンド料金の 60 ~ 91% 割引)。 Google Cloud は 30 秒の通知で Spot VM を停止または削除して容量を再利用できるため、これらのコンピューティング インスタンスは、フォールト トレラントなバッチ ML トレーニング、チェックポイント バッチジョブ、分散データ処理に最適です。
Flex Start VM: Dynamic Workload Scheduler(DWS)を活用した動的スケジューリング オプション。固定期間のワークロード(最大 7 日間)に対して、指定された期間内に GPU リソースを割引料金でプロビジョニングします。
予約:
- 予約: 標準 GPU の容量を予約し、予約した容量をすぐに使用できます。
- 将来の予約(カレンダー モードと AI Hypercomputer): 将来の日付と時刻にクラスタ化された GPU 容量を予約するリクエストを送信できます。 Google Cloud がリクエストを承認すると、指定した時間に容量の使用を開始し、予約が終了するまで排他的アクセスを維持できます。
割引オプション
確約利用割引(CUD): 特定のリージョンでリソース使用量を継続的に維持することを確約すると、大幅な割引(3 年間のコミットメントで最大 55%、1 年間のコミットメントで最大 37%)が適用されます。アクセラレータ最適化マシンタイプとアタッチされた GPU の場合、CUD には予約に関連付けられたリソースベースのコミットメントの購入が必要です。
継続利用割引(SUD): 請求月の 25% を超えて実行された場合に、N1 コンピューティング インスタンスとアタッチされた GPU に自動的に適用される割引。アクセラレータ最適化マシンシリーズ(A シリーズと G シリーズ)は SUD を受け取りません。
すべてのリージョンの時間単位と月単位の料金の詳細については、GPU の料金ページと VM インスタンスの料金ページをご覧ください。
すべてのアクセラレータ マシンタイプで使用可能な消費オプションの詳細な機能マトリックスについては、各マシンタイプで利用可能な消費オプションをご覧ください。
次のステップ
- アクセラレータ最適化マシン ファミリーの GPU マシンについて確認する。
- GPU が接続された VM を作成する方法を学習する。
- AI Hypercomputer の概要で、 Google Cloudのスーパーコンピューティング AI アーキテクチャをご覧ください。