AI Hypercomputer は、要求の厳しい人工知能(AI)と機械学習(ML)のワークロード向けに最適化された垂直統合インフラストラクチャを提供します。高性能 NVIDIA GPU は、システムがライフサイクル イベントとメンテナンスを処理する方法によって、一般的な GPU とクラスタ化された GPU に分類されます。
ワークロードに最適なインフラストラクチャ カテゴリを特定するには、アクセラレータ インフラストラクチャを選択する をご覧ください。
一般的な GPU
一般的な GPU は、標準の Compute Engine API と Google Kubernetes Engine(GKE)API を使用して、コントロール プレーンと直接統合することで、独立したコンピューティング ユニットとして管理されます。 Google Cloud
一般的な GPU には、次のマシンシリーズが含まれます。
- 1、2、または 4 個の(NVIDIA H100)GPU を搭載した A3 High: 8 個の GPU 同期クラスタを必要としない標準のトレーニングと推論のワークロード向けに最適化されています。
- A3 Edge(NVIDIA H100): 標準の VPC ネットワーキングを使用して、高 スループットで複数のホストに分散される推論向けに最適化されています。
- A2(NVIDIA A100): 高パフォーマンスの単一ノード サービングと小規模な ファインチューニング向けに最適化されています。
- G4(NVIDIA RTX PRO 6000): 費用対効果の高いエントリーレベルの推論とグラフィック ワークロード向けに最適化されています。
- G2(NVIDIA L4): 主流の推論と RAG 向けに最適化されています。
- N1(NVIDIA T4 または V100): 高パフォーマンスのインターコネクトよりもコストを優先するエントリーレベルの推論と研究タスク向けに最適化されています。
クラスタ化された GPU
クラスタ化された GPU は、Cluster Director を使用して、相互接続された数千のアクセラレータの単一の緊密に結合されたシステムとして管理されます。
クラスタ化された GPU には、次のマシンシリーズが含まれます。
- A4X Max(NVIDIA GB300): ベアメタル エクサスケール トレーニングとハイ パフォーマンス コンピューティング向けに設計されており、 NVIDIA GB300 Grace Blackwell Ultra Superchip を搭載しています。
- A4X(NVIDIA GB200)とA4(NVIDIA B200): 基盤モデルのトレーニングとエクサスケール基盤モデル トレーニング向けに設計されています。
- A3 Ultra(NVIDIA H200)、A3 Mega(NVIDIA H100)、8 個の(NVIDIA H100)GPU を搭載した A3 High: 大規模な分散トレーニングと、大規模なデータテーブルを含むマルチホスト推論向けに最適化されています。
GPU パフォーマンスに関する考慮事項
ワークロードのパフォーマンスを評価して最適化するには、CUDA コアや Tensor コアの使用率などのハードウェア レベルの指標をトラッキングします。リソースをモニタリングし、一般的な環境とクラスタ化された環境の両方でパフォーマンスを評価するには、以下をご覧ください。
- モニタリング ダッシュボード: 個々のスタンドアロン インスタンスまたは オーケストレーションされたクラスタ フリートのリアルタイムの GPU 使用率とメモリ使用量をトラッキングします。
- Goodput 指標のレシピ: アクセラレータが有用な計算を実行する時間の割合とシステム オーバーヘッドを測定します。これは、クラスタ化されたハードウェアでの大規模な 分散トレーニングに強く推奨されます。
次のステップ
- インフラストラクチャ要件を評価するには、 アクセラレータ インフラストラクチャを選択するをご覧ください。
- クラスタを起動する際のプロセスと選択肢を確認するには、 AI インフラストラクチャを計画して作成するをご覧ください。