GPU アクセラレータについて

AI Hypercomputer は、要求の厳しい人工知能(AI)と機械学習(ML)のワークロード向けに最適化された垂直統合インフラストラクチャを提供します。高性能 NVIDIA GPU は、システムがライフサイクル イベントとメンテナンスを処理する方法によって、一般的な GPU とクラスタ化された GPU に分類されます。

ワークロードに最適なインフラストラクチャ カテゴリを特定するには、アクセラレータ インフラストラクチャを選択する をご覧ください。

一般的な GPU

一般的な GPU は、標準の Compute Engine API と Google Kubernetes Engine(GKE)API を使用して、コントロール プレーンと直接統合することで、独立したコンピューティング ユニットとして管理されます。 Google Cloud

一般的な GPU には、次のマシンシリーズが含まれます。

  • 1、2、または 4 個の(NVIDIA H100)GPU を搭載した A3 High: 8 個の GPU 同期クラスタを必要としない標準のトレーニングと推論のワークロード向けに最適化されています。
  • A3 Edge(NVIDIA H100): 標準の VPC ネットワーキングを使用して、高 スループットで複数のホストに分散される推論向けに最適化されています。
  • A2(NVIDIA A100): 高パフォーマンスの単一ノード サービングと小規模な ファインチューニング向けに最適化されています。
  • G4(NVIDIA RTX PRO 6000): 費用対効果の高いエントリーレベルの推論とグラフィック ワークロード向けに最適化されています。
  • G2(NVIDIA L4): 主流の推論と RAG 向けに最適化されています。
  • N1(NVIDIA T4 または V100): 高パフォーマンスのインターコネクトよりもコストを優先するエントリーレベルの推論と研究タスク向けに最適化されています。

クラスタ化された GPU

クラスタ化された GPU は、Cluster Director を使用して、相互接続された数千のアクセラレータの単一の緊密に結合されたシステムとして管理されます。

クラスタ化された GPU には、次のマシンシリーズが含まれます。

GPU パフォーマンスに関する考慮事項

ワークロードのパフォーマンスを評価して最適化するには、CUDA コアや Tensor コアの使用率などのハードウェア レベルの指標をトラッキングします。リソースをモニタリングし、一般的な環境とクラスタ化された環境の両方でパフォーマンスを評価するには、以下をご覧ください。

  • モニタリング ダッシュボード: 個々のスタンドアロン インスタンスまたは オーケストレーションされたクラスタ フリートのリアルタイムの GPU 使用率とメモリ使用量をトラッキングします。
  • Goodput 指標のレシピ: アクセラレータが有用な計算を実行する時間の割合とシステム オーバーヘッドを測定します。これは、クラスタ化されたハードウェアでの大規模な 分散トレーニングに強く推奨されます。

次のステップ