このドキュメントでは、ライフサイクル ステージ(小規模なプロトタイピング、リアルタイム推論、大規模な分散トレーニングなど)に基づいて、AI と ML のワークロードに最適なアクセラレータ インフラストラクチャを特定する方法について説明します。AI Hypercomputer は、アクセラレータ オファリングを 汎用 GPU と クラスタ化された GPU の 2 つのカテゴリに分類します。
GPU インフラストラクチャ
AI Hypercomputer には、2 つの異なるカテゴリの GPU があります。各カテゴリには、システムがライフサイクル イベントを処理し、メンテナンスを管理し、ワークロードのネットワーキングを最適化する方法を決定する独自の管理モデルがあります。
一般的な GPU 管理モデル
一般的な GPU 管理モデルは、リソースの独立性と高可用性を優先するワークロード向けに設計されています。このモデルは標準の Google Cloud 管理プレーンを使用するため、Compute Engine または GKE をすでに使用しているチームに使い慣れたエクスペリエンスを提供します。
メンテナンス: 非同期。個々のインスタンスは個別に更新されます。マルチノード サービング フリートでは、1 つのノードのメンテナンス イベントが他のノードの可用性に影響しないため、ジョブ全体を停止することなく、トラフィックを正常なノードにリダイレクトできます。
主なユースケース: リアルタイム推論、モデル提供、小規模なプロトタイピング、スーパーコンピューティング規模を必要としない開発環境などの主流のタスクにおすすめします。
汎用 GPU マシンシリーズ
次のマシンシリーズは汎用 GPU です。
- 1、2、または 4 個の GPU を搭載した A3 High
- A3 Edge
- A2
- G4
- G2
- N1+T4
- N1+V100
各汎用 GPU マシンの技術情報については、GPU マシンタイプをご覧ください。
クラスタ化された GPU 管理モデル
クラスタ化された GPU 管理モデルは、大規模な分散トレーニング用に設計されたスーパーコンピューティング クラスの環境です。リソースは、クラスタ化された GPU スタックを使用して、単一の密結合システムとして管理されます。
メンテナンス: 調整済み。このモデルは、密結合されたワークロードをサポートするためにメンテナンス イベントを調整します。分散トレーニングでは、同期メンテナンスを使用できます。このメンテナンスでは、すべてのノードに同時に更新が適用されます。このアプローチにより、ノードの再起動によるジョブの停止を防ぎ、グッドプットを最大化できます。このモデルでは、90 日間のメンテナンス通知も提供されます。
主なユースケース: 数兆個のパラメータを含むエクサスケールの基盤モデルのトレーニングや、創薬やタンパク質フォールディングなどの複雑なハイ パフォーマンス コンピューティング(HPC)シミュレーションの実行向けに設計されています。
クラスタ化された GPU マシンシリーズ
次のマシンシリーズはクラスタ化された GPU です。
- A4X Max
- A4X
- A4
- A3 Ultra
- A3 Mega
- 8 個の GPU を搭載した A3 High
クラスタ化された各 GPU マシンの技術情報については、GPU マシンタイプをご覧ください。
機能マトリックス
一般的な GPU 管理モデルとクラスタ化された GPU 管理モデルの技術的特性と運用上の特性を比較します。
| 特性 | 一般的な GPU 管理モデル | クラスタ化された GPU 管理モデル |
|---|---|---|
| 主なユースケース: | 推論、モデルのサービング、プロトタイピング、開発 | 大規模な分散トレーニングと HPC |
| メンテナンス | 非同期: 独立したノードの更新により、ジョブを停止することなくトラフィックをリダイレクトできます。 | 調整済み: クラスタ全体の調整済み(同期済み)更新をサポートし、ノードの同期を維持してスループットを最大化します。 |
| 対象ハードウェア | A3 High(1、2、または 4 個の GPU)、A3 Edge、G4、G2、A2、N1+T4、N1+V100 | A4X、A4、A3 Ultra、A3 Mega、A3 High(8 個の GPU) |
| ネットワーキング | gVNIC インターフェースを介した標準 VPC ネットワーキング(複数の VPC で GPUDirect-TCPX を使用する A3 Edge を除く) | 低レイテンシの専用ファブリック(RDMA、RoCE、TCPX、NVIDIA NVLink) |
| 管理スタック | Standard Google Cloud プレーン(Compute Engine または GKE) | 専用の管理スタック(Cluster Director など) |
| 信頼性 | Standard ノードの自動修復と Pod レベルの稼働時間 | Specialized Resource and Recovery スイート |
意思決定マトリックス
このマトリックスを使用して、特定のワークロードの意図に合致するハードウェア ファミリーを特定します。
| ワークロードに次のものが含まれている場合... | 推奨される GPU インフラストラクチャ | 推奨されるマシンシリーズ |
|---|---|---|
| プロトタイピングと開発 | 汎用 GPU | A3 High(1、2、または 4 個の GPU)、A3 Edge、A2、G4、G2、N1+T4、N1+V100 |
| リアルタイム推論(1,000 億個未満のパラメータ) | 汎用 GPU | A3 High(1、2、または 4 個の GPU)、A3 Edge、A2、G4、G2、N1+T4、N1+V100 |
| 複数の GPU での推論 | クラスタ化された GPU | A4、A3 Ultra、A3 Mega、A3 High(8 GPU) |
| 大規模なトレーニングと推論 | クラスタ化された GPU | A4、A3 Ultra、A3 Mega、A3 High(8 GPU) |
| 大規模なトレーニング(5,000 億を超えるパラメータ)と分離された推論 | クラスタ化された GPU | A4X Max、A4X、A4 |
モデル アーキテクチャをハードウェアに直接マッピングする詳細なディシジョン ツリーについては、アクセラレータを選択するをご覧ください。
これらの主な基準を確立したら、オーケストレーション プラットフォームを選択します。この選択は、オペレーティング システムとドライバの自動管理またはきめ細かい制御に対するチームの好みによって異なります。
次のステップ
- オーケストレーターとデプロイ オプションを選択するには、オーケストレーターとデプロイ オプションを選択するをご覧ください。
- 推論ワークロードをデプロイするか、大規模なトレーニングを実行するには、AI Hypercomputer チュートリアルをご覧ください。
- システムの効率を最適化するには、グッドプット最適化レシピをご覧ください。