このドキュメントでは、小規模なプロトタイピング、リアルタイム推論、大規模な分散トレーニングなど、ライフサイクル ステージに基づいて、人工知能(AI)と機械学習(ML)のワークロードに最適なアクセラレータ インフラストラクチャを特定する方法について説明します。AI Hypercomputer は、アクセラレータのオファリングを 2 つの カテゴリに分類しています。一般的な GPU とクラスタ化された GPUです。
GPU インフラストラクチャ
AI Hypercomputer には、2 つの異なるカテゴリの GPU が用意されています。各カテゴリには、システムがライフサイクル イベントを処理する方法、メンテナンスを管理する方法、ワークロードのネットワーキングを最適化する方法を決定する、異なる管理モデルがあります。
一般的な GPU 管理モデル
一般的な GPU 管理モデルは、リソースの独立性と高可用性を優先するワークロード向けに設計されています。この モデルでは、標準の Google Cloud 管理プレーンを使用するため、Compute Engine または GKE をすでに使用しているチームは使い慣れた 操作感で利用できます。
メンテナンス: 非同期。個々のインスタンスは個別に更新されます。マルチノード サービング フリートでは、1 つのノードでメンテナンス イベントが発生しても他のノードの可用性に影響しないため、ジョブ全体を停止することなく、トラフィックを正常なノードにリダイレクトできます。
主なユースケース: リアルタイム推論、モデル提供、小規模なプロトタイピング、スーパーコンピューティング スケールを必要としない開発環境など、主流のタスクにおすすめします。
一般的な GPU マシンシリーズ
次のマシンシリーズは一般的な GPU です。
- G2(L4)
- G4(RTX PRO 6000)
- A2(A100)
- N1+T4
- A3 Edge
- A3 High(1、2、4 個の GPU)
一般的な GPU マシンの技術情報については、GPU マシンタイプをご覧ください。
クラスタ化された GPU 管理モデル
クラスタ化された GPU 管理モデルは、大規模な分散トレーニング向けに設計されたスーパーコンピューティング クラスの環境です。リソースは、クラスタ化された GPU スタックを使用して、単一の緊密に結合されたシステムとして管理されます。
メンテナンス: 調整済み。このモデルは、緊密に結合されたワークロードをサポートするために、メンテナンス イベントを調整します。分散トレーニングでは、すべてのノードに同時に更新を適用する同期メンテナンスを使用できます。このアプローチにより、ノードの再起動によってジョブが停止するのを防ぎ、 goodputを最大化できます。このモデルでは、90 日間のメンテナンス通知も提供されます。
主なユースケース: 数兆のパラメータを持つエクサスケールの基盤モデルのトレーニングや、創薬やタンパク質フォールディングなどの複雑なハイ パフォーマンス コンピューティング(HPC)シミュレーションの実行向けに設計されています。
クラスタ化された GPU マシンシリーズ
次のマシンシリーズはクラスタ化された GPU です。
- A4X
- A4(Blackwell)
- A3 Ultra
- A3 Mega
- A3 High(8 個の GPU)
クラスタ化された GPU マシンの技術情報については、GPU マシンタイプをご覧ください。
機能マトリックス
一般的な GPU 管理モデルとクラスタ化された GPU 管理モデルの技術的特性と運用特性を比較します。
| 特性 | 一般的な GPU 管理モデル | クラスタ化された GPU 管理モデル |
|---|---|---|
| 主なユースケース | 推論、モデル提供、プロトタイピング、開発 | 大規模な分散トレーニングと HPC |
| メンテナンス | 非同期: 個別のノード更新により、ジョブを停止することなくトラフィックをリダイレクトできます | 調整済み: クラスタ全体の調整済み(同期)更新をサポートし、ノードの同期を維持して goodput を最大化します |
| ターゲット ハードウェア | G2(L4)、G4(RTX PRO 6000)、A2(A100)、N1+T4、A3 Edge、A3 High(1、2、4 個の GPU) | A4X、A4(Blackwell)、A3 Ultra、A3 Mega、およびA3 High(8 個の GPU) |
| ネットワーキング | gVNIC インターフェース上の標準 VPC ネットワーキング(複数の VPC で GPUDirect-TCPX を使用する A3 Edge を除く) | 特殊な低レイテンシ ファブリック(RDMA、RoCE、TCPX、NVIDIA NVLink) |
| 管理スタック | 標準 Google Cloud プレーン(Compute Engine または GKE) | 特殊な管理スタック(Cluster Director など) |
| 信頼性 | 標準のノード自動修復と Pod レベルのアップタイム | 特殊なリソースと復旧スイート |
判断マトリックス
このマトリックスを使用して、特定のワークロードの意図に合致するハードウェア ファミリーを特定します。
| ワークロードに次のものが含まれる場合... | 推奨される GPU インフラストラクチャ | 推奨されるマシンシリーズ |
|---|---|---|
| プロトタイピングと開発 | 一般的な GPU | G2、G4、A2、N1+T4、A3 Edge |
| リアルタイム推論(< 1,000 億個のパラメータ) | 一般的な GPU | G2、G4、A2、N1+T4、A3 Edge |
| 複数の GPU での推論 | クラスタ化された GPU | A3、A4 |
| 大規模なトレーニングと推論 | クラスタ化された GPU | A4、A3 シリーズ |
| 大規模なトレーニング(> 5,000 億個のパラメータ)と分離された推論 | クラスタ化された GPU | A4X Max、A4X、A4 |
モデル アーキテクチャをハードウェアに直接マッピングする詳細なデシジョン ツリーについては、 アクセラレータを選択するをご覧ください。
これらの主要な基準を確立したら、オーケストレーション プラットフォームを選択します。 この選択は、オペレーティング システムとドライバの自動管理または詳細な制御に対するチームの優先度によって異なります。
次のステップ
- オーケストレーターとデプロイ オプションを選択するには、オーケストレーターとデプロイ オプションを選択するをご覧ください。
- 推論ワークロードをデプロイする、または大規模なトレーニングを実行するには、AI Hypercomputer のチュートリアルをご覧ください。
- システムの効率を最適化するには、goodput 最適化レシピをご覧ください。