このドキュメントでは、さまざまな AI、ML、ハイ パフォーマンス コンピューティング(HPC)ワークロードに最適なアクセラレータ、利用オプション、デプロイ ツールに関する推奨事項について説明します。このドキュメントは、ワークロードに最適なデプロイを特定するのに役立ちます。
AI、ML、HPC ワークロードのインフラストラクチャ ピラーに関する情報と推奨事項については、次のドキュメントをご覧ください。
ワークロードの概要
AI ハイパーコンピュータ アーキテクチャは、次のユースケースをサポートしています。
| ワークロード | 説明 | 推奨事項 |
|---|---|---|
| 基盤モデルの事前トレーニング | これには、大規模なデータセットを使用して言語モデルを構築することが含まれます。基盤モデルの事前トレーニングの結果は、一般的なタスクの実行に優れた新しいモデルになります。 モデルは、サイズに基づいて次のように分類されます。
|
事前トレーニング モデルに関する推奨事項をご覧ください。 |
| ファインチューニング | これには、トレーニング済みのモデルをベースに、特殊なデータセットやその他の手法を使用して、特定のタスクを実行するように適応させることが含まれます。ファインチューニングは通常、大規模なモデルに対して行われます。 | モデルのファインチューニングに関する推奨事項をご覧ください。 |
| 推論またはサービング | これには、トレーニング済みモデルまたはファイン チューニング済みモデルを取得して、ユーザーまたはアプリケーションが使用できるようにすることが含まれます。 推論ワークロードは、モデルのサイズに基づいて次のように分類されます。
|
推論に関する推奨事項をご覧ください。 |
| 小規模または中規模のモデル向けの ML | これには、サイズと複雑さが小さい ML モデルのトレーニングとサービングが含まれます。通常、より専門的なタスクに使用されます。 | 小規模または中規模のモデルの ML に関する推奨事項をご覧ください。 |
| HPC | これは、コンピューティング リソースを集約することで、単一のワークステーション、サーバー、コンピュータよりも高いパフォーマンスを実現する手法です。HPC は、学術研究、科学、設計、シミュレーション、ビジネス インテリジェンスの問題を解決するために使用されます。 | HPC の推奨事項をご覧ください。 |
事前トレーニング モデルに関する推奨事項
基盤モデルを事前トレーニングするには、アクセラレータの大規模なクラスタが大量のデータを継続的に読み取ります。これらのアクセラレータは、フォワード パスとバックワード パスを通じて重みを調整し、データから学習します。これらのトレーニング ジョブは、一度に数週間または数か月間実行されます。
以降のセクションでは、基盤モデルの事前トレーニングに使用することをおすすめするアクセラレータと使用量オプションについて説明します。
推奨されるアクセラレータ
Google Cloudで基盤モデルを事前トレーニングするには、A4X Max(NVIDIA GB300)、A4X(NVIDIA GB200)、A4(NVIDIA B200)、A3 Ultra(NVIDIA H200 141 GB)、A3 Mega(NVIDIA H100 80 GB)、A3 High(NVIDIA H100 80 GB)のアクセラレータ最適化マシンタイプを使用し、オーケストレータを使用してクラスタをデプロイすることをおすすめします。
これらのアクセラレータ クラスタをデプロイするには、Cluster Director または Cluster Toolkit を使用することをおすすめします。詳細については、次の表で選択したマシンタイプのクラスタ デプロイ ガイドをご覧ください。
| ワークロード | 推奨事項 | クラスタ デプロイガイド | |
|---|---|---|---|
| マシンタイプ | オーケストレーター | ||
| 基盤モデルの事前トレーニング |
|
GKE | Cluster Toolkit を使用して AI 最適化 GKE クラスタを作成する |
| Slurm | |||
| 大規模モデルのトレーニング | A3 Ultra(NVIDIA H200 141 GB) | GKE | Cluster Toolkit を使用して AI 最適化 GKE クラスタを作成する |
| Slurm | |||
| 大規模モデルのトレーニング |
|
GKE | 標準モードのクラスタで GPU ネットワーク帯域幅を最大化する |
| Slurm | |||
推奨される使用オプション
アクセラレータの大きなクラスタを確実に取得するには、予約を使用することをおすすめします。具体的には、予約済みリソースの費用を最小限に抑えるために、確約利用割引を受けられるだけの十分な予約期間をリクエストすることをおすすめします。使用オプションの詳細については、使用オプションを選択するをご覧ください。
モデルのファインチューニングに関する推奨事項
大規模な基盤モデルをファインチューニングするには、アクセラレータの小さなクラスタが中程度の量のデータを読み取ります。これらのアクセラレータは、特定のタスクを実行するようにモデルを調整します。これらのファインチューニング ジョブは、数日または数週間実行されます。
以降のセクションでは、モデルのファインチューニング時に使用する推奨アクセラレータと使用量オプションについて説明します。
推奨されるアクセラレータ
Google Cloudでモデルをファインチューニングするには、A3 Ultra(NVIDIA H200 141 GB)、A3 Mega(NVIDIA H100 80 GB)、または A3 High(NVIDIA H100 80 GB)アクセラレータ最適化マシンタイプを使用し、オーケストレーターを使用してクラスタをデプロイすることをおすすめします。
これらのアクセラレータ クラスタをデプロイするには、Cluster Director または Cluster Toolkit を使用することをおすすめします。詳細については、次の表で選択したマシンタイプのクラスタ デプロイ ガイドをご覧ください。
| ワークロード | 推奨事項 | クラスタ デプロイガイド | |
|---|---|---|---|
| マシンタイプ | オーケストレーター | ||
| 大規模モデルのファインチューニング | A3 Ultra(NVIDIA H200 141 GB) | GKE | Cluster Toolkit を使用して AI 最適化 GKE クラスタを作成する |
| Slurm | |||
| 大規模モデルのファインチューニング |
|
GKE | 標準モードのクラスタで GPU ネットワーク帯域幅を最大化する |
| Slurm | |||
推奨される使用オプション
ファインチューニング ワークロードの場合は、カレンダー モードで将来の予約を使用してリソースをプロビジョニングします。使用オプションの詳細については、使用オプションを選択するをご覧ください。
推論に関する推奨事項
以降のセクションでは、推論を実行する際に使用する推奨アクセラレータと消費オプションについて説明します。
推奨されるアクセラレータ
推論に推奨されるアクセラレータは、マルチホストのフロンティア モデルまたは大規模モデルの推論を実行するか、単一ホストのフロンティア モデルの推論を実行するかによって異なります。
推奨されるアクセラレータ(マルチホスト)
Google Cloudでマルチホストのフロンティア モデルまたは大規模モデルの推論を実行するには、A4X Max(NVIDIA GB300)、A4X(NVIDIA GB200)、A4(NVIDIA B200)、A3 Ultra(NVIDIA H200 141 GB)、A3 Mega(NVIDIA H100 80 GB)、または A3 High(NVIDIA H100 80 GB)のアクセラレータ最適化マシンタイプを使用し、オーケストレータを使用してマシンをデプロイします。これらのアクセラレータ クラスタをデプロイするには、Cluster Director または Cluster Toolkit を使用することをおすすめします。次の表に、推奨される各マシンタイプのクラスタ デプロイガイドへのリンクを示します。
| ワークロード | 推奨事項 | クラスタ デプロイガイド | |
|---|---|---|---|
| マシンタイプ | オーケストレーター | ||
| マルチホスト フロンティア推論 |
|
GKE | Cluster Toolkit を使用して AI 最適化 GKE クラスタを作成する |
| Slurm | |||
| 大規模モデルの推論 | A3 Ultra(NVIDIA H200 141 GB) | GKE | Cluster Toolkit を使用して AI 最適化 GKE クラスタを作成する |
| Slurm | |||
| 大規模モデルの推論 |
|
GKE | 標準モードのクラスタで GPU ネットワーク帯域幅を最大化する |
| Slurm | |||
推奨されるアクセラレータ(単一ホスト)
次の表に、単一ホストのフロンティア推論の実行におすすめのアクセラレータを示します。次の表に、推奨される各マシンタイプの VM デプロイガイドへのリンクを示します。
| ワークロード | 推奨事項 | VM デプロイガイド | |
|---|---|---|---|
| マシンタイプ | オーケストレーター | ||
| 単一ホストのフロンティア推論とメインストリーム推論 |
|
なし | A4 インスタンスまたは A3 Ultra インスタンスを作成する |
|
A3 High インスタンスまたは A3 Edge インスタンスを作成する | ||
| A2(NVIDIA A100) | A2 インスタンスを作成する | ||
| G4(NVIDIA RTX PRO 6000) | G4 インスタンスを作成する | ||
| G2(NVIDIA L4) | G2 インスタンスを作成する | ||
| N1(NVIDIA T4 または V100) | N1 インスタンスを作成する | ||
推奨される使用オプション
推論には、長時間実行される予約またはカレンダー モードの将来の予約を使用します。使用オプションの詳細については、使用オプションを選択するをご覧ください。
小規模または中規模のモデルの推奨事項
小規模から中規模のモデルを含む ML ワークロードの場合、料金とパフォーマンスの最適なバランスを実現することが主な考慮事項となります。
推奨されるアクセラレータ
次の表に、小規模から中規模のモデルの ML ワークロードで使用する推奨アクセラレータの概要を示します。
| ワークロード | 推奨事項 | VM デプロイガイド | |
|---|---|---|---|
| マシンタイプ | オーケストレーター | ||
| 小規模または中規模のモデルの ML | A3 Edge(NVIDIA H100 80 GB) | なし | A3 Edge インスタンスを作成する |
| A2(NVIDIA A100) | A2 インスタンスを作成する | ||
| G4(NVIDIA RTX PRO 6000) | G4 インスタンスを作成する | ||
| G2(NVIDIA L4) | G2 インスタンスを作成する | ||
| N1(NVIDIA T4 または V100) | N1 インスタンスを作成する | ||
HPC の推奨事項
HPC ワークロードでは、アクセラレータ最適化マシンシリーズまたはコンピューティング最適化マシンシリーズが適しています。アクセラレータ最適化マシンシリーズを使用する場合、最適なものは GPU にオフロードする必要がある計算量によって異なります。HPC ワークロードの推奨事項の詳細なリストについては、HPC ワークロードの実行に関するベスト プラクティスをご覧ください。
推奨事項の概要
次の表に、ワークロードごとに推奨されるアクセラレータと使用オプションの概要を示します。
| リソース | 推奨事項 |
|---|---|
| モデルの事前トレーニング | |
| マシン ファミリー | 次のいずれかのアクセラレータ最適化マシンタイプを使用します。A4X Max(NVIDIA GB300)、A4X(NVIDIA GB200)、A4(NVIDIA B200)、A3 Ultra(NVIDIA H200 141 GB)、A3 Mega(NVIDIA H100 80 GB)、A3 High(NVIDIA H100 80 GB) |
| 使用オプション | 「標準の将来の予約を使用する |
| モデルの微調整 | |
| マシン ファミリー | A3 Ultra(NVIDIA H200 141 GB)、A3 Mega(NVIDIA H100 80 GB)、または A3 High(NVIDIA H100 80 GB)アクセラレータ最適化マシンタイプを使用する |
| 使用オプション | 「標準の将来の予約を使用する |
| 推論 | |
| マシン ファミリー | 次のいずれかのマシンタイプを使用します。A4X Max(NVIDIA GB300)、A4X(NVIDIA GB200)、A4(NVIDIA B200)、A3 Ultra(NVIDIA H200 141 GB)、A3 Mega(NVIDIA H100 80 GB)、A3 High(NVIDIA H100 80 GB)、A3 Edge(NVIDIA H100 80 GB)、A2(NVIDIA A100)、G4(NVIDIA RTX PRO 6000)、G2(NVIDIA L4)、N1(NVIDIA T4 または V100) |
| 使用オプション | 予約、オンデマンド、Spot を使用する |
| 小規模または中規模のモデルの ML | |
| マシン ファミリー | 次のいずれかのマシンタイプを使用します。A3 Edge(NVIDIA H100 80 GB)、A2(NVIDIA A100)、G4(NVIDIA RTX PRO 6000)、G2(NVIDIA L4)、N1(NVIDIA T4 または V100) |
| 使用オプション | オンデマンド予約、スポット予約、標準予約を使用する |
| ストレージ | Cloud Storage FUSE を使用する |
| HPC | |
| HPC ワークロードの実行に関するベスト プラクティスの概要セクションをご覧ください。 | |
次のステップ
- AI 最適化 GKE クラスタを作成する方法を確認する。
- フルマネージド Slurm クラスタを作成する方法を学習する。
- AI 最適化インスタンスを作成する方法を確認する。