AI Hypercomputer には、コンピューティング リソースを取得するための使用オプションがいくつか用意されています。これらのオプションは、ワークロードの期間、フォールト トレランス、インフラストラクチャ モデルなどのニーズに対応します。これらのオプションについて学習し、ユースケースに最適なオプションを選択してください。
手動評価の代わりに、 Google Cloud コンソール で Gemini にプロンプトを表示して、ワークロードと予算の使用オプションを比較できます。詳細については、 Compute Advisor を使用して AI インフラストラクチャを設計するをご覧ください。
使用オプションの概要
主な特性で使用オプションを比較するには、次の表を使用します。
| 使用オプション | プロビジョニング モデル | 最適な用途 | 容量保証 | 存続期間 | プリエンプティブル | Quota | 割引 | 割り当てモデル |
|---|---|---|---|---|---|---|---|---|
| Flex Start | Flex Start | 容量を待機できる最長 7 日間の短期間のワークロード。 | ベスト エフォート | 最長 7 日間 | いいえ | プリエンプティブル割り当て | サポートされているシリーズで割引(最大 53%) | MIG サイズ変更リクエストの場合は Dense。スタンドアロン VM の場合はベスト エフォート。 |
| Spot VM | スポット | フォールト トレラントな短期間の汎用 GPU ワークロード。 | ベスト エフォート | プリエンプティブル | はい | プリエンプティブル割り当て | 大幅な割引(最大 91%) | 標準 |
| 標準の予約 | 標準 | 容量の確実性が非常に高いことを必要とする重要な汎用 GPU ワークロード。 | 非常に高い | 非常に高い | ユーザー定義 | いいえ | 割り当ては消費されません | 確約利用割引(CUD)による割引料金 |
| 容量ブロックの将来の予約 | 予約で制限 | クラスタ化された GPU での大規模な長時間実行トレーニング。 | 非常に高い | 予約期間内は無制限。 | いいえ | 自動的に増加 | CUD で割引(最大 53%) | Dense |
| カレンダー モードの将来の予約 | 予約で制限 | 予約済み容量を必要とする最長 90 日間のクラスタ化された GPU ワークロード。 | 非常に高い | 最長 90 日間 | いいえ | 割り当ては消費されません | 割引(最大 53%) | Dense |
| オンデマンド VM | 標準 | 特定の期間のない汎用 GPU ワークロード。 | ベスト エフォート | 無制限 | いいえ | オンデマンドの割り当て | なし(従量課金制) | 標準 |
インフラストラクチャのデプロイに使用する使用オプションは、一般的な GPU を使用するか、クラスタ化された GPU を使用するかによって異なります。
一般的な GPU: 小規模な 推論、開発、小規模なトレーニング ワークロード向けに設計されています。このタイプの GPU は、非同期メンテナンスにより運用上の柔軟性を提供します。利用可能なオプションを表示するには、一般的な GPU の使用オプションをご覧ください。
クラスタ化された GPU: 大規模で 緊密に結合されたトレーニング ワークロード、大規模な推論、RL、 推論モデル ワークロード向けに設計されています。これらのワークロードでは、ネットワーク レイテンシを最小限に抑えるために、高い容量保証と密な リソース割り当てが必要です。利用可能な オプションを表示するには、クラスタ化された GPU の 使用オプションをご覧ください。
一般的な GPU の使用オプション
一般的な GPU の容量を取得するには、次の使用オプションを使用します。
Flex Start を使用する
リソースの密な割り当てを必要とする短期間のワークロードを実行するには、Flex Start を使用して最大 7 日間のコンピューティング リソースをリクエストできます。リソースが使用可能になると、 Compute Engine はリクエストされた数の VM を作成します。スタンドアロンの Flex Start VM は停止できますが、マネージド インスタンス グループ(MIG)がサイズ変更リクエストで作成した Flex Start VM は停止できません。Flex Start VM は、ユーザーが削除するか、Compute Engine が実行期間の終了時に VM を削除するまで存在します。
適しているワークロード
- 小規模モデルの事前トレーニング
- モデルのファインチューニング
- ハイ パフォーマンス コンピューティング(HPC)シミュレーション
- バッチ推論
主な特徴
- プロビジョニング モデル: Flex Start。
- 幅広いハードウェア サポート: A4X Max と A4X を除く任意のクラスタ化された GPU マシンタイプをリクエストします。
- レイテンシの最適化: コンパクト プレースメント ポリシーをスタンドアロン VM に適用して、 ネットワーク レイテンシを最小限に抑えます。
- 費用対効果: A4、A3、A2、G4 マシンシリーズの vCPU、メモリ、GPU、 ローカル SSD ディスクで最大 53% の割引を受けられます。サポートされている他のシリーズには、標準のオンデマンド料金が適用されます。詳細については、Flex Start の料金をご覧ください。
スポットを使用
フォールト トレラントなワークロードを実行するには、可用性に基づいて コンピューティング リソースをすぐに取得できます。リソースを可能な限り低価格で取得できます。ただし、Compute Engine は いつでも VM をプリエンプトして容量を再利用できます。
適しているワークロード
- バッチ処理とデータ分析
- ハイ パフォーマンス コンピューティング(HPC)とメディア エンコード
主な特徴
- プロビジョニング モデル: スポット。
- 幅広いハードウェア サポート: A4X Max と A4X を除く任意のクラスタ化された GPU マシンタイプをリクエストします。
- レイテンシの最適化: コンパクト プレースメント ポリシーをスタンドアロン VM に適用して、 ネットワーク レイテンシを最小限に抑えます。
- 費用対効果: vCPU、メモリ、GPU、 ローカル SSD ディスクで最大 91% の割引を受けられます。
オンデマンドを使用
ヒント: 一般的な GPU 容量を取得できる可能性を高めるには、Flex Start またはスポットを使用します。これらの 使用オプションでは、オンデマンド料金と比較して GPU が割引料金で提供されます。また、GPU などの需要の高いリソースを取得できる可能性を高めるように設計されています。
特定の期間のないワークロードを実行するには、可用性に基づいてコンピューティング リソースをすぐに取得できます。 VM は、停止または削除するまで実行されます。
適しているワークロード
- 推論とモデル提供
- プロトタイピングと試験運用
主な特徴
- プロビジョニング モデル: 標準。
- 即時利用可能: 容量のスケジューリングや承認を待たずに、VM インスタンスをすぐに作成できます。
- 標準料金: 長期的なコミットメントなしで、標準のオンデマンド料金でリソースの料金を支払います。
- 幅広いハードウェア サポート: 一般的な GPU パスでサポートされている任意の GPU マシンシリーズで使用します。
標準の予約を使用する
容量の確実性が非常に高い ことを必要とする重要な汎用 GPU ワークロードを実行するには、標準の予約を使用します。
適しているワークロード
- 重要な本番環境ワークロード
- 確約された容量を必要とするワークロード
主な特徴
- プロビジョニング モデル: 標準。
- 容量保証: リソースが利用可能であるという非常に高い保証を提供します。
- 料金: 標準料金が適用されますが、CUD を適用して費用を削減できます。
クラスタ化された GPU の使用オプション
クラスタ化された GPU の容量を取得するには、次の使用オプションを使用します。容量ブロックの将来の予約を使用する
リソースの密な割り当てを必要とする大規模な長時間実行分散ワークロードを実行するには、 特定の期間のコンピューティング リソースをリクエストします。その期間は 予約済みリソースに排他的にアクセスでき、リソースを使用して VM または クラスタを作成できます。予約期間の終了時に、Compute Engine は次の処理を行います。
- Compute Engine は予約を削除します。
- VM に指定した 終了アクション に基づいて、Compute Engine は予約を使用する VM を停止または削除します。
適しているワークロード
- 基盤モデルの事前トレーニング
- 複数のホストにわたる基盤モデルの推論
主な特徴
- プロビジョニング モデル: 予約で制限。
- プレミアム マシンのサポート: A4X Max、A4X、A4、A3 Ultra、A3 Mega、A3 High(8 個の GPU)マシンタイプを予約します。
- コミットメントの要件: 1 年以上の予約には、リソースベースのコミットメントを適用します。
- 動的な変更: ハードウェア緊急メンテナンス通知を有効にします 期間の開始後に、Vertex AI ジョブの使用状況に関する通知を有効にします。
カレンダー モードで将来の予約を使用する
リソースの密な割り当てを必要とする短時間実行の分散ワークロードを実行するには、最長 90 日間のコンピューティング リソースを リクエストします。その期間は予約済みリソース に排他的にアクセスでき、リソースを使用して VM またはクラスタを作成できます。予約期間の終了時に、Compute Engine は次の処理を行います。
- Compute Engine は予約を削除します。
- VM に指定した 終了アクション に基づいて、Compute Engine は予約を使用する VM を停止または削除します。
適しているワークロード
- 事前トレーニングとファインチューニング
- 大規模なシミュレーションと推論
主な特徴
- プロビジョニング モデル: 予約で制限。
- マシンシリーズのサポート: A4、A3 Ultra、A3 Mega、A3 High(8 個の GPU) マシンタイプを予約します。
- スケーラビリティの上限: 最長 90 日間、最大 80 個の VM を予約します。
- 最適化されたプロビジョニング: 予約で制限されたモデルを使用して、GPU を取得できる 可能性を高めます。
Flex Start を使用する
最長 7 日間、密な割り当てのリソースが必要な場合は、クラスタ化されたマネージド インスタンス グループ(MIG)のサイズ変更リクエストに Flex Start を使用します。
適しているワークロード
Flex Start VM は、次のような、いつでも開始できるワークロードの実行に最適です。
- 小規模モデルの事前トレーニング
- モデルのファインチューニング
- ハイ パフォーマンス コンピューティング(HPC)シミュレーション
- バッチ推論
主な特徴
- プロビジョニング モデル: Flex Start。
- リソース割り当て: MIG サイズ変更リクエスト用に密に割り当てられます。
- 費用対効果: A4、A3、A2、G4 マシンシリーズの vCPU、メモリ、GPU、 接続されているローカル SSD ディスクで最大 53% の割引を受けられます。サポートされている他のマシンシリーズには、標準のオンデマンド料金 が適用されます。
スポットを使用
Compute Engine が VM をプリエンプトして容量を再利用できることを理解したうえで、密に割り当てられたフォールト トレラントなワークロードに Spot VM を使用して大幅な割引を実現できます。
適しているワークロード
- フォールト トレラントな分散トレーニング
- バッチ処理
主な特徴
- プロビジョニング モデル: スポット。
- プリエンプション: Compute Engine はいつでもインスタンスをプリエンプトできます。
- 費用対効果: vCPU、メモリ、GPU、 接続されているローカル SSD ディスクで最大 91% の割引を受けられます。
次のステップ
- ワークロードのニーズを特定するには、ワークロードのニーズ を特定するをご覧ください。
- 予約を作成して使用するには、予約を作成して使用する をご覧ください。
- Spot VM の詳細については、Spot VM の詳細を確認するをご覧ください。
- オンデマンド VM インスタンスを作成するには、オンデマンド VM インスタンスを作成するをご覧ください。