AI Hypercomputer には、コンピューティング リソースを取得するための複数の消費オプションがあります。これらのオプションは、ワークロードの期間、フォールト トレランス、インフラストラクチャ モデルなどのニーズに対応します。これらのオプションについて学習し、ユースケースに最適なオプションを選択します。
使用オプションの概要
主な特性で消費オプションを比較するには、次の表を使用します。
| 使用オプション | プロビジョニング モデル | 最適な用途 | 容量保証 | 存続期間 | プリエンプティブル | 割り当て | 割引 | 割り当てモデル |
|---|---|---|---|---|---|---|---|---|
| Flex Start | Flex Start | 容量を待機できる、最大 7 日間の短期間のワークロード。 | ベスト エフォート | 最長 7 日間 | × | プリエンプティブル割り当て | サポートされているシリーズで割引(最大 53%) | MIG のサイズ変更リクエストの場合は密、スタンドアロン VM の場合はベスト エフォート。 |
| Spot VM | スポット | フォールト トレラントで短時間の一般的な GPU ワークロード。 | ベスト エフォート | プリエンプティブル | ○ | プリエンプティブル割り当て | 大幅な割引(最大 91%) | 標準 |
| 標準の純広告 | 標準 | 容量の確実性が非常に高いレベルで求められる重要な汎用 GPU ワークロード。 | 非常に高い | 非常に高い | ユーザー定義 | × | 割り当てが消費されていない | 確約利用割引(CUD)による割引料金 |
| 容量ブロックの将来の予約 | 予約で制限 | クラスタ化された GPU での大規模な長時間実行トレーニング。 | 非常に高い | 予約期間内は無制限。 | × | 自動的に増加 | CUD で割引(最大 53%) | Dense |
| カレンダー モードの将来の予約 | 予約で制限 | 予約容量を必要とするクラスタ化された GPU ワークロード(最大 90 日間)。 | 非常に高い | 最長 90 日間 | × | 割り当てが消費されていない | 割引(最大 53%) | Dense |
| オンデマンド VM | 標準 | 特定の期間のない一般的な GPU ワークロード。 | ベスト エフォート | 無制限 | × | オンデマンド割り当て | なし(従量課金制) | 標準 |
インフラストラクチャのデプロイに使用する消費オプションは、汎用 GPU を使用するか、クラスタ GPU を使用するかによって異なります。
汎用 GPU: 小規模な推論、開発、小規模なトレーニング ワークロード向けに設計されています。このタイプの GPU は、非同期メンテナンスを通じて運用の柔軟性を提供します。使用可能なオプションを確認するには、汎用 GPU の使用オプションをご覧ください。
クラスタ化された GPU: 大規模で密結合されたトレーニング ワークロードと、高容量の保証と高密度のリソース割り当てを必要とする大規模な推論、RL、推論モデルのワークロード向けに設計されており、ネットワーク レイテンシを最小限に抑えます。使用可能なオプションを表示するには、クラスタ化された GPU の使用オプションをご覧ください。
汎用 GPU の使用オプション
次の使用オプションを使用して、汎用 GPU の容量を取得します。
Flex Start を使用する
リソースの密な割り当てを必要とする短期間のワークロードを実行するには、Flex Start を使用して最大 7 日間のコンピューティング リソースをリクエストできます。リソースが使用可能になると、Compute Engine はリクエストされた数の VM を作成します。スタンドアロンの Flex Start VM は停止できますが、マネージド インスタンス グループ(MIG)がサイズ変更リクエストで作成した Flex Start VM は停止できません。Flex Start VM は、ユーザーが削除するか、Compute Engine が実行期間の終了時に VM を削除するまで存在します。
適しているワークロード
- 小規模モデルの事前トレーニング
- モデルのファインチューニング
- ハイ パフォーマンス コンピューティング(HPC)シミュレーション
- バッチ推論
主な特徴
- プロビジョニング モデル: Flex Start。
- 広範なハードウェア サポート: A4X Max と A4X を除く任意のクラスタ化 GPU マシンタイプをリクエストします。
- レイテンシの最適化: コンパクト プレースメント ポリシーをスタンドアロン VM に適用して、ネットワーク レイテンシを最小限に抑えます。
- 費用対効果: A4、A3、A2、G4 マシンシリーズの vCPU、メモリ、GPU、ローカル SSD ディスクで最大 53% の割引が適用されます。他のサポート対象シリーズには、標準のオンデマンド料金が適用されます。詳細については、Flex-start の料金をご覧ください。
スポットを使用する
フォールト トレラントなワークロードを実行するには、可用性に基づいてコンピューティング リソースをすぐに取得できます。リソースを可能な限り低価格で取得できます。ただし、Compute Engine はいつでも VM をプリエンプトして容量を再利用できます。
適しているワークロード
- バッチ処理とデータ分析
- ハイ パフォーマンス コンピューティング(HPC)とメディア エンコード
主な特徴
- プロビジョニング モデル: Spot。
- 広範なハードウェア サポート: A4X Max と A4X を除く任意のクラスタ化 GPU マシンタイプをリクエストします。
- レイテンシの最適化: コンパクト プレースメント ポリシーをスタンドアロン VM に適用して、ネットワーク レイテンシを最小限に抑えます。
- 費用対効果: vCPU、メモリ、GPU、ローカル SSD ディスクで最大 91% の割引が適用されます。
オンデマンドを使用
ヒント: 汎用 GPU 容量を取得できる可能性を高めるには、Flex Start または Spot を使用します。これらの消費オプションでは、オンデマンド料金と比較して GPU が割引価格で提供されます。また、GPU などの需要の高いリソースを取得できる可能性を高めるように設計されています。
特定の期間のないワークロードを実行するには、可用性に基づいてコンピューティング リソースをすぐに取得できます。VM は、ユーザーが停止または削除するまで実行されます。
適しているワークロード
- 推論とモデル提供
- プロトタイピングと試験運用
主な特徴
- プロビジョニング モデル: 標準。
- すぐに利用可能: 容量のスケジュール設定や承認を待たずに、VM インスタンスをすぐに作成します。
- 標準料金: 長期契約なしで、標準のオンデマンド料金でリソースの料金を支払います。
- 幅広いハードウェア サポート: 一般的な GPU パスで、サポートされている任意の GPU マシンシリーズで使用します。
標準予約を使用する
容量の確実性が非常に高い重要な汎用 GPU ワークロードを実行するには、標準予約を使用します。
適しているワークロード
- 重要な本番環境ワークロード
- 保証された容量を必要とするワークロード
主な特徴
- プロビジョニング モデル: 標準。
- 容量の保証: リソースが利用可能であることを保証します。
- 料金: 標準料金が適用されますが、CUD を適用して費用を削減できます。
クラスタ化された GPU の使用オプション
次の使用オプションを使用して、クラスタ化された GPU の容量を取得します。容量ブロックの将来の予約を使用する
リソースの密な割り当てを必要とする大規模な長時間実行分散ワークロードを実行するには、将来の特定の時間にコンピューティング リソースをリクエストします。この期間中、予約したリソースに排他的にアクセスできます。また、リソースを使用して VM またはクラスタを作成できます。予約期間の終了時に、Compute Engine は次の処理を行います。
- Compute Engine が予約を削除します。
- VM に指定した終了アクションに基づいて、Compute Engine は予約を使用している VM を停止または削除します。
適しているワークロード
- 基盤モデルの事前トレーニング
- 複数のホストにまたがる基盤モデルの推論
主な特徴
- プロビジョニング モデル: 予約にバインド。
- プレミアム マシンのサポート: A4X Max、A4X、A4、A3 Ultra、A3 Mega、A3 High(GPU 数 8)マシンタイプを予約します。
- コミットメントの要件: 1 年以上の予約にリソースベースのコミットメントを関連付けます。
- 動的な変更: 期間の開始後に Vertex AI ジョブの使用状況に関するハードウェア緊急メンテナンス通知を有効にします。
カレンダー モードで将来の予約を使用する
リソースの密な割り当てを必要とする短時間実行の分散ワークロードを実行するには、最大 90 日間のコンピューティング リソースをリクエストできます。この期間中、予約済みリソースに排他的にアクセスし、リソースを使用して VM またはクラスタを作成できます。予約期間の終了時に、Compute Engine は次の処理を行います。
- Compute Engine が予約を削除します。
- VM に指定した終了アクションに基づいて、Compute Engine は予約を使用している VM を停止または削除します。
適しているワークロード
- 事前トレーニングとファインチューニング
- 大規模なシミュレーションと推論
主な特徴
- プロビジョニング モデル: 予約にバインド。
- マシンシリーズのサポート: A4、A3 Ultra、A3 Mega、A3 High(8 個の GPU)マシンタイプを予約します。
- スケーラビリティの上限: 最大 90 日間、最大 80 個の VM を予約します。
- 最適化されたプロビジョニング: 予約バインド モデルを使用して、GPU を取得できる可能性を高めます。
Flex Start を使用する
最大 7 日間リソースの密な割り当てが必要な場合は、クラスタ化されたマネージド インスタンス グループ(MIG)のサイズ変更リクエストに Flex Start を使用します。
適しているワークロード
Flex Start VM は、次のような、いつでも開始できるワークロードの実行に最適です。
- 小規模モデルの事前トレーニング
- モデルのファインチューニング
- ハイ パフォーマンス コンピューティング(HPC)シミュレーション
- バッチ推論
主な特徴
- プロビジョニング モデル: Flex Start。
- リソース割り当て: MIG のサイズ変更リクエストに対して高密度で割り当てられます。
- 費用対効果: A4、A3、A2、G4 マシンシリーズの vCPU、メモリ、GPU、アタッチされたローカル SSD ディスクに対して最大 53% の割引が適用されます。他のサポート対象シリーズには、標準のオンデマンド料金が適用されます。
スポットを使用する
Compute Engine が容量を再利用するために VM をプリエンプトできることを理解したうえで、高密度に割り当てられたフォールト トレラントなワークロードに Spot VM を使用すると、大幅な割引が適用されます。
適しているワークロード
- フォールト トレラントな分散トレーニング
- バッチ処理
主な特徴
- プロビジョニング モデル: Spot。
- プリエンプション: Compute Engine はいつでもインスタンスをプリエンプトできます。
- 費用対効果: vCPU、メモリ、GPU、接続されているローカル SSD ディスクで最大 91% の割引が適用されます。
次のステップ
- ワークロードのニーズを特定するには、ワークロードのニーズを特定するをご覧ください。
- 予約を作成して使用するには、予約を作成して使用するをご覧ください。
- Spot VM の詳細については、Spot VM の詳細をご覧ください。
- オンデマンド VM インスタンスを作成するには、オンデマンド VM インスタンスを作成するをご覧ください。