AI Hypercomputer の消費オプション

AI Hypercomputer には、コンピューティング リソースを取得するための使用オプションがいくつか用意されています。これらのオプションは、ワークロードの期間、フォールト トレランス、インフラストラクチャ モデルなどのニーズに対応します。これらのオプションについて学習し、ユースケースに最適なオプションを選択してください。

手動評価の代わりに、 Google Cloud コンソール で Gemini にプロンプトを表示して、ワークロードと予算の使用オプションを比較できます。詳細については、 Compute Advisor を使用して AI インフラストラクチャを設計するをご覧ください。

使用オプションの概要

主な特性で使用オプションを比較するには、次の表を使用します。

使用オプション プロビジョニング モデル 最適な用途 容量保証 存続期間 プリエンプティブル Quota 割引 割り当てモデル
Flex Start Flex Start 容量を待機できる最長 7 日間の短期間のワークロード。 ベスト エフォート 最長 7 日間 いいえ プリエンプティブル割り当て サポートされているシリーズで割引(最大 53%) MIG サイズ変更リクエストの場合は Dense。スタンドアロン VM の場合はベスト エフォート。
Spot VM スポット フォールト トレラントな短期間の汎用 GPU ワークロード。 ベスト エフォート プリエンプティブル はい プリエンプティブル割り当て 大幅な割引(最大 91%) 標準
標準の予約 標準 容量の確実性が非常に高いことを必要とする重要な汎用 GPU ワークロード。 非常に高い 非常に高い ユーザー定義 いいえ 割り当ては消費されません 確約利用割引(CUD)による割引料金
容量ブロックの将来の予約 予約で制限 クラスタ化された GPU での大規模な長時間実行トレーニング。 非常に高い 予約期間内は無制限。 いいえ 自動的に増加 CUD で割引(最大 53%) Dense
カレンダー モードの将来の予約 予約で制限 予約済み容量を必要とする最長 90 日間のクラスタ化された GPU ワークロード。 非常に高い 最長 90 日間 いいえ 割り当ては消費されません 割引(最大 53%) Dense
オンデマンド VM 標準 特定の期間のない汎用 GPU ワークロード。 ベスト エフォート 無制限 いいえ オンデマンドの割り当て なし(従量課金制) 標準

インフラストラクチャのデプロイに使用する使用オプションは、一般的な GPU を使用するか、クラスタ化された GPU を使用するかによって異なります。

  • 一般的な GPU: 小規模な 推論、開発、小規模なトレーニング ワークロード向けに設計されています。このタイプの GPU は、非同期メンテナンスにより運用上の柔軟性を提供します。利用可能なオプションを表示するには、一般的な GPU の使用オプションをご覧ください

  • クラスタ化された GPU: 大規模で 緊密に結合されたトレーニング ワークロード、大規模な推論、RL、 推論モデル ワークロード向けに設計されています。これらのワークロードでは、ネットワーク レイテンシを最小限に抑えるために、高い容量保証と密な リソース割り当てが必要です。利用可能な オプションを表示するには、クラスタ化された GPU の 使用オプションをご覧ください

一般的な GPU の使用オプション

一般的な GPU の容量を取得するには、次の使用オプションを使用します。

Flex Start を使用する

リソースの密な割り当てを必要とする短期間のワークロードを実行するには、Flex Start を使用して最大 7 日間のコンピューティング リソースをリクエストできます。リソースが使用可能になると、 Compute Engine はリクエストされた数の VM を作成します。スタンドアロンの Flex Start VM は停止できますが、マネージド インスタンス グループ(MIG)がサイズ変更リクエストで作成した Flex Start VM は停止できません。Flex Start VM は、ユーザーが削除するか、Compute Engine が実行期間の終了時に VM を削除するまで存在します。

適しているワークロード

  • 小規模モデルの事前トレーニング
  • モデルのファインチューニング
  • ハイ パフォーマンス コンピューティング(HPC)シミュレーション
  • バッチ推論

主な特徴

  • プロビジョニング モデル: Flex Start。
  • 幅広いハードウェア サポート: A4X Max と A4X を除く任意のクラスタ化された GPU マシンタイプをリクエストします。
  • レイテンシの最適化: コンパクト プレースメント ポリシーをスタンドアロン VM に適用して、 ネットワーク レイテンシを最小限に抑えます。
  • 費用対効果: A4、A3、A2、G4 マシンシリーズの vCPU、メモリ、GPU、 ローカル SSD ディスクで最大 53% の割引を受けられます。サポートされている他のシリーズには、標準のオンデマンド料金が適用されます。詳細については、Flex Start の料金をご覧ください。

スポットを使用

フォールト トレラントなワークロードを実行するには、可用性に基づいて コンピューティング リソースをすぐに取得できます。リソースを可能な限り低価格で取得できます。ただし、Compute Engine は いつでも VM をプリエンプトして容量を再利用できます。

適しているワークロード

  • バッチ処理とデータ分析
  • ハイ パフォーマンス コンピューティング(HPC)とメディア エンコード

主な特徴

  • プロビジョニング モデル: スポット。
  • 幅広いハードウェア サポート: A4X Max と A4X を除く任意のクラスタ化された GPU マシンタイプをリクエストします。
  • レイテンシの最適化: コンパクト プレースメント ポリシーをスタンドアロン VM に適用して、 ネットワーク レイテンシを最小限に抑えます。
  • 費用対効果: vCPU、メモリ、GPU、 ローカル SSD ディスクで最大 91% の割引を受けられます。

オンデマンドを使用

ヒント: 一般的な GPU 容量を取得できる可能性を高めるには、Flex Start またはスポットを使用します。これらの 使用オプションでは、オンデマンド料金と比較して GPU が割引料金で提供されます。また、GPU などの需要の高いリソースを取得できる可能性を高めるように設計されています。

特定の期間のないワークロードを実行するには、可用性に基づいてコンピューティング リソースをすぐに取得できます。 VM は、停止または削除するまで実行されます。

適しているワークロード

  • 推論とモデル提供
  • プロトタイピングと試験運用

主な特徴

  • プロビジョニング モデル: 標準。
  • 即時利用可能: 容量のスケジューリングや承認を待たずに、VM インスタンスをすぐに作成できます。
  • 標準料金: 長期的なコミットメントなしで、標準のオンデマンド料金でリソースの料金を支払います。
  • 幅広いハードウェア サポート: 一般的な GPU パスでサポートされている任意の GPU マシンシリーズで使用します。

標準の予約を使用する

容量の確実性が非常に高い ことを必要とする重要な汎用 GPU ワークロードを実行するには、標準の予約を使用します。

適しているワークロード

  • 重要な本番環境ワークロード
  • 確約された容量を必要とするワークロード

主な特徴

  • プロビジョニング モデル: 標準。
  • 容量保証: リソースが利用可能であるという非常に高い保証を提供します。
  • 料金: 標準料金が適用されますが、CUD を適用して費用を削減できます。

クラスタ化された GPU の使用オプション

クラスタ化された GPU の容量を取得するには、次の使用オプションを使用します。

容量ブロックの将来の予約を使用する

リソースの密な割り当てを必要とする大規模な長時間実行分散ワークロードを実行するには、 特定の期間のコンピューティング リソースをリクエストします。その期間は 予約済みリソースに排他的にアクセスでき、リソースを使用して VM または クラスタを作成できます。予約期間の終了時に、Compute Engine は次の処理を行います。

  • Compute Engine は予約を削除します。
  • VM に指定した 終了アクション に基づいて、Compute Engine は予約を使用する VM を停止または削除します。

適しているワークロード

  • 基盤モデルの事前トレーニング
  • 複数のホストにわたる基盤モデルの推論

主な特徴

  • プロビジョニング モデル: 予約で制限。
  • プレミアム マシンのサポート: A4X Max、A4X、A4、A3 Ultra、A3 Mega、A3 High(8 個の GPU)マシンタイプを予約します。
  • コミットメントの要件: 1 年以上の予約には、リソースベースのコミットメントを適用します。
  • 動的な変更: ハードウェア緊急メンテナンス通知を有効にします 期間の開始後に、Vertex AI ジョブの使用状況に関する通知を有効にします。

カレンダー モードで将来の予約を使用する

リソースの密な割り当てを必要とする短時間実行の分散ワークロードを実行するには、最長 90 日間のコンピューティング リソースを リクエストします。その期間は予約済みリソース に排他的にアクセスでき、リソースを使用して VM またはクラスタを作成できます。予約期間の終了時に、Compute Engine は次の処理を行います。

  • Compute Engine は予約を削除します。
  • VM に指定した 終了アクション に基づいて、Compute Engine は予約を使用する VM を停止または削除します。

適しているワークロード

  • 事前トレーニングとファインチューニング
  • 大規模なシミュレーションと推論

主な特徴

  • プロビジョニング モデル: 予約で制限。
  • マシンシリーズのサポート: A4、A3 Ultra、A3 Mega、A3 High(8 個の GPU) マシンタイプを予約します。
  • スケーラビリティの上限: 最長 90 日間、最大 80 個の VM を予約します。
  • 最適化されたプロビジョニング: 予約で制限されたモデルを使用して、GPU を取得できる 可能性を高めます。

Flex Start を使用する

最長 7 日間、密な割り当てのリソースが必要な場合は、クラスタ化されたマネージド インスタンス グループ(MIG)のサイズ変更リクエストに Flex Start を使用します。

適しているワークロード

Flex Start VM は、次のような、いつでも開始できるワークロードの実行に最適です。

  • 小規模モデルの事前トレーニング
  • モデルのファインチューニング
  • ハイ パフォーマンス コンピューティング(HPC)シミュレーション
  • バッチ推論

主な特徴

  • プロビジョニング モデル: Flex Start。
  • リソース割り当て: MIG サイズ変更リクエスト用に密に割り当てられます。
  • 費用対効果: A4、A3、A2、G4 マシンシリーズの vCPU、メモリ、GPU、 接続されているローカル SSD ディスクで最大 53% の割引を受けられます。サポートされている他のマシンシリーズには、標準のオンデマンド料金 が適用されます。

スポットを使用

Compute Engine が VM をプリエンプトして容量を再利用できることを理解したうえで、密に割り当てられたフォールト トレラントなワークロードに Spot VM を使用して大幅な割引を実現できます。

適しているワークロード

  • フォールト トレラントな分散トレーニング
  • バッチ処理

主な特徴

  • プロビジョニング モデル: スポット。
  • プリエンプション: Compute Engine はいつでもインスタンスをプリエンプトできます。
  • 費用対効果: vCPU、メモリ、GPU、 接続されているローカル SSD ディスクで最大 91% の割引を受けられます。

次のステップ