MIG 内の TPU インスタンス

マネージド インスタンス グループ(MIG)は、VM のコレクションの作成、構成、ライフサイクル管理を自動化します。MIG は、自動修復とリージョン(マルチゾーン)デプロイによる高可用性、変動する負荷に対応する自動スケーリング、アプリケーションのローリング アップデートの簡素化などのメリットを提供します。詳細については、マネージド インスタンス グループをご覧ください。

MIG を使用して、TPU バージョン v5p、v6e、TPU7x の TPU VM を作成して管理できます。単一の TPU VM を使用した MIG、独立した TPU VM(単一ホスト スライスとも呼ばれます)、相互接続された TPU VM を使用した MIG(マルチホスト スライスとも呼ばれます)を作成できます。

単一ホスト MIG の各スライスには、最大で 1 つの TPU VM があります。MIG 内の TPU VM は、チップ間相互接続(ICI)リンクで接続されていません。

マルチホスト スライスには、ICI リンクで相互接続された複数の TPU VM が含まれています。

単一ホスト TPU スライスを含む MIG

複数の独立した TPU インスタンスを含むマネージド インスタンス グループ(MIG)を作成することは、複数の個々の TPU VM を必要とするが、分散ワークロード用に ICI リンクで相互接続する必要がないワークロードに役立ちます。次に例を示します。

  • 推論サービング: MIG の各 VM は、推論リクエストを個別に処理できます。MIG を使用すると、需要に基づいてサービング インスタンスの数をスケーリングし、グループとして管理できます。
  • 並列独立タスク: MIG は、単一の TPU VM で並列実行できる多くの小さな独立したトレーニング ジョブやその他の計算を管理する方法を提供します。
  • 管理: MIG には次の機能があります。
    • デプロイ: インスタンス テンプレートを 1 回定義し、MIG を使用して複数の同一の TPU VM を作成します。
    • スケーラビリティ: MIG のサイズを変更して、TPU VM の数を調整します。
    • ローリング アップデート: すべての VM でソフトウェアまたはマシンタイプを制御された方法で更新します。
  • 費用対効果: 大規模な TPU スライスのフルパワーや相互接続を必要としないタスクでは、複数の小規模で独立した TPU スライスを使用する方が費用対効果が高くなることがあります。

詳細については、単一ホスト TPU スライスで MIG を作成するをご覧ください。

マルチホスト スライスを含む MIG

独立した TPU スライスのグループとは異なり、マルチホスト スライス用に構成された MIG は、ICI リンクを介して緊密に結合された TPU VM のセットを管理します。これにより、単一の論理 TPU スライスが作成されます。

特典とパフォーマンス

マルチホスト TPU スライスの MIG は、負荷の高い ML ワークロードに必要なスケールとパフォーマンスを提供します。

  • 分散トレーニング: 機械学習モデルのトレーニングでは、単一の TPU VM で提供できるよりも多くの TPU 能力が必要になることがよくあります。大規模な TPU スライスでは、ICI リンクによって多くの TPU チップと VM 間の高速通信が可能になり、計算が分散されます。これはトレーニングのパフォーマンスにとって非常に重要です。
  • 高い相互接続帯域幅: ICI ネットワークは、標準のデータセンター ネットワーク(DCN)よりも、スライス内の TPU チップ間の帯域幅が広く、レイテンシが低くなります。これは、大規模なモデル トレーニングで一般的な同期オペレーションに不可欠です。

アトミック ライフサイクル オペレーション

相互接続されたトポロジの完全性を確保するため、MIG はライフサイクル全体を通じてスライス全体を単一の不可分な単位として管理します。

  • 作成: スライス内のすべての VM がまとめてプロビジョニングされます。リクエストされたトポロジ全体に対して十分な正常な相互接続容量が利用できない場合、スライスは作成されません。
  • 削除: MIG はスライス全体をユニットとして削除します。
  • サイズ変更: サイズ変更は、0 からフルスライス サイズへのスケーリング、またはフルスライス サイズから 0 へのスケーリングに制限されます。マルチ VM スライスのサイズを部分的に変更することはできません。

設定要件

マルチホスト MIG を構成するには、物理相互接続トポロジと個々のインスタンス プロパティの両方を定義する必要があります。

  • ワークロード ポリシー: accelerator-topology パラメータ(4x4、8x8、4x4x4 など)を使用してワークロード ポリシーを指定する必要があります。これにより、インスタンスを相互接続された単一のスライスとして扱うように MIG が構成されます。トポロジについては、システム アーキテクチャをご覧ください。
  • インスタンス テンプレート: スライス内の各 VM のマシンタイプ、ディスク イメージ、その他の設定などのプロパティを定義します。

スライスの可用性と障害復旧

MIG を使用してマルチホスト TPU スライスを作成する場合、障害復旧の動作は、使用するプロビジョニング モデルと予約モードによって異なります。

  • MIG がオンデマンド、Flex Start、または予約(全容量モードの予約を除く)を使用している場合。このシナリオでは、Compute Engine がスライスの復元プロセスを自動的に管理します。ホストまたは ICI の障害が発生すると、スライスは REACTIVATING 状態に移行します。スライス内のすべての VM が REPAIRING 状態に移行します(必ずしも同時に移行するとは限りません)。Compute Engine は、正常な容量で VM を一緒に再起動して、スライスを自動的に復元します。

  • MIG が Spot プロビジョニング モデルを使用している場合。このシナリオでは、スライス復元プロセスの管理を担当します。Spot VM のプリエンプションが発生すると、Compute Engine はスライスのすべてのインスタンスを終了します。スライスが FAILED 状態に移行し、VM が TERMINATED 状態に移行します。失敗した状態から復元するには、手動でスライスを再作成する必要があります。

  • MIG が All Capacity モードで予約を使用している場合。このシナリオでは、スライスの復元プロセスを管理する必要があります。障害が発生すると、スライスは FAILED 状態に移行し、手動でスライスを再作成する必要があります。

    All Capacity モードの動作は、次の要素にも左右されます。

    • ホストの障害または障害のある VM の報告。影響を受ける VM は REPAIRING 状態に移行します。基盤となるハードウェアが修正されると、VM は RUNNING 状態に戻ります。
    • 緊急メンテナンスが予定されています。メンテナンス イベントを手動で開始すると、VM は RUNNING 状態から REPAIRING 状態に移行します。メンテナンスが終了すると、VM は RUNNING 状態に戻ります。
    • ICI の失敗。VM は RUNNING 状態のままですが、スライス状態は FAILED 状態に移行します。

Spot VM のプリエンプション後、または全容量モードでの障害後にスライスを再作成するには、次のいずれかを行う必要があります。

  • MIG を削除して再作成します。
  • MIG のサイズを 0 に変更し、必要なサイズに増やします。

インスタンスの中断からの障害復旧

TPU インスタンスを削除または停止した場合、またはオペレーティング システム内からインスタンスを停止した場合、スライスは FAILED 状態に移行します。このシナリオでは、スライスを再作成するまで、スライスは FAILED 状態のままになります。スライスを再作成するには、MIG を削除して再作成するか、MIG のサイズを 0 に変更してからサイズを増やす必要があります。

スライスの状態の詳細については、TPU スライスのステータスを表示するをご覧ください。

制限事項

以降のセクションでは、TPU VM を使用して MIG を作成する場合の制限事項について説明します。

インスタンス テンプレートの制限事項

TPU マシンタイプを指定するインスタンス テンプレートには、次の制限事項があります。

  • 予約にバインドされたプロビジョニング モデルを使用する場合は、インスタンスの終了アクションを削除に設定する必要があります。

  • TPU は、明示的にターゲット設定された予約のみを使用できます。

  • プレースメント ポリシーは指定できません。

  • 次のような場合は、自動再起動を無効にしないでください。

    • 標準、Flex Start、または予約で制限されたプロビジョニング モデル(All Capacity モードを含む)を使用するマルチホスト スライス。

    • All Capacity モードで予約にバインドされたプロビジョニング モデルを使用する単一ホスト。

  • Spot プロビジョニング モデルを使用する場合は、自動再起動を有効にしないでください。

MIG の制限事項

TPU を使用する MIG には次の制限があります。

  • ライフサイクル オペレーション: TPU インスタンスの停止、起動、再開、一時停止はできません。再起動が必要な構成を変更する場合や、課金を停止する場合は、インスタンスを削除する必要があります。

  • リージョン MIG のゾーン分配: ターゲット分配形態を ANY_SINGLE_ZONE に設定する必要があります。

  • MIG での構成の更新:

    • 定義されたアクセラレータ トポロジのため、マルチホスト TPU スライスを形成する MIG を更新することはできません。
    • 自動または選択的方法を使用して、単一ホスト TPU スライスを形成する MIG を更新できます。ただし、単一ホスト TPU スライスの更新では、再起動(RESTART)アクションはサポートされていません。再起動が必要で、許容される最も大がかりなアクションが置換(REPLACE)の場合、Updater はインスタンスを置き換えます。それ以外の場合、更新の試行はエラーで失敗します。
  • マルチホスト TPU スライスを形成する MIG には、次の制限も適用されます。

    • 目標サイズ ポリシー: 目標サイズ ポリシーモードを BULK に設定する必要があります。このモードを設定すると、変更できません。

    • ターゲット サイズ: バルクモードでは、ターゲット サイズを 0 またはアクセラレータ トポロジの形成に必要なインスタンス数に設定できます。

    • ワークロード ポリシー: アクセラレータ トポロジが定義されているワークロード ポリシーを指定する必要があります。ワークロード ポリシーを設定すると、MIG からポリシーを変更または削除できなくなります。

    • MIG によって開始された修復: defaultActionOnFailure フィールドを DO_NOTHING に設定して、MIG によって開始された修復をオフにする必要があります。この構成では、MIG は障害が発生したインスタンスに対してアクションを行いません。Compute Engine は、健全な容量で同じスライスのすべてのインスタンスを再起動することで、障害が発生したインスタンスを自動的に復元します。

  • サポートされていない機能: TPU を使用する MIG は、次の機能をサポートしていません。

次のステップ