TPU インスタンスの障害復旧

ワークロードの実行を維持するため、Compute Engine はハードウェアとアプリケーションの障害から TPU インスタンスとスライスを復元します。

障害復旧の動作は、容量モードによって異なります。

  • マネージド容量モード(オンデマンド、Flex Start、標準予約): Compute Engine は、正常なハードウェアで TPU インスタンスとスライスを再起動して自動的に復元します。
  • All Capacity モード(All Capacity モードの予約): TPU スライスの復元を管理します。ハードウェア障害は、インスタンスを新しいハードウェアに自動的に再配置することなく、既存のホストで修復されます。

マルチホスト スライスの復元要件

マルチホスト TPU スライスでは、スライス内のすべてのインスタンスをまとめて復元または再スケジュールする必要があります。Compute Engine がマネージド容量モードで復元を自動的に処理するか、すべての容量モードでスライスを手動で復元するかに関係なく、スライス内の個々のインスタンスのスケジュールを変更することはできません。

マルチホスト スライスのインスタンスは、チップ間相互接続(ICI)で接続されます。場合によっては、光回路スイッチ(OCS)で接続されます。マルチホスト スライスをプロビジョニングすると、Compute Engine は TPU インスタンスを作成し、ICI ネットワークを有効にします。スライスのネットワーク トポロジは、ワークロード ポリシーでアクセラレータ トポロジを設定して指定します。ワークロードが開始すると、基盤となる TPU ソフトウェア レイヤである LibTPU がネットワーク トポロジを初期化します。デフォルトでは、XLA コンパイラはモデルのオペレーションをこのトポロジに静的にマッピングします。

インスタンスまたはネットワーク リンクが失敗すると、物理ハードウェアがマッピングされたトポロジと一致しなくなります。その結果、システムがスライス内のすべてのインスタンスを再作成または再スケジュールしてネットワーク トポロジを再構成するまで、XLA コンパイラはワークロードを実行できません。

マネージド容量モードでの障害復旧

マネージド容量モード(オンデマンド、Flex Start、標準予約を含む)では、Compute Engine は正常なハードウェアで TPU インスタンスとスライスを再起動することで、ハードウェアとホストの障害から自動的に復旧します。

単一ホスト TPU スライスの自動復元

単一ホスト スライスは独立した TPU インスタンスです。デフォルトでは、Compute Engine は正常なハードウェアでインスタンスを再起動して、障害が発生したインスタンスを自動的に復元します。この動作は自動再起動の設定によって制御されます。この設定は、Spot VM を除くインスタンスの作成時にデフォルトで有効になっています。自動再起動を無効にすると、インスタンス障害が発生した場合にインスタンスが TERMINATED 状態になります。詳細については、自動再起動をご覧ください。

Compute Engine は、次のようなシナリオで障害が発生したインスタンスを自動的に復元します。

  • 物理マシンの応答停止、ホストのシャットダウン、ホストの再起動、ホストの停電が原因で発生したホストのタイムアウトまたはエラー
  • ユーザーまたは Google によって開始された物理ホスト メンテナンス イベント
  • ホスト内のチップ間相互接続(ICI)の障害
  • VM のクラッシュ

Compute Engine は、次のような計画的な終了のシナリオでインスタンスを自動的に復元しません。

  • インスタンスの削除
  • 予約の削除または有効期限切れ
  • Spot VM のプリエンプション

単一ホスト スライスでの MIG による修復

単一ホスト スライスを含む MIG で、ハードウェア障害や Spot VM のプリエンプションなどの外部イベントにより、単一ホスト スライス内の TPU インスタンスが TERMINATED 状態になると、MIG はデフォルトでインスタンスを修復します。修復中、MIG は同じ名前のインスタンスを再作成します。修復をオフにすると、この修復メカニズムを無効にできます。

シングルホスト スライスを含む MIG でアプリケーション ベースのヘルスチェックを設定することもできます。ヘルスチェックでアプリケーションが応答していないことが検出されると、MIG はインスタンスを異常とマークし、インスタンスを再作成して自動修復します。

詳細については、高可用性のための VM の修復についてとアプリケーションのヘルスチェックと自動修復を設定するをご覧ください。

マルチホスト スライスの自動復元

オンデマンド、Flex Start、または予約の消費モデルを使用するマネージド モードの TPU の場合、Compute Engine はマルチホスト スライス内の障害が発生したインスタンスを自動的に復元します。

復元中、Compute Engine はネットワーク トポロジを形成できる TPU マシンのセットを特定し、スライス内のすべてのインスタンスをこれらのマシンで同時に再起動して、ネットワークを再構成します。このプロセスでは、ハードウェアの修理を待つのではなく、使用可能な健全なハードウェアでトポロジを再作成することで、ダウンタイムを最小限に抑えます。

復元プロセスとスライス状態

自動復元中、スライスは次の状態に移行します。

  1. スライスが REACTIVATING 状態に移行します。
  2. スライス内のすべてのインスタンスが REPAIRING 状態に移行します(必ずしも同時に移行するとは限りません)。
  3. Compute Engine は、スライス内のすべてのインスタンスを正常なハードウェアで同時に再起動します。

TPU スライスの状態の詳細については、アクセラレータ トポロジの状態をご覧ください。

マネージド容量モードで手動スライス復元が必要なシナリオ

Compute Engine は、次のシナリオではマルチホスト スライスを自動的に復元できません。

  • Spot VM のプリエンプト: スライスのインスタンスがプリエンプトされると、Compute Engine はスライスのすべてのインスタンスを終了し、スライスは FAILED 状態になります。
  • ユーザーが開始した中断: TPU インスタンスを停止または削除した場合、またはオペレーティング システム内からインスタンスを停止した場合、スライスは FAILED 状態になります。スライスは、再作成するまで FAILED 状態のままになります。

このようなシナリオでは、スライスを手動で復元する必要があります。

All Capacity モードでの障害復旧

All Capacity モードでは、TPU スライスの復元プロセスを管理する必要があります。マネージド容量モードとは異なり、Compute Engine は、障害が発生した TPU インスタンスまたはマルチホスト スライスを新しい物理ハードウェアに自動的に再配置しません。Google は、既存のホストで障害が発生した基盤となるハードウェアを修理します。お客様は、予約で確保した正常なスペア ハードウェアに異常なスライスを再スケジュールする必要があります。

ホストの障害と障害のあるホストの修復

ホスト障害が発生した場合、または VM ホストに障害があると報告した場合、ホストの修復プロセスは次のように動作します。

  • 影響を受ける VM は、物理ハードウェアの修復中に REPAIRING 状態に移行します。
  • 基盤となるハードウェアが修復されると、VM は同じホストの RUNNING 状態に戻ります。ただし、VM がマルチホスト スライスに属している場合、スライスは「FAILED」状態のままになります。スライスを手動で復元する必要があります。

詳細については、All Capacity モードで障害のある TPU ホストを報告して修復するをご覧ください。

緊急メンテナンス

緊急メンテナンス イベント中またはメンテナンス イベントを手動で開始した場合:

  • VM が RUNNING 状態から REPAIRING 状態に移行します。
  • メンテナンスが完了すると、VM は同じホストの RUNNING 状態に戻ります。

詳細については、All Capacity モードでメンテナンス イベントを管理するをご覧ください。

マルチホスト スライスの障害シナリオ

All Capacity モードでは、Compute Engine はマルチホスト スライスを自動的に復元しません。次のシナリオでは、スライスが FAILED 状態に移行します。

  • ICI の障害: VM は RUNNING 状態のままですが、スライス状態は FAILED 状態に移行します。
  • Spot VM のプリエンプト: スライスのインスタンスがプリエンプトされると、Compute Engine はスライスのすべてのインスタンスを終了し、スライスは FAILED 状態になります。
  • ユーザーが開始した中断: TPU インスタンスを停止または削除した場合、またはオペレーティング システム内からインスタンスを停止した場合、スライスは FAILED 状態になります。

スライスが FAILED 状態になった場合は、スライス内のすべてのインスタンスを再スケジュールして、スライスを手動で復元する必要があります。

TPU スライスを手動で復元する

マネージド容量モードまたは All Capacity モードの TPU スライスが FAILED 状態の場合、次のいずれかの方法でスライス内のすべてのインスタンスを再スケジュールして、手動で復元する必要があります。

次のステップ

TPU の障害復旧を確認するには、次のステータスを確認します。