TPU 容量モード

TPU には、マネージド容量モードと All Capacity モードの 2 つの容量モードがあります。各モードでは、ハードウェア メンテナンスとホストエラーの処理方法、TPU ハードウェア トポロジの可視性と制御のレベルが定義されます。

TPU 容量モードの概要

次の表は、マネージド容量モードと All Capacity モードの主な違いをまとめたものです。

マネージド容量モード All Capacity モード
容量アクセス Google は、利用可能なインフラストラクチャ全体で容量の割り当てとホストの復元を管理します。 予約済み容量の 100% をワークロードで使用できます。障害復旧用の予備容量の管理はお客様の責任となります。特定のブロックまたはサブブロックをターゲットにして、トポロジを認識した正確なワークロード配置を行うことができます。
ハードウェア トポロジの可視性 Compute Engine は物理トポロジを抽象化します。 クラスタ、ブロック、サブブロック、ホストのトポロジと使用率を完全に可視化します。
障害復旧 Compute Engine は、障害が発生した TPU スライスを自動的に検出し、正常なハードウェアで再起動します。 Google は、障害のあるハードウェアを自動的に検出して修復します。TPU スライスの健全性をモニタリングし、異常なスライスを予約で確保した正常なスペア ハードウェアに再スケジュールするのは、ユーザーの責任です。
メンテナンスの制御 Compute Engine は、メンテナンス イベントをスケジュールして管理します。必要に応じて、スケジュールされたメンテナンス時間より前にメンテナンスを開始できます。 予約、ブロック、サブブロック レベルでメンテナンスをスケジュールして開始する詳細な制御が可能です。
サポートされている TPU バージョン すべての TPU バージョン。 TPU v6e(Trillium)と TPU7x(Ironwood)
サポートされている使用オプション すべての使用オプション。 1 年以上の最小容量サイズの将来の予約が必要です。カレンダー モードの将来の予約はサポートされていません。詳細については、 Google Cloud アカウント チームにお問い合わせください。All Capacity モードの予約をリクエストすることもできます。

マネージド容量モード

デフォルトでは、TPU 容量はマネージド容量モードで動作します。このモードでは、Compute Engine がハードウェア障害を自動的に検出し、影響を受ける TPU インスタンスを置き換えて、ワークロードが正常なハードウェアで再起動できるようにします。

マネージド容量モードには次の機能があります。

  • インスタンスの自動復元: オンデマンド、Flex Start、予約使用オプションの場合、Compute Engine はハードウェア障害を自動的に検出し、影響を受ける TPU インスタンスを置き換えます。
  • 管理の効率化: ホストのメンテナンスや修復オペレーションに手動で介入する必要はありません。

All Capacity モード

All Capacity モードは、TPU リソースを予約ベースで直接制御できるように設計されています。All Capacity モードでは、予約済み容量の 100% にアクセスできます。十分な正常な予備容量を使用して TPU スライスの復元を管理し、メンテナンス イベントをスケジュールするのは、お客様の責任となります。

All Capacity モードには次の機能があります。

  • 容量の完全割り当て: 障害復旧やワークロード バースト用に割り当てられた予備容量を含め、予約した容量をすべて利用できます。
  • トポロジを認識した配置: クラスタ、ブロック、サブブロック、ホストのトポロジを完全に可視化して、ワークロードの配置を最適化します。
  • 高度なメンテナンス管理: 予約、ブロック、サブブロックのレベルでメンテナンス イベントをスケジュールしてトリガーします。
  • 報告と修理: パフォーマンスの低いハードウェアを修理のために報告します。

All Capacity モードの予約をリクエストするには、 Google Cloud アカウント チームにお問い合わせください。詳細については、All Capacity モードの概要をご覧ください。

次のステップ