Pemulihan kegagalan instance TPU

Agar workload Anda tetap berjalan, Compute Engine memulihkan instance dan slice TPU dari kegagalan hardware dan aplikasi.

Perilaku pemulihan kegagalan bergantung pada mode kapasitas Anda:

  • Mode kapasitas terkelola (pemesanan on-demand, mulai fleksibel, dan standar): Compute Engine secara otomatis memulihkan instance dan slice TPU dengan memulai ulang instance dan slice tersebut di hardware yang berfungsi dengan baik.
  • Mode Semua Kapasitas (pemesanan dalam mode Semua Kapasitas): Anda mengelola pemulihan slice TPU. Kegagalan hardware diperbaiki di host yang ada tanpa memindahkan instance secara otomatis ke hardware baru.

Persyaratan pemulihan slice multi-host

Slice TPU multi-host mengharuskan semua instance dalam slice dipulihkan atau dijadwalkan ulang bersama-sama. Baik Compute Engine menangani pemulihan secara otomatis dalam mode kapasitas terkelola atau Anda memulihkan slice secara manual dalam mode Semua Kapasitas, Anda tidak dapat menjadwalkan ulang instance satu per satu dalam slice.

Instance dalam slice multi-host terhubung oleh interkoneksi antar-chip (ICI) dan, dalam beberapa kasus, oleh Optical Circuit Switch (OCS). Saat Anda menyediakan slice multi-host, Compute Engine akan membuat instance TPU dan mengaktifkan jaringan ICI. Anda menentukan topologi jaringan slice dengan menyetel topologi akselerator dalam kebijakan workload. Saat workload dimulai, LibTPU, lapisan software TPU dasar, akan menginisialisasi topologi jaringan. Secara default, compiler XLA kemudian memetakan operasi model secara statis ke topologi ini.

Jika link jaringan atau instance gagal, hardware fisik tidak lagi cocok dengan topologi yang dipetakan. Akibatnya, compiler XLA tidak dapat menjalankan beban kerja hingga sistem mengonfigurasi ulang topologi jaringan dengan membuat ulang atau menjadwalkan ulang semua instance dalam slice.

Pemulihan kegagalan dalam mode kapasitas terkelola

Dalam mode kapasitas terkelola (termasuk reservasi on-demand, flex-start, dan standar), Compute Engine secara otomatis memulihkan instance dan slice TPU dari kegagalan hardware dan host dengan memulai ulang instance dan slice tersebut di hardware yang berfungsi dengan baik.

Pemulihan otomatis slice TPU host tunggal

Slice host tunggal adalah instance TPU independen. Secara default, Compute Engine secara otomatis memulihkan instance yang gagal dengan memulai ulang instance pada hardware yang berfungsi dengan baik. Perilaku ini dikontrol oleh setelan mulai ulang otomatis, yang diaktifkan secara default saat membuat instance, kecuali untuk Spot VM. Jika Anda menonaktifkan mulai ulang otomatis, kegagalan instance akan menyebabkan instance memasuki status TERMINATED. Untuk mengetahui informasi selengkapnya, lihat Mulai ulang otomatis.

Compute Engine secara otomatis memulihkan instance yang gagal dalam skenario seperti:

  • Waktu tunggu atau error host yang disebabkan oleh mesin fisik yang tidak merespons, penonaktifan host, mulai ulang host, atau pemadaman listrik host
  • Peristiwa pemeliharaan host fisik yang dimulai oleh Anda atau Google
  • Kegagalan interkoneksi antar-chip (ICI) dalam host
  • Error VM

Compute Engine tidak otomatis memulihkan instance dalam skenario penghentian terencana, termasuk:

  • Penghapusan instance
  • Penghapusan atau masa berlaku reservasi
  • Preemption Spot VM

Perbaikan yang dimulai MIG di slice host tunggal

Dalam MIG dengan slice host tunggal, jika instance TPU dalam slice host tunggal memasuki status TERMINATED karena kegagalan hardware atau peristiwa eksternal seperti preempt VM Spot, MIG akan memperbaiki instance secara default. Selama perbaikan, MIG akan membuat ulang instance dengan nama yang sama. Anda dapat menonaktifkan mekanisme perbaikan ini jika Anda menonaktifkan perbaikan.

Anda juga dapat menyiapkan health check berbasis aplikasi di MIG dengan slice host tunggal. Jika health check mendeteksi bahwa aplikasi Anda tidak responsif, MIG akan menandai instance sebagai tidak responsif dan melakukan autohealing pada instance dengan membuatnya ulang.

Untuk mengetahui informasi selengkapnya, lihat Tentang memperbaiki VM untuk ketersediaan tinggi dan Menyiapkan health check dan autohealing aplikasi.

Pemulihan otomatis slice multi-host

Untuk TPU dalam mode terkelola yang menggunakan model penggunaan on-demand, flex-start, atau reservasi, Compute Engine akan otomatis memulihkan instance yang gagal dalam slice multi-host.

Selama pemulihan, Compute Engine mengidentifikasi sekumpulan mesin TPU yang dapat membentuk topologi jaringan, memulai ulang semua instance dalam slice secara bersamaan di mesin tersebut, dan mengonfigurasi ulang jaringan. Proses ini meminimalkan waktu istirahat dengan membuat ulang topologi pada hardware yang berfungsi, bukan menunggu perbaikan hardware.

Proses pemulihan dan status slice

Selama pemulihan otomatis, slice akan bertransisi melalui status berikut:

  1. Slice akan bertransisi ke status REACTIVATING.
  2. Semua instance dalam slice bertransisi ke status REPAIRING, meskipun tidak harus pada saat yang sama.
  3. Compute Engine memulai ulang semua instance dalam slice secara bersamaan di hardware yang berfungsi dengan baik.

Untuk mengetahui informasi selengkapnya tentang status slice TPU, lihat Status topologi akselerator.

Skenario yang memerlukan pemulihan slice manual dalam mode kapasitas terkelola

Compute Engine tidak dapat memulihkan slice multi-host secara otomatis dalam skenario berikut:

  • Preemption Spot VM: Jika ada instance dalam slice yang di-preempt, Compute Engine akan menghentikan semua instance dalam slice, dan slice akan memasuki status FAILED.
  • Interupsi yang diinisiasi pengguna: Jika Anda menghentikan atau menghapus instance TPU, atau menghentikan instance dari dalam sistem operasi, maka slice akan memasuki status FAILED. Slice akan tetap dalam status FAILED hingga Anda membuatnya ulang.

Dalam skenario ini, Anda harus memulihkan slice secara manual.

Pemulihan kegagalan dalam mode Semua Kapasitas

Dalam mode Semua Kapasitas, Anda bertanggung jawab untuk mengelola proses pemulihan slice TPU. Tidak seperti mode kapasitas terkelola, Compute Engine tidak otomatis memindahkan instance TPU yang gagal atau slice multi-host ke hardware fisik baru. Google memperbaiki hardware yang mendasarinya yang gagal di host yang ada, dan Anda bertanggung jawab untuk menjadwalkan ulang slice yang tidak berfungsi ke hardware cadangan yang berfungsi yang Anda sisihkan dalam reservasi Anda.

Kegagalan host dan perbaikan host yang rusak

Jika terjadi kegagalan host atau jika Anda melaporkan host VM sebagai rusak, proses perbaikan host akan berfungsi sebagai berikut:

  • VM yang terpengaruh akan bertransisi ke status REPAIRING saat hardware fisik diperbaiki.
  • Setelah hardware yang mendasarinya diperbaiki, VM akan bertransisi kembali ke status RUNNING di host yang sama. Namun, jika VM termasuk dalam slice multi-host, slice akan tetap dalam status 'GAGAL'. Anda harus memulihkan slice secara manual.

Untuk mengetahui informasi selengkapnya, lihat Melaporkan dan memperbaiki host TPU yang rusak dalam mode Semua Kapasitas.

Pemeliharaan darurat

Selama peristiwa pemeliharaan mendesak atau saat Anda memulai peristiwa pemeliharaan secara manual:

  • VM bertransisi dari status RUNNING ke status REPAIRING.
  • Setelah pemeliharaan selesai, VM akan kembali ke status RUNNING di host yang sama.

Untuk mengetahui informasi selengkapnya, lihat Mengelola peristiwa pemeliharaan dalam mode Semua Kapasitas.

Skenario kegagalan slice multi-host

Dalam mode Semua Kapasitas, Compute Engine tidak akan otomatis memulihkan slice multi-host. Slice bertransisi ke status FAILED dalam skenario berikut:

  • Kegagalan ICI: VM tetap dalam status RUNNING, tetapi status slice berubah ke status FAILED.
  • Preemption Spot VM: Jika ada instance dalam slice yang di-preempt, Compute Engine akan menghentikan semua instance dalam slice, dan slice akan memasuki status FAILED.
  • Interupsi yang diinisiasi pengguna: Jika Anda menghentikan atau menghapus instance TPU, atau menghentikan instance dari dalam sistem operasi, maka slice akan memasuki status FAILED.

Saat slice memasuki status FAILED, Anda harus memulihkan slice secara manual dengan menjadwalkan ulang semua instance dalam slice.

Memulihkan slice TPU secara manual

Jika slice TPU dalam mode kapasitas terkelola atau mode Semua Kapasitas berada dalam status FAILED, Anda harus memulihkannya secara manual dengan menjadwalkan ulang semua instance dalam slice menggunakan salah satu metode berikut:

Langkah berikutnya

Untuk memverifikasi pemulihan kegagalan TPU, periksa status berikut: