Pemulihan kegagalan instance TPU
Agar workload Anda tetap berjalan, Compute Engine memulihkan instance dan slice TPU dari kegagalan hardware dan aplikasi.
Perilaku pemulihan kegagalan bergantung pada mode kapasitas Anda:
- Mode kapasitas terkelola (pemesanan on-demand, mulai fleksibel, dan standar): Compute Engine secara otomatis memulihkan instance dan slice TPU dengan memulai ulang instance dan slice tersebut di hardware yang berfungsi dengan baik.
- Mode Semua Kapasitas (pemesanan dalam mode Semua Kapasitas): Anda mengelola pemulihan slice TPU. Kegagalan hardware diperbaiki di host yang ada tanpa memindahkan instance secara otomatis ke hardware baru.
Persyaratan pemulihan slice multi-host
Slice TPU multi-host mengharuskan semua instance dalam slice dipulihkan atau dijadwalkan ulang bersama-sama. Baik Compute Engine menangani pemulihan secara otomatis dalam mode kapasitas terkelola atau Anda memulihkan slice secara manual dalam mode Semua Kapasitas, Anda tidak dapat menjadwalkan ulang instance satu per satu dalam slice.
Instance dalam slice multi-host terhubung oleh interkoneksi antar-chip (ICI) dan, dalam beberapa kasus, oleh Optical Circuit Switch (OCS). Saat Anda menyediakan slice multi-host, Compute Engine akan membuat instance TPU dan mengaktifkan jaringan ICI. Anda menentukan topologi jaringan slice dengan menyetel topologi akselerator dalam kebijakan workload. Saat workload dimulai, LibTPU, lapisan software TPU dasar, akan menginisialisasi topologi jaringan. Secara default, compiler XLA kemudian memetakan operasi model secara statis ke topologi ini.
Jika link jaringan atau instance gagal, hardware fisik tidak lagi cocok dengan topologi yang dipetakan. Akibatnya, compiler XLA tidak dapat menjalankan beban kerja hingga sistem mengonfigurasi ulang topologi jaringan dengan membuat ulang atau menjadwalkan ulang semua instance dalam slice.
Pemulihan kegagalan dalam mode kapasitas terkelola
Dalam mode kapasitas terkelola (termasuk reservasi on-demand, flex-start, dan standar), Compute Engine secara otomatis memulihkan instance dan slice TPU dari kegagalan hardware dan host dengan memulai ulang instance dan slice tersebut di hardware yang berfungsi dengan baik.
Pemulihan otomatis slice TPU host tunggal
Slice host tunggal adalah instance TPU independen. Secara default, Compute Engine
secara otomatis memulihkan instance yang gagal dengan memulai ulang instance pada hardware yang berfungsi dengan baik. Perilaku ini dikontrol oleh setelan mulai ulang otomatis, yang diaktifkan secara default saat membuat instance, kecuali untuk Spot VM. Jika Anda
menonaktifkan mulai ulang otomatis, kegagalan instance akan menyebabkan instance memasuki
status TERMINATED. Untuk mengetahui informasi selengkapnya, lihat Mulai ulang otomatis.
Compute Engine secara otomatis memulihkan instance yang gagal dalam skenario seperti:
- Waktu tunggu atau error host yang disebabkan oleh mesin fisik yang tidak merespons, penonaktifan host, mulai ulang host, atau pemadaman listrik host
- Peristiwa pemeliharaan host fisik yang dimulai oleh Anda atau Google
- Kegagalan interkoneksi antar-chip (ICI) dalam host
- Error VM
Compute Engine tidak otomatis memulihkan instance dalam skenario penghentian terencana, termasuk:
- Penghapusan instance
- Penghapusan atau masa berlaku reservasi
- Preemption Spot VM
Perbaikan yang dimulai MIG di slice host tunggal
Dalam MIG dengan slice host tunggal, jika instance TPU dalam slice host tunggal memasuki status TERMINATED karena kegagalan hardware atau peristiwa eksternal seperti preempt VM Spot, MIG akan memperbaiki instance secara default.
Selama perbaikan, MIG akan membuat ulang instance dengan nama yang sama. Anda dapat
menonaktifkan mekanisme perbaikan ini jika Anda menonaktifkan
perbaikan.
Anda juga dapat menyiapkan health check berbasis aplikasi di MIG dengan slice host tunggal. Jika health check mendeteksi bahwa aplikasi Anda tidak responsif, MIG akan menandai instance sebagai tidak responsif dan melakukan autohealing pada instance dengan membuatnya ulang.
Untuk mengetahui informasi selengkapnya, lihat Tentang memperbaiki VM untuk ketersediaan tinggi dan Menyiapkan health check dan autohealing aplikasi.
Pemulihan otomatis slice multi-host
Untuk TPU dalam mode terkelola yang menggunakan model penggunaan on-demand, flex-start, atau reservasi, Compute Engine akan otomatis memulihkan instance yang gagal dalam slice multi-host.
Selama pemulihan, Compute Engine mengidentifikasi sekumpulan mesin TPU yang dapat membentuk topologi jaringan, memulai ulang semua instance dalam slice secara bersamaan di mesin tersebut, dan mengonfigurasi ulang jaringan. Proses ini meminimalkan waktu istirahat dengan membuat ulang topologi pada hardware yang berfungsi, bukan menunggu perbaikan hardware.
Proses pemulihan dan status slice
Selama pemulihan otomatis, slice akan bertransisi melalui status berikut:
- Slice akan bertransisi ke status
REACTIVATING. - Semua instance dalam slice bertransisi ke status
REPAIRING, meskipun tidak harus pada saat yang sama. - Compute Engine memulai ulang semua instance dalam slice secara bersamaan di hardware yang berfungsi dengan baik.
Untuk mengetahui informasi selengkapnya tentang status slice TPU, lihat Status topologi akselerator.
Skenario yang memerlukan pemulihan slice manual dalam mode kapasitas terkelola
Compute Engine tidak dapat memulihkan slice multi-host secara otomatis dalam skenario berikut:
- Preemption Spot VM: Jika ada instance dalam slice yang di-preempt, Compute Engine akan menghentikan semua instance dalam slice, dan slice akan memasuki status
FAILED. - Interupsi yang diinisiasi pengguna: Jika Anda menghentikan atau menghapus instance TPU, atau
menghentikan instance dari dalam sistem operasi, maka slice akan memasuki status
FAILED. Slice akan tetap dalam statusFAILEDhingga Anda membuatnya ulang.
Dalam skenario ini, Anda harus memulihkan slice secara manual.
Pemulihan kegagalan dalam mode Semua Kapasitas
Dalam mode Semua Kapasitas, Anda bertanggung jawab untuk mengelola proses pemulihan slice TPU. Tidak seperti mode kapasitas terkelola, Compute Engine tidak otomatis memindahkan instance TPU yang gagal atau slice multi-host ke hardware fisik baru. Google memperbaiki hardware yang mendasarinya yang gagal di host yang ada, dan Anda bertanggung jawab untuk menjadwalkan ulang slice yang tidak berfungsi ke hardware cadangan yang berfungsi yang Anda sisihkan dalam reservasi Anda.
Kegagalan host dan perbaikan host yang rusak
Jika terjadi kegagalan host atau jika Anda melaporkan host VM sebagai rusak, proses perbaikan host akan berfungsi sebagai berikut:
- VM yang terpengaruh akan bertransisi ke status
REPAIRINGsaat hardware fisik diperbaiki. - Setelah hardware yang mendasarinya diperbaiki, VM akan bertransisi kembali ke status
RUNNINGdi host yang sama. Namun, jika VM termasuk dalam slice multi-host, slice akan tetap dalam status 'GAGAL'. Anda harus memulihkan slice secara manual.
Untuk mengetahui informasi selengkapnya, lihat Melaporkan dan memperbaiki host TPU yang rusak dalam mode Semua Kapasitas.
Pemeliharaan darurat
Selama peristiwa pemeliharaan mendesak atau saat Anda memulai peristiwa pemeliharaan secara manual:
- VM bertransisi dari status
RUNNINGke statusREPAIRING. - Setelah pemeliharaan selesai, VM akan kembali ke status
RUNNINGdi host yang sama.
Untuk mengetahui informasi selengkapnya, lihat Mengelola peristiwa pemeliharaan dalam mode Semua Kapasitas.
Skenario kegagalan slice multi-host
Dalam mode Semua Kapasitas, Compute Engine tidak akan otomatis memulihkan slice multi-host. Slice bertransisi ke status FAILED dalam skenario
berikut:
- Kegagalan ICI: VM tetap dalam status
RUNNING, tetapi status slice berubah ke statusFAILED. - Preemption Spot VM: Jika ada instance dalam slice yang di-preempt, Compute Engine akan menghentikan semua instance dalam slice, dan slice akan memasuki status
FAILED. - Interupsi yang diinisiasi pengguna: Jika Anda menghentikan atau menghapus instance TPU, atau
menghentikan instance dari dalam sistem operasi, maka slice akan memasuki status
FAILED.
Saat slice memasuki status FAILED, Anda harus memulihkan slice secara manual dengan menjadwalkan ulang semua instance dalam slice.
Memulihkan slice TPU secara manual
Jika slice TPU dalam mode kapasitas terkelola atau mode Semua Kapasitas berada dalam status
FAILED, Anda harus memulihkannya secara manual dengan menjadwalkan ulang semua instance dalam
slice menggunakan salah satu metode berikut:
- Ubah ukuran
MIG
ke ukuran target
0, lalu tingkatkan ke ukuran yang diperlukan. - Hapus MIG dan buat ulang slice.
Langkah berikutnya
Untuk memverifikasi pemulihan kegagalan TPU, periksa status berikut: