Recuperación ante fallas de instancias de TPU
Para mantener en funcionamiento tus cargas de trabajo, Compute Engine recupera las instancias y las segmentaciones de TPU de las fallas de hardware y de aplicaciones.
El comportamiento de recuperación ante fallas depende del modo de capacidad:
- Modo de capacidad administrada (reservas a pedido, de inicio flexible y estándar): Compute Engine recupera automáticamente las instancias y los segmentos de TPU reiniciándolos en hardware en buen estado.
- Modo All Capacity (reservas en el modo All Capacity): Administras la recuperación de la porción de TPU. Las fallas de hardware se reparan en el host existente sin reubicar automáticamente las instancias en hardware nuevo.
Requisitos de recuperación de porciones de varios hosts
Las porciones de TPU de varios hosts requieren que todas las instancias de la porción se recuperen o se reprogramen juntas. Ya sea que Compute Engine controle automáticamente la recuperación en el modo de capacidad administrada o que recuperes segmentos de forma manual en el modo de toda la capacidad, no puedes reprogramar instancias individuales dentro de un segmento.
Las instancias en una porción de varios hosts se conectan a través de interconexiones entre chips (ICI) y, en algunos casos, a través de un conmutador de circuitos ópticos (OCS). Cuando aprovisionas un segmento de TPU de varios hosts, Compute Engine crea instancias de TPU y activa la red de ICI. Para especificar la topología de red de la segmentación, configura la topología del acelerador en tu política de carga de trabajo. Cuando se inicia una carga de trabajo, LibTPU, la capa de software fundamental de la TPU, inicializa la topología de red. De forma predeterminada, el compilador de XLA asigna de forma estática las operaciones del modelo a esta topología.
Si falla una instancia o un vínculo de red, el hardware físico ya no coincidirá con la topología asignada. Como resultado, el compilador de XLA no puede ejecutar la carga de trabajo hasta que el sistema reconfigure la topología de red recreando o reprogramando todas las instancias en la división.
Recuperación de fallas en el modo de capacidad administrada
En el modo de capacidad administrada (incluidas las reservas estándar, de inicio flexible y bajo demanda), Compute Engine recupera automáticamente las instancias y los segmentos de TPU de las fallas de hardware y host reiniciándolos en hardware en buen estado.
Recuperación automática de una porción de TPU de host único
Las porciones de host único son instancias de TPU independientes. De forma predeterminada, Compute Engine recupera automáticamente las instancias fallidas reiniciándolas en hardware en buen estado. Este comportamiento se controla con el parámetro de configuración de reinicio automático, que está habilitado de forma predeterminada cuando se crean instancias, excepto en el caso de las VMs Spot. Si inhabilitas el reinicio automático, una falla de la instancia hará que esta entre en el estado TERMINATED. Para obtener más información, consulta Reinicio automático.
Compute Engine recupera automáticamente una instancia con errores en situaciones como las siguientes:
- Un error o tiempo de espera del host causado por la falta de respuesta de la máquina física, el apagado o reinicio del host, o la interrupción de la alimentación del host
- Eventos de mantenimiento del host físico iniciados por ti o por Google
- Falla de interconexión entre chips (ICI) dentro de un host
- Falla de la VM
Compute Engine no recupera automáticamente las instancias en situaciones de finalización planificada, como las siguientes:
- Borrado de instancias
- Borrado o vencimiento de la reserva
- Interrupción de VMs Spot
Reparación iniciada por el MIG en porciones de host único
En un MIG con segmentos de un solo host, si una instancia de TPU en un segmento de un solo host ingresa en un estado TERMINATED debido a fallas de hardware o eventos externos, como la interrupción de VMs Spot, el MIG repara la instancia de forma predeterminada.
Durante una reparación, el MIG recrea la instancia con el mismo nombre. Puedes inhabilitar este mecanismo de reparación si desactivas las reparaciones.
También puedes configurar una verificación de estado basada en la aplicación en un MIG con segmentos de un solo host. Si la verificación de estado detecta que tu aplicación no responde, el MIG marca la instancia como en mal estado y la repara automáticamente volviéndola a crear.
Para obtener más información, consulta Acerca de la reparación de VMs para alta disponibilidad y Configura la verificación de estado y la reparación automática de una aplicación.
Recuperación automática de una porción de varios hosts
En el caso de las TPU en modo administrado que usan los modelos de consumo de reserva, inicio flexible o a pedido, Compute Engine recupera automáticamente las instancias con errores en una porción de varios hosts.
Durante la recuperación, Compute Engine identifica un conjunto de máquinas TPU que pueden formar la topología de red, reinicia todas las instancias de la porción juntas en esas máquinas y vuelve a configurar la red. Este proceso minimiza el tiempo de inactividad, ya que recrea la topología en el hardware disponible en buen estado, en lugar de esperar a que se repare el hardware.
Proceso de recuperación y estados de segmentación
Durante la recuperación automática, el segmento pasa por los siguientes estados:
- La segmentación pasa al estado
REACTIVATING. - Todas las instancias de la porción pasan al estado
REPAIRING, aunque no necesariamente al mismo tiempo. - Compute Engine reinicia todas las instancias de la división juntas en hardware en buen estado.
Para obtener más información sobre los estados de las porciones de TPU, consulta Estados de la topología del acelerador.
Situaciones que requieren la recuperación manual de segmentos en el modo de capacidad administrada
Compute Engine no puede recuperar automáticamente una división de varios hosts en las siguientes situaciones:
- Interrupción de VMs Spot: Si se interrumpe alguna instancia de la división, Compute Engine finaliza todas las instancias de la división y esta pasa al estado
FAILED. - Interrupciones iniciadas por el usuario: Si detienes o borras una instancia de TPU, o bien detienes una instancia desde el sistema operativo, la porción ingresa al estado
FAILED. El segmento permanece en el estadoFAILEDhasta que lo vuelvas a crear.
En estos casos, debes recuperar manualmente el segmento.
Recuperación de fallas en el modo All Capacity
En el modo All Capacity, eres responsable de administrar el proceso de recuperación de la porción de TPU. A diferencia del modo de capacidad administrada, Compute Engine no reubica automáticamente las instancias de TPU o las porciones de varios hosts con errores en hardware físico nuevo. Google repara el hardware subyacente con errores en el host existente, y tú eres responsable de reprogramar las particiones en mal estado para que se ejecuten en el hardware de repuesto en buen estado que reservaste.
Falla del host y reparación del host defectuoso
Si se produce una falla del host o si informas que un host de VM está defectuoso, el proceso de reparación del host funciona de la siguiente manera:
- La VM afectada pasa al estado
REPAIRINGmientras se repara el hardware físico. - Una vez que se repara el hardware subyacente, la VM vuelve al estado
RUNNINGen el mismo host. Sin embargo, si la VM pertenece a una porción de varios hosts, la porción permanece en el estado "FAILED". Debes recuperar manualmente el segmento.
Para obtener más información, consulta Informa y repara hosts de TPU defectuosos en el modo All Capacity.
Mantenimiento emergente
Durante los eventos de mantenimiento de emergencia o cuando inicias un evento de mantenimiento de forma manual, sucede lo siguiente:
- Las VMs pasan del estado
RUNNINGal estadoREPAIRING. - Una vez que finaliza el mantenimiento, las VMs vuelven al estado
RUNNINGen el mismo host.
Para obtener más información, consulta Administra eventos de mantenimiento en el modo All Capacity.
Situaciones de falla de la porción de varios hosts
En el modo All Capacity, Compute Engine no recupera automáticamente una división de varios hosts. Un segmento transiciona al estado FAILED en las siguientes situaciones:
- Falla de ICI: Las VMs permanecen en el estado
RUNNING, pero el estado de la segmentación pasa al estadoFAILED. - Interrupción de VMs Spot: Si se interrumpe alguna instancia de la división, Compute Engine finaliza todas las instancias de la división y esta pasa al estado
FAILED. - Interrupciones iniciadas por el usuario: Si detienes o borras una instancia de TPU, o bien detienes una instancia desde el sistema operativo, la porción ingresa al estado
FAILED.
Cuando una porción ingresa al estado FAILED, debes recuperarla manualmente reprogramando todas las instancias de la porción.
Cómo recuperar manualmente una porción de TPU
Cuando una porción de TPU en el modo de capacidad administrada o en el modo All Capacity se encuentra en el estado FAILED, debes recuperarla de forma manual reprogramando todas las instancias de la porción con uno de los siguientes métodos:
- Cambia el tamaño del MIG al tamaño objetivo
0y, luego, auméntalo al tamaño requerido. - Borra el MIG y vuelve a crear el segmento.
¿Qué sigue?
Para verificar la recuperación ante fallas de las TPU, comprueba los siguientes estados: