Los grupos de instancias administrados (MIG) automatizan la creación, la configuración y la administración del ciclo de vida de una colección de VMs. Los MIG proporcionan beneficios como alta disponibilidad a través de la reparación automática y las implementaciones regionales (multizona), el ajuste de escala automático para controlar cargas variables y las actualizaciones progresivas simplificadas para las aplicaciones. Para obtener más información, consulta Grupos de instancias administrados.
Puedes usar MIG para crear y administrar VMs de TPU para las versiones v5p, v6e y TPU7x de la TPU. Puedes crear MIG con una sola VM de TPU, VMs de TPU independientes (también llamadas porciones de un solo host) y MIG con VMs de TPU interconectadas (también llamadas porciones de varios hosts).
Cada segmento en un MIG de un solo host tiene, como máximo, una VM de TPU. Las VMs de TPU dentro de la MIG no están conectadas con vínculos de interconexión entre chips (ICI).
Una porción de varios hosts contiene varias VMs de TPU interconectadas con vínculos de ICI.
MIG con una sola instancia de VM de TPU
Puedes crear y administrar una TPU VM individual con un MIG si configuras el tamaño objetivo del MIG en uno. Este enfoque es útil si deseas usar funciones de MIG, como la reparación automática de una sola instancia. Para obtener más información, consulta Crea un MIG con porciones de TPU de host único.
MIGs con porciones de TPU de host único
Crear un grupo de instancias administrado (MIG) con varias instancias de TPU independientes es beneficioso para las cargas de trabajo que requieren varias VMs de TPU individuales, pero no necesitan que se interconecten con vínculos de ICI para cargas de trabajo distribuidas. Por ejemplo:
- Publicación de inferencias: Cada VM en el MIG puede controlar de forma independiente las solicitudes de inferencia. Un MIG te permite escalar la cantidad de instancias de procesamiento según la demanda y administrarlas como un grupo.
- Tareas independientes paralelas: Un MIG proporciona una forma de administrar muchos trabajos de entrenamiento pequeños e independientes, o bien otros cálculos que se pueden ejecutar en paralelo en VMs de TPU individuales.
- Administración: Los MIG proporcionan las siguientes funciones:
- Implementación: Define una plantilla de instancias una vez y usa el MIG para crear varias VMs de TPU idénticas.
- Escalabilidad: Ajusta la cantidad de VMs de TPU cambiando el tamaño del MIG.
- Actualizaciones continuas: Actualiza el software o el tipo de máquina en todas las VMs de forma controlada.
- Rentabilidad: Para las tareas que no requieren toda la potencia o la interconectividad de una porción de TPU grande, usar varias porciones de TPU más pequeñas e independientes puede ser más rentable.
Para obtener más información, consulta Crea un MIG con porciones de TPU de host único.
MIGs con una porción de varios hosts
A diferencia de los grupos de porciones de TPU independientes, un MIG configurado para una porción de varios hosts administra un conjunto de VMs de TPU que están estrechamente vinculadas a través de vínculos de ICI. Esto crea una sola porción de TPU lógica.
Beneficios y rendimiento
Los MIG para las porciones de TPU de varios hosts proporcionan la escala y el rendimiento necesarios para las cargas de trabajo de aprendizaje automático intensivas.
- Entrenamiento distribuido: Entrenar modelos de aprendizaje automático a menudo requiere más potencia de TPU de la que puede proporcionar una sola TPU VM. Las porciones de TPU más grandes distribuyen el procesamiento en muchos chips y VMs de TPU, y los vínculos de ICI permiten una comunicación rápida entre ellos. Esto es fundamental para el rendimiento del entrenamiento.
- Alto ancho de banda de interconexión: La red de ICI proporciona un mayor ancho de banda y una menor latencia entre los chips de TPU en la porción que la red estándar del centro de datos (DCN). Esto es fundamental para las operaciones síncronas comunes en el entrenamiento de modelos grandes.
Operaciones atómicas del ciclo de vida
Para garantizar la integridad de la topología interconectada, el MIG administra toda la porción como una sola unidad indivisible durante todo su ciclo de vida.
- Creación: Todas las VMs de la porción se aprovisionan juntas. Si no hay suficiente capacidad interconectada y en buen estado disponible para toda la topología solicitada, no se crea la segmentación.
- Borrado: El MIG borra toda la segmentación como una unidad.
- Cambio de tamaño: El cambio de tamaño se restringe al ajuste de escala de 0 al tamaño completo de la división o del tamaño completo de la división a 0. No puedes cambiar el tamaño de una porción de varias VM de forma parcial.
Requisitos de configuración
Para configurar un MIG de varios hosts, se deben definir tanto la topología de interconexión física como las propiedades de cada instancia.
- Política de carga de trabajo: Debes especificar una política de carga de trabajo con el parámetro
accelerator-topology(por ejemplo, 4x4, 8x8 o 4x4x4). Esto configura el MIG para que trate las instancias como una sola porción interconectada. Para obtener información sobre la topología, consulta Topología de TPU. - Plantilla de instancias: Define propiedades como el tipo de máquina, la imagen de disco y otros parámetros de configuración para cada VM dentro de la división.
Disponibilidad de la Slice y recuperación de fallas
Cuando usas MIG para crear una porción de TPU de varios hosts, el comportamiento de recuperación ante fallas depende del modelo de aprovisionamiento y el modo de reserva que uses:
Cuando un MIG usa reservas, inicio flexible o según demanda (excepto las reservas en el modo All Capacity). En esta situación, Compute Engine administra automáticamente el proceso de recuperación de la división. Si se produce una falla en el host o en el ICI, el segmento pasa al estado
REACTIVATING. Todas las VMs de la división pasan al estadoREPAIRING, aunque no necesariamente al mismo tiempo. Luego, Compute Engine recupera automáticamente la porción reiniciando las VMs juntas en capacidad en buen estado.Cuando un MIG usa el modelo de aprovisionamiento spot. En esta situación, eres responsable de administrar el proceso de recuperación de la segmentación. Si se produce la interrupción de las VMs Spot, Compute Engine finaliza todas las instancias de la porción. El segmento pasa al estado
FAILEDy las VMs pasan al estadoTERMINATED. Para recuperarte del estado de error, debes volver a crear el segmento de forma manual.Cuando un MIG usa reservas en el modo All Capacity. En esta situación, eres responsable de administrar el proceso de recuperación de la segmentación. Si se produce una falla, el segmento pasa al estado
FAILEDy debes volver a crear el segmento de forma manual.El comportamiento en el modo All Capacity también depende de lo siguiente:
- Falla del host o VM defectuosa informada. La VM afectada pasa al estado
REPAIRING. Una vez que se repara el hardware subyacente, la VM vuelve al estadoRUNNING. - Próximo mantenimiento de emergencia. Cuando inicias un evento de mantenimiento de forma manual, las VMs pasan del estado
RUNNINGal estadoREPAIRING. Una vez que finaliza el mantenimiento, la VM vuelve al estadoRUNNING. - Error de ICI. Las VMs permanecen en el estado
RUNNING, pero el estado de la segmentación pasa al estadoFAILED.
- Falla del host o VM defectuosa informada. La VM afectada pasa al estado
Para volver a crear una segmentación después de la interrupción de las VMs Spot o una falla en el modo All Capacity, debes hacer una de las siguientes acciones:
- Borra y vuelve a crear el MIG.
- Cambia el tamaño del MIG a
0y, luego, auméntalo al tamaño requerido.
Recuperación ante fallas por interrupción de una instancia
Si borras o detienes una instancia de TPU, o bien detienes una instancia desde el sistema operativo, la segmentación pasa al estado FAILED. En este caso, el segmento permanece en el estado FAILED hasta que lo vuelvas a crear.
Para volver a crear la segmentación, debes borrar y volver a crear el MIG, o bien cambiar el tamaño del MIG a 0 y, luego, aumentarlo.
Para obtener más información sobre los estados de la porción, consulta Cómo ver el estado de una porción de TPU.
Limitaciones
En las siguientes secciones, se explican las limitaciones para crear un MIG con VMs de TPU.
Limitaciones de las plantillas de instancias
Las plantillas de instancias que especifican un tipo de máquina TPU tienen las siguientes limitaciones:
Cuando usas el modelo de aprovisionamiento vinculado a la reserva, debes configurar la acción de finalización de la instancia como borrar.
Las TPU solo pueden consumir reservas orientadas específicamente.
No puedes especificar una política de posición.
No debes inhabilitar el reinicio automático en los siguientes casos:
Segmentos de múltiples hosts que usan modelos de aprovisionamiento estándar, de inicio flexible o vinculados a la reserva (incluido el modo All Capacity).
Es un solo host que usa el modelo de aprovisionamiento vinculado a la reserva en el modo All Capacity.
No debes habilitar el reinicio automático cuando uses el modelo de aprovisionamiento Spot.
Limitaciones de los MIG
Los MIG con TPUs tienen las siguientes limitaciones:
Operaciones de ciclo de vida: No puedes detener, iniciar, reanudar ni suspender instancias de TPU. Para cambiar la configuración que requiere un reinicio o dejar de generar cargos, debes borrar las instancias.
Distribución de zonas del MIG regional: Debes establecer la forma de distribución objetivo en
ANY_SINGLE_ZONE.Actualizaciones de configuración en un MIG:
- No puedes actualizar un MIG que forma una porción de TPU de varios hosts debido a la topología de acelerador definida.
- Puedes actualizar un MIG que forma porciones de TPU de host único con los métodos automático o selectivo.
Sin embargo, las actualizaciones de la porción de TPU de host único no admiten la acción de reinicio (
RESTART). Si es necesario reiniciar y la acción más disruptiva permitida es reemplazar (REPLACE), el actualizador reemplazará la instancia; de lo contrario, el intento de actualización fallará con un error.
En el caso de un MIG que forma una porción de TPU de varios hosts, también se aplican las siguientes limitaciones:
Política de tamaño objetivo: Debes establecer el modo de política de tamaño objetivo en
BULK. Una vez que establezcas este modo, no podrás cambiarlo.Tamaño objetivo: En el modo masivo, puedes establecer el tamaño objetivo en
0o en la cantidad de instancias que se requieren para formar la topología del acelerador.Política de carga de trabajo: Debes especificar una política de carga de trabajo en la que se defina la topología del acelerador. Después de establecer la política de carga de trabajo, no podrás cambiarla ni quitarla del MIG.
Reparaciones iniciadas por el MIG: Debes desactivar las reparaciones iniciadas por el MIG configurando el campo
defaultActionOnFailurecomoDO_NOTHING. En esta configuración, el MIG no realiza ninguna acción en una instancia con errores. Compute Engine recupera automáticamente la instancia con errores reiniciando todas las instancias de la misma división en capacidad en buen estado.
Funciones no admitidas: Las MIG con TPU no admiten las siguientes funciones:
- Flexibilidad de instancias
- Solicitudes de cambio de tamaño para obtener recursos de una sola vez
- Configuración con estado
- En el caso de un MIG que forma una porción de TPU de varios hosts, tampoco se admiten las siguientes opciones:
¿Qué sigue?
- Aprende a crear un MIG con porciones de TPU de host único
- Aprende a crear un MIG con una porción de TPU de varios hosts