Os grupos gerenciados de instâncias (MIGs) automatizam a criação, a configuração e o gerenciamento do ciclo de vida de uma coleção de VMs. Os MIGs oferecem benefícios como alta disponibilidade com recuperação automática e implantações regionais (várias zonas), escalonamento automático para lidar com cargas variáveis e atualizações graduais simplificadas para aplicativos. Para mais informações, consulte Grupos gerenciados de instâncias.
É possível usar MIGs para criar e gerenciar VMs de TPU para as versões v5p, v6e e TPU7x. É possível criar MIGs com uma única VM de TPU, VMs de TPU independentes (também chamadas de frações de host único) e MIGs com VMs de TPU interconectadas (também chamadas de frações de vários hosts).
Cada fração em um MIG de host único tem no máximo uma VM de TPU. As VMs de TPU no MIG não são conectadas com links de interconexão interchip (ICI).
Uma fração de vários hosts contém várias VMs de TPU interconectadas com links de ICI.
MIGs com uma única instância de VM de TPU
É possível criar e gerenciar uma VM de TPU individual usando um MIG definindo o tamanho de destino do MIG como um. Essa abordagem é útil se você quiser usar recursos do MIG, como reparo automático para uma única instância. Para mais informações, consulte Criar um MIG com frações de TPU de host único.
MIGs com frações de TPU de host único
Criar um grupo gerenciado de instâncias (MIG) com várias instâncias de TPU independentes é útil para cargas de trabalho que exigem várias VMs de TPU individuais, mas não precisam que elas sejam interconectadas com links ICI para cargas de trabalho distribuídas. Exemplo:
- Serviço de inferência: cada VM no MIG pode processar solicitações de inferência de forma independente. Com um MIG, é possível escalonar o número de instâncias de serviço com base na demanda e gerenciá-las como um grupo.
- Tarefas paralelas independentes: um MIG oferece uma maneira de gerenciar muitos jobs de treinamento pequenos e independentes ou outras computações que podem ser executadas em paralelo em VMs de TPU únicas.
- Gerenciamento: os MIGs oferecem os seguintes recursos:
- Implantação: defina um modelo de instância uma vez e use o MIG para criar várias VMs de TPU idênticas.
- Escalonabilidade: ajuste o número de VMs de TPU redimensionando o MIG.
- Atualizações graduais: atualize o software ou o tipo de máquina em todas as VMs de maneira controlada.
- Custo-benefício: para tarefas que não exigem toda a capacidade ou interconectividade de uma grande fração de TPU, usar várias frações menores e independentes pode ser mais econômico.
Para mais informações, consulte Criar um MIG com frações de TPU de host único.
MIGs com uma fração de vários hosts
Ao contrário dos grupos de frações de TPU independentes, um MIG configurado para uma fração de vários hosts gerencia um conjunto de VMs de TPU que são fortemente acopladas por links de ICI. Isso cria uma única fração lógica de TPU.
Benefícios e performance
Os MIGs para frações de TPU de vários hosts oferecem a escala e a performance necessárias para cargas de trabalho intensivas de machine learning.
- Treinamento distribuído: o treinamento de modelos de machine learning geralmente requer mais potência de TPU do que uma única VM de TPU pode oferecer. As frações maiores de TPU distribuem a computação por muitos chips e VMs de TPU, e os links ICI permitem uma comunicação rápida entre eles. Isso é crucial para o desempenho do treinamento.
- Alta largura de banda de interconexão: a rede ICI oferece maior largura de banda e menor latência entre os chips de TPU na fração do que a rede padrão do data center (DCN). Isso é essencial para as operações síncronas comuns no treinamento de modelo grandes.
Operações atômicas de ciclo de vida
Para garantir a integridade da topologia interconectada, o MIG gerencia toda a fração como uma unidade única e indivisível ao longo do ciclo de vida.
- Criação: todas as VMs na fração são provisionadas juntas. Se não houver capacidade suficiente e interconectada disponível para toda a topologia solicitada, a fração não será criada.
- Exclusão: o MIG exclui toda a fração como uma unidade.
- Redimensionamento: o redimensionamento é restrito ao escalonamento de 0 para o tamanho total da fração ou do tamanho total da fração de volta para 0. Não é possível redimensionar parcialmente uma fração de várias VMs.
Requisitos de configuração
Para configurar um MIG multihost, é necessário definir a topologia de interconexão física e as propriedades de cada instância.
- Política de carga de trabalho: especifique uma política de carga de trabalho com o parâmetro
accelerator-topology(por exemplo, 4x4, 8x8 ou 4x4x4). Isso configura o MIG para tratar as instâncias como uma única fração interconectada. Para informações sobre topologia, consulte Topologia de TPU. - Modelo de instância: define propriedades como tipo de máquina, imagem do disco e outras configurações para cada VM na fração.
Disponibilidade Slice e recuperação de falhas
Quando você usa MIGs para criar uma fração de TPU com vários hosts, o comportamento de recuperação de falhas depende do modelo de provisionamento e do modo de reserva usados:
Quando um MIG usa reservas imediatas, de início flexível ou (exceto reservas no modo "Toda a capacidade"). Nesse cenário, o Compute Engine gerencia automaticamente o processo de recuperação de fração. Se ocorrer uma falha no host ou no ICI, a fração vai passar para o estado
REACTIVATING. Todas as VMs na fatia fazem a transição para o estadoREPAIRING, mas não necessariamente todas ao mesmo tempo. Em seguida, o Compute Engine recupera automaticamente a fatia reiniciando as VMs juntas em capacidade íntegra.Quando um MIG usa o modelo de provisionamento spot. Nesse cenário, você é responsável por gerenciar o processo de recuperação de fragmentos. Se ocorrer uma interrupção das VMs spot, o Compute Engine vai encerrar todas as instâncias na fração. A fração passa para o estado
FAILED, e as VMs passam para o estadoTERMINATED. Para se recuperar do estado de falha, é necessário recriar manualmente a fração.Quando um MIG usa reservas no modo "Toda a capacidade". Nesse cenário, você é responsável por gerenciar o processo de recuperação de fatias. Se ocorrer uma falha, a fração vai passar para o estado
FAILED, e você precisará recriar a fração manualmente.O comportamento no modo "Toda a capacidade" depende ainda mais do seguinte:
- Falha do host ou VM com falha informada. A VM afetada passa para o estado
REPAIRING. Quando o hardware subjacente for corrigido, a VM voltará ao estadoRUNNING. - Manutenção emergencial programada. Quando você
inicia manualmente um evento de manutenção,
as VMs fazem a transição do estado
RUNNINGparaREPAIRING. Depois que a manutenção terminar, a VM vai voltar ao estadoRUNNING. - Falha do ICI. As VMs permanecem no estado
RUNNING, mas o estado da fração passa paraFAILED.
- Falha do host ou VM com falha informada. A VM afetada passa para o estado
Para recriar uma fração após a preempção de VMs spot ou uma falha no modo "Toda a capacidade", faça uma destas ações:
- Exclua e recrie o MIG.
- Redimensione o MIG para
0e aumente para o tamanho necessário.
Recuperação de falhas devido a uma interrupção da instância
Se você excluir ou parar uma instância de TPU ou parar uma instância no
sistema operacional, a fração vai passar para o estado FAILED. Nesse
cenário, a fração permanece no estado FAILED até que você a recrie.
Para recriar a fração, exclua e recrie o MIG ou redimensione-o para 0 e aumente o tamanho.
Para mais informações sobre os estados de fração, consulte Ver o status de uma fração de TPU.
Limitações
As seções a seguir explicam as limitações para criar um MIG com VMs de TPU.
Limitações dos modelos de instância
Os modelos de instância que especificam um tipo de máquina de TPU têm as seguintes limitações:
Ao usar o modelo de provisionamento vinculado à reserva, defina a ação de encerramento da instância como exclusão.
As TPUs só podem consumir reservas segmentadas especificamente.
Não é possível especificar uma política de posicionamento.
Não desative o reinício automático nos seguintes casos:
Intervalos de vários hosts usando modelos de provisionamento padrão, de início flexível ou vinculados à reserva (incluindo o modo de capacidade total).
Host único usando o modelo de provisionamento vinculado à reserva no modo "Toda a capacidade".
Não ative a reinicialização automática ao usar o modelo de provisionamento spot.
Limitações para MIGs
Os MIGs com TPUs têm as seguintes limitações:
Operações de ciclo de vida: não é possível interromper, iniciar, retomar ou suspender instâncias de TPU. Para mudar configurações que exigem uma reinicialização ou parar de gerar custos, exclua as instâncias.
Distribuição de zona do MIG regional: defina o formato de distribuição de destino como
ANY_SINGLE_ZONE.Atualizações de configuração em um MIG:
- Não é possível atualizar um MIG que forma uma fração de TPU de vários hosts devido à topologia de acelerador definida.
- É possível atualizar um MIG que forma frações de TPU de host único usando os
métodos automático ou seletivo.
No entanto, as atualizações para fatias de TPU de host único não aceitam a ação de reinicialização
(
RESTART). Se uma reinicialização for necessária e a ação mais disruptiva permitida for a substituição (REPLACE), o atualizador vai substituir a instância. Caso contrário, a tentativa de atualização vai falhar com um erro.
Para um MIG que forma uma fração de TPU de vários hosts, as seguintes limitações também se aplicam:
Política de tamanho do destino: defina o modo da política de tamanho do destino como
BULK. Depois de definir esse modo, não será possível mudar.Tamanho do destino: no modo em massa, é possível definir o tamanho do destino como
0ou o número de instâncias necessárias para formar a topologia do acelerador.Política de carga de trabalho: especifique uma política de carga de trabalho em que a topologia do acelerador esteja definida. Depois de definir a política de carga de trabalho, não é possível mudar ou remover a política do MIG.
Reparos iniciados pelo MIG: é necessário desativar os reparos iniciados pelo MIG definindo o campo
defaultActionOnFailurecomoDO_NOTHING. Nessa configuração, o MIG não realiza nenhuma ação em uma instância com falha. O Compute Engine recupera automaticamente a instância com falha reiniciando todas as instâncias na mesma fração em uma capacidade íntegra.
Recursos não compatíveis: MIGs com TPUs não são compatíveis com os seguintes recursos:
- Flexibilidade de instância
- Solicitações de redimensionamento para obter recursos de uma só vez
- Configuração com estado
- Para um MIG que forma uma fração de TPU de vários hosts, o seguinte também está indisponível:
A seguir
- Saiba como criar um MIG com frações de TPU de host único
- Saiba como criar um MIG com uma fração de TPU de vários hosts