As GPUs em cluster, como as séries de máquinas A4X Max, A4X, A4, A3 Ultra, A3 Mega, e A3 High (8 GPUs), foram projetadas para permitir que você execute clusters de inteligência artificial (IA) e machine learning (ML) em grande escala e oferecem os seguintes recursos de gerenciamento de clusters:
- Colocação de infraestrutura de GPU em cluster
- Posicionamento com reconhecimento de topologia de cluster
- Modo operacional do cluster
- Programação e controles de manutenção de clusters
- Ferramentas de monitoramento e diagnóstico de clusters
Série de máquinas compatível
Os recursos de gerenciamento de clusters descritos nesta página estão disponíveis para a série de máquinas de GPU em cluster, que são otimizadas para cargas de trabalho de grande escala e vários nós.
Esses recursos não se aplicam à série de máquinas de GPU geral, que consiste em recursos de computação independentes que usam redes VPC padrão e não oferecem suporte a modos operacionais de manutenção ou colocação densa.
A tabela a seguir resume a série de máquinas com suporte no Hipercomputador de IA:
| Categoria | Série de máquina | Oferece suporte ao gerenciamento de clusters |
|---|---|---|
| GPUs em cluster | A4X Max, A4X, A4, A3 Ultra, A3 Mega, A3 High | Sim |
| GPUs gerais | A3 Edge, A2, G2, G4, N1 | Não |
Para mais informações sobre cada série de máquinas, consulte Sobre aceleradores de GPU.
A maioria dos recursos de gerenciamento de clusters só é compatível com a capacidade vinculada à reserva , ou seja, a infraestrutura que usa o modelo de provisionamento vinculado à reserva, que só oferece suporte a tipos de máquinas de GPU em cluster. Para capacidade que usa qualquer outro modelo de provisionamento, apenas os seguintes recursos de gerenciamento de clusters estão disponíveis:
- Colocação de recursos de infraestrutura de IA
- Posicionamento com reconhecimento de topologia de cluster
- Gerenciar eventos de host em instâncias
Colocação de infraestrutura de GPU em cluster
Ao usar GPUs em cluster, como A4X Max, A4X, A4, A3 Ultra, A3 Mega e A3 High (8 GPUs), é possível solicitar máquinas host que o Compute Engine provisiona o mais próximo possível. Essas máquinas oferecem os seguintes recursos:
O Compute Engine provisiona as máquinas como blocos de recursos.
Uma estrutura de rede de machine learning (ML) dinâmica interconecta as máquinas.
Essa organização de recursos minimiza os saltos de rede e otimiza a menor latência de rede. Para implantar blocos de máquinas otimizadas para aceleradores que o Compute Engine aloca densamente, use as seguintes opções:
Os recursos precisam ser alocados densamente uns com os outros quando você faz uma ou mais das seguintes ações:
Crie recursos que usam a mesma reserva adiantada no AI Hypercomputer ou reserva adiantada no modo de calendário.
Implante um grupo gerenciado de instâncias (MIG) que usa solicitações de redimensionamento e crie os recursos na mesma solicitação.
Especifique que os recursos usam a mesma política de posicionamento compacto ou política de carga de trabalho que especifica um valor de distância máxima. Especificamente, os recursos só precisam estar tão próximos quanto o valor de distância máxima especificado pela política.
Os recursos são alocados densamente uns com os outros, com base na disponibilidade de melhor esforço, quando você faz uma ou mais das seguintes ações:
Crie recursos na mesma solicitação para VMs de início flexível.
Especifique que os recursos usam a mesma política de posicionamento compacto ou política de carga de trabalho que não especifica uma distância máxima.
Posicionamento com reconhecimento de topologia de cluster
Depois de criar GPUs em cluster, é possível receber informações de topologia nos níveis de nó e cluster. Essas informações ajudam você a fazer o seguinte:
Ajuste o design do aplicativo ou da carga de trabalho para minimizar ainda mais a latência de rede.
Entenda e resolva problemas de latência de rede e desempenho para instâncias que se comunicam com frequência. Esses problemas podem ocorrer se as instâncias estiverem inesperadamente distantes umas das outras.
Especificamente, o suporte para recursos de topologia é o seguinte:
As informações de topologia funcionam melhor com capacidade vinculada à reserva, que é necessária para visualizar a topologia de uma reserva.
Os recursos de topologia só oferecem suporte a tipos de máquinas que oferecem suporte a políticas de posicionamento compacto.
Para VMs spot, as informações de topologia só aparecem quando uma máquina usa uma política de posicionamento compacto.
Para mais informações, consulte Visualizar a topologia de instâncias de computação.
Modo operacional do cluster
Ao reservar capacidade para criar instâncias de computação ou clusters usando GPUs em cluster, o tipo de máquina reservado determina o modo operacional do cluster para as instâncias. Esse modo especifica como as instâncias se comportam após erros de host ou relatórios de host com falha. Os modos operacionais disponíveis para uma instância são modo gerenciado, em que o Compute Engine substitui automaticamente todas as máquinas com falha , mas retém parte da capacidade reservada para que as instâncias tenham os recursos necessários para serem reiniciadas. Ou o modo de capacidade total, em que você tem acesso à capacidade reservada completa, mas é responsável por gerenciar falhas e manutenção planejada.
Para mais informações, consulte Modo operacional de reserva.
Programação e controles de manutenção de clusters
Você controla a manutenção de GPUs em cluster usando o agendamento com reconhecimento de topologia em um bloco de recursos. Esse recurso ajuda a sincronizar upgrades para que as cargas de trabalho sejam mais resilientes a eventos de host e minimizem interrupções. Essa abordagem ajuda a melhorar o throughput da carga de trabalho.
Para facilitar o controle total dos eventos de manutenção, use os seguintes recursos:
Tipo de programação de manutenção
Ao reservar capacidade para criar instâncias de computação ou clusters de GPUs em cluster, é possível definir como o Compute Engine mantém a infraestrutura em que as instâncias são executadas. Com base no tipo de máquina que você quer usar para as instâncias, é possível escolher entre a manutenção sincronizada em instâncias (agrupadas) ou programações de manutenção diferentes (independentes).
Para mais informações, consulte Tipos de programação de manutenção.
Gerenciar eventos de host
Depois de criar GPUs em cluster e iniciar a carga de trabalho, é possível configurar alertas e receber notificações quando a manutenção das instâncias ou blocos reservados for programada, iniciada ou concluída. Também é possível visualizar e, se necessário, iniciar manualmente a manutenção em uma instância ou bloco reservado antes do horário programado. Essas opções ajudam você a controlar e minimizar proativamente as inatividade das cargas de trabalho.
Para mais informações, consulte os seguintes tópicos:
Ferramentas de monitoramento e diagnóstico de clusters
Para monitoramento e solução de problemas, as GPUs em cluster incluem os seguintes serviços:
Previsão de degradação da integridade da VM, que ajuda a identificar VMs que provavelmente serão degradadas nas próximas cinco horas.
Relatório de host com falha, que pode ser usado para sinalizar problemas com máquinas host individuais.
Suporte a métricas do Cloud Monitoring, que ajudam a monitorar o desempenho de redes e GPUs.