Recursos de gerenciamento de clusters

As GPUs em cluster, como as séries de máquinas A4X Max, A4X, A4, A3 Ultra, A3 Mega, e A3 High (8 GPUs), foram projetadas para permitir que você execute clusters de inteligência artificial (IA) e machine learning (ML) em grande escala e oferecem os seguintes recursos de gerenciamento de clusters:

Série de máquinas compatível

Os recursos de gerenciamento de clusters descritos nesta página estão disponíveis para a série de máquinas de GPU em cluster, que são otimizadas para cargas de trabalho de grande escala e vários nós.

Esses recursos não se aplicam à série de máquinas de GPU geral, que consiste em recursos de computação independentes que usam redes VPC padrão e não oferecem suporte a modos operacionais de manutenção ou colocação densa.

A tabela a seguir resume a série de máquinas com suporte no Hipercomputador de IA:

Categoria Série de máquina Oferece suporte ao gerenciamento de clusters
GPUs em cluster A4X Max, A4X, A4, A3 Ultra, A3 Mega, A3 High Sim
GPUs gerais A3 Edge, A2, G2, G4, N1 Não

Para mais informações sobre cada série de máquinas, consulte Sobre aceleradores de GPU.

A maioria dos recursos de gerenciamento de clusters só é compatível com a capacidade vinculada à reserva , ou seja, a infraestrutura que usa o modelo de provisionamento vinculado à reserva, que só oferece suporte a tipos de máquinas de GPU em cluster. Para capacidade que usa qualquer outro modelo de provisionamento, apenas os seguintes recursos de gerenciamento de clusters estão disponíveis:

Colocação de infraestrutura de GPU em cluster

Ao usar GPUs em cluster, como A4X Max, A4X, A4, A3 Ultra, A3 Mega e A3 High (8 GPUs), é possível solicitar máquinas host que o Compute Engine provisiona o mais próximo possível. Essas máquinas oferecem os seguintes recursos:

Essa organização de recursos minimiza os saltos de rede e otimiza a menor latência de rede. Para implantar blocos de máquinas otimizadas para aceleradores que o Compute Engine aloca densamente, use as seguintes opções:

Posicionamento com reconhecimento de topologia de cluster

Depois de criar GPUs em cluster, é possível receber informações de topologia nos níveis de nó e cluster. Essas informações ajudam você a fazer o seguinte:

  • Ajuste o design do aplicativo ou da carga de trabalho para minimizar ainda mais a latência de rede.

  • Entenda e resolva problemas de latência de rede e desempenho para instâncias que se comunicam com frequência. Esses problemas podem ocorrer se as instâncias estiverem inesperadamente distantes umas das outras.

Especificamente, o suporte para recursos de topologia é o seguinte:

Para mais informações, consulte Visualizar a topologia de instâncias de computação.

Modo operacional do cluster

Ao reservar capacidade para criar instâncias de computação ou clusters usando GPUs em cluster, o tipo de máquina reservado determina o modo operacional do cluster para as instâncias. Esse modo especifica como as instâncias se comportam após erros de host ou relatórios de host com falha. Os modos operacionais disponíveis para uma instância são modo gerenciado, em que o Compute Engine substitui automaticamente todas as máquinas com falha , mas retém parte da capacidade reservada para que as instâncias tenham os recursos necessários para serem reiniciadas. Ou o modo de capacidade total, em que você tem acesso à capacidade reservada completa, mas é responsável por gerenciar falhas e manutenção planejada.

Para mais informações, consulte Modo operacional de reserva.

Programação e controles de manutenção de clusters

Você controla a manutenção de GPUs em cluster usando o agendamento com reconhecimento de topologia em um bloco de recursos. Esse recurso ajuda a sincronizar upgrades para que as cargas de trabalho sejam mais resilientes a eventos de host e minimizem interrupções. Essa abordagem ajuda a melhorar o throughput da carga de trabalho.

Para facilitar o controle total dos eventos de manutenção, use os seguintes recursos:

Tipo de programação de manutenção

Ao reservar capacidade para criar instâncias de computação ou clusters de GPUs em cluster, é possível definir como o Compute Engine mantém a infraestrutura em que as instâncias são executadas. Com base no tipo de máquina que você quer usar para as instâncias, é possível escolher entre a manutenção sincronizada em instâncias (agrupadas) ou programações de manutenção diferentes (independentes).

Para mais informações, consulte Tipos de programação de manutenção.

Gerenciar eventos de host

Depois de criar GPUs em cluster e iniciar a carga de trabalho, é possível configurar alertas e receber notificações quando a manutenção das instâncias ou blocos reservados for programada, iniciada ou concluída. Também é possível visualizar e, se necessário, iniciar manualmente a manutenção em uma instância ou bloco reservado antes do horário programado. Essas opções ajudam você a controlar e minimizar proativamente as inatividade das cargas de trabalho.

Para mais informações, consulte os seguintes tópicos:

Ferramentas de monitoramento e diagnóstico de clusters

Para monitoramento e solução de problemas, as GPUs em cluster incluem os seguintes serviços:

A seguir