As GPUs em cluster, como as séries de máquinas A4X Max, A4X, A4, A3 Ultra, A3 Mega, e A3 High (8 GPUs), foram projetadas para permitir que você execute clusters de inteligência artificial (IA) e machine learning (ML) em grande escala e oferecem os seguintes recursos de gerenciamento de clusters:

A maioria dos recursos de gerenciamento de clusters só é compatível com a capacidade vinculada à reserva, ou seja, a infraestrutura que usa o modelo de provisionamento vinculado à reserva, que só oferece suporte a tipos de máquina de GPUs em cluster. Para capacidade que usa qualquer outro modelo de provisionamento, apenas os seguintes recursos de gerenciamento de clusters estão disponíveis:

Colocação de recursos de infraestrutura de IA

Ao usar GPUs em cluster, como A4X Max, A4X, A4, A3 Ultra, A3 Mega e A3 High (8 GPUs), é possível solicitar máquinas host que o Compute Engine provisiona o mais próximo possível. Essas máquinas oferecem os seguintes recursos:

Essa organização de recursos minimiza os saltos de rede e otimiza a menor latência de rede. Para implantar blocos de máquinas otimizadas por acelerador que o Compute Engine aloca densamente, use as seguintes opções:

Posicionamento com reconhecimento de topologia de cluster

Depois de criar GPUs em cluster, é possível receber informações de topologia nos níveis de nó e cluster. Essas informações ajudam você a fazer o seguinte:

  • Ajuste o design do aplicativo ou da carga de trabalho para minimizar ainda mais a latência de rede.

  • Entenda e resolva problemas de latência de rede e desempenho para instâncias que se comunicam com frequência. Esses problemas podem ocorrer se as instâncias estiverem inesperadamente distantes umas das outras.

Especificamente, as informações de topologia são compatíveis da seguinte maneira:

  • As informações de topologia funcionam melhor com capacidade vinculada à reserva, que é necessária para visualizar a topologia de uma reserva.

  • Para VMs spot, as informações de topologia só aparecem quando uma máquina usa uma política de posicionamento compacto ou uma política de carga de trabalho.

Para ver mais informações, consulte os seguintes tópicos:

Modo operacional do cluster

Ao reservar capacidade vinculada à reserva para criar instâncias ou clusters de computação, o tipo de máquina reservado determina o modo operacional do cluster para as instâncias. Esse modo especifica como as instâncias se comportam após erros de host ou relatórios de host com falha. Os modos operacionais disponíveis para uma instância são modo gerenciado, em que o Compute Engine substitui automaticamente todas as máquinas com falha , mas retém parte da capacidade reservada para que as instâncias tenham os recursos necessários para serem reiniciadas. Ou o modo de capacidade total, em que você tem acesso à capacidade reservada completa, mas é responsável por gerenciar falhas e manutenção planejada.

Para mais informações, consulte Modo operacional de reserva.

Programação e controles de manutenção de clusters

Você controla a manutenção de GPUs em cluster usando o agendamento com reconhecimento de topologia em um bloco de recursos. Esse recurso ajuda a sincronizar upgrades para que as cargas de trabalho sejam mais resilientes a eventos de host e minimizem interrupções. Essa abordagem ajuda a melhorar o throughput da carga de trabalho.

Para facilitar o controle total dos eventos de manutenção, use os seguintes recursos:

Tipo de programação de manutenção

Ao reservar capacidade vinculada à reserva para criar instâncias de computação ou clusters de GPUs em cluster, é possível definir como o Compute Engine mantém a infraestrutura em que as instâncias são executadas. Com base no tipo de máquina que você quer usar para as instâncias, é possível escolher entre a manutenção sincronizada em instâncias (agrupadas) ou programações de manutenção diferentes (independentes).

Para mais informações, consulte Tipos de programação de manutenção.

Gerenciar eventos de host

Depois de criar GPUs em cluster e iniciar a carga de trabalho, é possível configurar alertas e receber notificações quando a manutenção das instâncias ou blocos reservados for programada, iniciada ou concluída. Também é possível visualizar e, se necessário, iniciar manualmente a manutenção em uma instância ou bloco reservado antes do horário programado. Essas opções ajudam você a controlar e minimizar proativamente os períodos de inatividade das cargas de trabalho.

Para ver mais informações, consulte os seguintes tópicos:

Ferramentas de monitoramento e diagnóstico de clusters

Para monitoramento e solução de problemas, os tipos de máquina de GPU em cluster incluem os seguintes serviços para capacidade vinculada à reserva:

A seguir