Terminologia

Os termos a seguir se aplicam ao Hipercomputador de IA.

Acelerador
Um dispositivo de hardware especializado, como uma GPU ou TPU, projetado para realizar tarefas específicas, como cargas de trabalho de machine learning, de maneira mais eficiente do que um processador de uso geral.

Bloco
Um conjunto de sub-blocos interconectados por uma rede não bloqueante de alta velocidade que oferece alta largura de banda para todas as máquinas host no bloco.

Cluster
Um conjunto de blocos interconectados por uma malha de rede de alta velocidade. Cada cluster é globalmente exclusivo. Para máquinas A4X, A4, A3 Ultra, A3 Mega e A3 High (8 GPUs), um cluster fornece uma malha de rede comum e não bloqueante para seus blocos de capacidade de acelerador. Em um cluster, a comunicação entre nós (tráfego leste-oeste) não é bloqueada para toda a coleção de blocos.

GPU em cluster
Uma categoria de famílias de máquinas para GPUs, incluindo A4X, A4, A3 Ultra, A3 Mega e A3 High (8 GPUs). As GPUs em cluster permitem que as equipes implantem e escalonem milhares de aceleradores interconectados como um único sistema fortemente acoplado usando malhas de rede especializadas e manutenção sincronizada. Elas são ideais para cargas de trabalho que exigem computação, memória e sincronização de rede de alta velocidade. Os casos de uso comuns incluem modelos de base de pré-treinamento com trilhões de parâmetros, modelos de fronteira e simulações para descoberta de medicamentos.

Manutenção emergencial
Às vezes, chamada de manutenção de emergência. Um evento de manutenção não planejado causado por um problema crítico de hardware, software ou segurança. Para tipos de máquinas aceleradoras compatíveis, a manutenção emergencial fornece uma notificação antecipada em vez de uma interrupção imediata. Essa notificação oferece tempo para esgotar as cargas de trabalho e, opcionalmente, acionar o reparo antes que o sistema encerre as VMs.

GPU geral
Uma categoria de famílias de máquinas de GPU, incluindo G2, G4, A2, N1+T4 e A3 Edge. As GPUs gerais permitem que as equipes implantem e escalonem aceleradores NVIDIA com autonomia operacional completa, ignorando a complexidade arquitetônica de clusters de supercomputação coordenados. Elas são ideais para cargas de trabalho que priorizam alta disponibilidade, provisionamento de autoatendimento e escalonamento independente. Os casos de uso comuns incluem inferência em tempo real, RAG, prototipagem e treinamento de modelos pequenos a médios.

Malha de rede
Infraestrutura de rede de alta velocidade que oferece alta largura de banda e baixa latência em todos os blocos e Google Cloud serviços em um cluster. A malha usa a arquitetura da Jupiter. Para otimizar a performance, a malha usa rede definida por software e switches ópticos.

Nó ou host
Uma única máquina de servidor físico no data center. Cada host tem recursos de computação associados, como aceleradores. O número e a configuração desses recursos de computação dependem da família de máquinas. As instâncias do Compute Engine são provisionadas em um host físico.

Um domínio NVLink, também chamado de sub-bloco, é a unidade principal de capacidade para máquinas A4X Max e A4X. Um domínio NVLink consiste em 18 instâncias A4X Max ou A4X (72 GPUs) conectadas por um sistema NVLink de vários nós.

Sub-blocos
Um grupo de hosts e hardware de conectividade associado que estão em um único bloco físico. No contexto das máquinas A4X Max e A4X, um sub-bloco também é chamado de domínio NVLink.

Superbloco
Um agrupamento físico de máquinas interconectadas em data centers. Ao colocar máquinas dentro de um superbloco, você consegue a capacidade de processamento de rede extrema e a latência abaixo de milissegundos necessárias para executar cargas de trabalho de treinamento fortemente acopladas.

Mais informações

Os documentos a seguir fornecem mais explicações sobre as terminologias relevantes para os tópicos correspondentes: