Terminologia

Os termos a seguir se aplicam ao Hipercomputador de IA.

Acelerador
Um dispositivo de hardware especializado, como uma GPU ou TPU, projetado para realizar tarefas específicas, como cargas de trabalho de machine learning, com mais eficiência do que um processador de uso geral.

Bloco
Uma coleção de sub-blocos interconectados. Em um bloco, qualquer GPU pode ser acessada pela estrutura de rede, o que garante uma comunicação de latência ultrabaixa para suas tarefas de treinamento distribuídas.

Cluster
Uma coleção de blocos interconectados unidos por uma estrutura de alta velocidade. A estrutura de rede leste-oeste sem bloqueio permite dimensionar trabalhos de treinamento enormes em milhares de GPUs sem encontrar gargalos de desempenho ou largura de banda.

GPU em cluster
Uma categoria de famílias de máquinas para GPUs, incluindo A4X, A4, A3 Ultra, A3 Mega e A3 High (8 GPUs). As GPUs em cluster permitem que as equipes implantem e dimensionem milhares de aceleradores interconectados como um único sistema fortemente acoplado usando estruturas de rede especializadas e manutenção sincronizada. Elas são ideais para cargas de trabalho que exigem computação extrema, memória e sincronização de rede de alta velocidade. Os casos de uso comuns incluem modelos de base de pré-treinamento com trilhões de parâmetros, modelos de fronteira e simulações para descoberta de medicamentos.

Manutenção emergencial
Às vezes, chamada de manutenção de emergência. Um evento de manutenção não planejado causado por um problema crítico de hardware, software ou segurança. Para tipos de máquinas aceleradoras compatíveis, a manutenção emergencial fornece uma notificação antecipada em vez de uma interrupção imediata. Essa notificação dá tempo para você esgotar as cargas de trabalho e, opcionalmente, acionar o reparo antes que o sistema encerre as VMs.

GPU geral
Uma categoria de famílias de máquinas de GPU, incluindo G2, G4, A2, N1+T4 e A3 Edge. As GPUs gerais permitem que as equipes implantem e dimensionem aceleradores NVIDIA com autonomia operacional completa, ignorando a complexidade arquitetônica de clusters de supercomputação coordenados. Elas são ideais para cargas de trabalho que priorizam alta disponibilidade, provisionamento de autoatendimento e escalonamento independente. Os casos de uso comuns incluem inferência em tempo real, RAG, prototipagem e treinamento de modelos pequenos a médios.

Estrutura de redelink
Uma estrutura de rede fornece conectividade de alta largura de banda e baixa latência em todos os blocos e Google Cloud serviços em um cluster. O Jupiter é a arquitetura de rede do data center do Google que usa redes definidas por software e switches de circuito óptico para evoluir a rede e otimizar a performance dela.

Nó ou host
Uma única máquina de servidor físico no data center. Cada host tem recursos de computação associados, como aceleradores. O número e a configuração desses recursos de computação dependem da família de máquinas. As instâncias do Compute Engine são provisionadas em um host físico.

Um domínio NVLink, também chamado de sub-bloco, é a unidade principal de capacidade para máquinas A4X Max e A4X. Um domínio NVLink consiste em 18 instâncias A4X Max ou A4X (72 GPUs) conectadas por um sistema NVLink de vários nós.

Sub-blocolink
Um grupo de hosts e hardware de conectividade associado que estão em um único rack físico. No contexto de máquinas A4X Max e A4X, um sub-bloco também é chamado de domínio NVLink.

Superbloco
Um agrupamento físico de máquinas interconectadas em data centers. Ao colocar máquinas dentro de um superbloco, você consegue a capacidade de processamento de rede extrema e a latência de submilissegundos necessárias para executar cargas de trabalho de treinamento com acoplamento rígido.

Mais informações

Os documentos a seguir fornecem mais explicações sobre as terminologias relevantes para os tópicos correspondentes: