Visão geral do Hipercomputador de IA

O Hipercomputador de IA é um sistema de supercomputação integrado otimizado para oferecer suporte às suas cargas de trabalho de inteligência artificial (IA) e machine learning (ML). Ele é o portfólio unificado da infraestrutura de IA do Google Cloud Google Cloude oferece um único ponto de entrada para explorar, configurar e implantar hardware otimizado para performance, software aberto e modelos de consumo flexíveis.

O Hipercomputador de IA incorpora design no nível do sistema e práticas recomendadas para aumentar a eficiência em todo o ciclo de vida do desenvolvimento de IA, desde a prototipagem e o desenvolvimento até o treinamento em grande escala e a disponibilização em tempo real.

Arquitetura do sistema

O Hipercomputador de IA integra verticalmente esses três componentes para maximizar bomput—a medida da produtividade real de machine learning:

  • Infraestrutura otimizada para performance: oferece aceleradores (GPUs NVIDIA e Google Cloud TPUs), rede e recursos de armazenamento.
    • GPUs: categorizadas por como o sistema processa os eventos do ciclo de vida e a manutenção:
      • GPUs gerais: infraestrutura gerenciada como unidades de computação independentes com manutenção assíncrona.
      • GPUs clusterizadas: clusters de alta performance gerenciados como um único sistema fortemente acoplado com manutenção sincronizada.
    • TPUs: usam hardware projetado para realizar grandes operações de matriz e têm memória de alta largura de banda (HBM) no chip para modelos e tamanhos de lote maiores. As TPUs podem ser conectadas em grupos chamados frações que escalonar verticalmente suas cargas de trabalho com pouca ou nenhuma alteração no código. Para mais informações sobre a infraestrutura de TPU, consulte a documentação do Cloud TPUs.
  • Software aberto: oferece versões otimizadas de frameworks de machine learning (PyTorch, JAX e TensorFlow) e plataformas de orquestração. Para implantar e gerenciar seus aceleradores, escolha entre as seguintes opções:
    • Google Kubernetes Engine para escalonamento automatizado nativo de contêineres
    • Slurm pelo Cluster Director
    • Blueprints do Cluster Toolkit
  • Opções de consumo: oferece opções de provisionamento flexíveis com base nas necessidades da carga de trabalho:
    • VMs de início flexível, VMs spot e reservas: oferecem opções flexíveis para diferentes cargas de trabalho.
    • Dynamic Workload Scheduler: oferece provisionamento atômico para blocos inteiros de nós interconectados para treinamento em grande escala.

Benefícios

  • Alta performance e bomput: otimize o agendamento e as camadas de execução para maximizar o bomput, ajudando os aceleradores a gastar mais tempo em computação produtiva e menos tempo em sobrecarga do sistema.
  • Confiabilidade integrada: acesse recursos de confiabilidade especializados:
    • GPUs clusterizadas: inclui monitoramento automatizado da integridade do hardware e substituição proativa de nós.
    • GPUs gerais: usa o reparo automático de Google Cloud nós padrão para manter o tempo de atividade no nível do pod para disponibilizar frotas.
  • Armazenamento otimizado: use serviços de armazenamento de alta capacidade, como o Google Cloud Managed Lustre e o Cloud Storage Rapid, para eliminar gargalos de E/S.

Casos de uso

O Hipercomputador de IA atende às necessidades destes casos de uso:

Caso de uso Cargas de trabalho de exemplo
Cargas de trabalho de IA e ML em grande escala
  • Treinamento distribuído para IA generativa
  • Inferência para IA generativa
  • Detecção de fraude
  • Modelos de recomendação
Inferência e disponibilização do modelo
  • Detecção de fraude em tempo real
  • Mecanismos de recomendação para resultados em tempo real
Prototipagem e desenvolvimento
  • Experimentos em pequena escala
  • Desenvolvimento inicial

A seguir