Visão geral dos clusters de treinamento da Gemini Enterprise Agent Platform

Se você tiver interesse em clusters de treinamento da Gemini Enterprise Agent Platform, entre em contato com seu representante de vendas para acesso.

Os clusters de treinamento da Gemini Enterprise Agent Platform são um serviço do Google Cloud Google Cloud criado para simplificar e acelerar as cargas de trabalho de IA/ML maiores e mais complexas. Ele foi criado especificamente para resolver desafios em treinamentos de grande escala, como configuração complexa de clusters, otimização de frameworks, tratamento de falhas de hardware e integração de conjuntos de ferramentas diferentes.

Principais propostas de valor e recursos

Os clusters de treinamento da Gemini Enterprise Agent Platform oferecem vários benefícios principais:

  • UX do Slurm de código aberto e transparência do cluster: os clusters de treinamento da Gemini Enterprise Agent Platform oferecem ferramentas conhecidas e flexíveis para iniciar e gerenciar jobs por meio de uma experiência do usuário do Slurm de código aberto. O Slurm é um padrão do setor conhecido pelo agendamento otimizado de GPU, tolerância a falhas automatizada e inicialização simplificada de jobs paralelos.

  • Configuração e configuração automatizadas de clusters: os clusters de treinamento da Gemini Enterprise Agent Platform automatizam a configuração e a configuração de clusters, com o objetivo de fazer a transição da reserva para o treinamento de produção em horas. Os usuários podem criar clusters usando o Google Cloud console (com arquiteturas de referência ou configuração detalhada) ou por chamadas de API com arquivos JSON.

  • Receitas e fluxos de trabalho de ciência de dados pré-configurados: Os clusters de treinamento da Gemini Enterprise Agent Platform incluem ferramentas criadas para fins específicos e receitas de treinamento otimizadas para iniciar o treinamento de casos de uso comuns, como modelos Llama e Gemma, abrangendo pré-treinamento, SFT (ajuste supervisionado) e aprendizado por reforço (RL). Essas receitas são pré-configuradas para desempenho de ponta (SOTA) na Google Cloud infraestrutura, demonstrando ganhos significativos de desempenho.

  • Resiliência de hardware e alta disponibilidade: os clusters de treinamento da Gemini Enterprise Agent Platform são projetados com resiliência de hardware para aumentar o tempo de atividade do cluster. Ele resolve automaticamente problemas de hardware, detecta e tria vários modos de falha (por exemplo, verificações de correção, verificações de velocidade, erros de código de correção de erros (ECC), verificações do NVIDIA Data Center GPU Manager (DCGM), capacidade de espaço em disco) e aciona ações de correção, como reinicialização, recriação de imagem ou substituição de nós com falha e retomada de checkpoints. Isso ajuda a mitigar o aumento significativo de custos e atrasos causados por interrupções de jobs e falhas de hardware em treinamentos de grande escala.

  • Arquitetura e componentes: os clusters de treinamento da Gemini Enterprise Agent Platform são executados na infraestrutura do Compute Engine com suporte a GPUs e CPUs. Ele aproveita um orquestrador Slurm gerenciado para implantar e gerenciar nós de computação, incluindo nós de login e de trabalho. O serviço é integrado a outros Google Cloud serviços, como rede e armazenamento.

  • MLOps e observabilidade: integra-se às ferramentas do Vertex ML Ops, como o Gemini Enterprise Agent Platform Model Registry para registro, rastreamento e controle de versões automáticos de fluxos de trabalho treinados, e a Vertex AI Inference para implantação com escalonamento automático e métricas automatizadas. Os clusters de treinamento também apresentam integração automática de observabilidade com o Vertex AI TensorBoard para visualizar processos de treinamento, rastrear métricas e identificar problemas com antecedência.

Os clusters de treinamento podem ser criados, recuperados, listados, atualizados e excluídos usando a API de clusters de treinamento da Gemini Enterprise Agent Platform. Após a criação do cluster, os usuários podem validar a funcionalidade dele fazendo login nos nós, executando comandos básicos do Slurm (por exemplo, sinfo, sbatch) e executando cargas de trabalho relacionadas à GPU (por exemplo, nvidia-smi).

Os clusters de treinamento da Gemini Enterprise Agent Platform fornecem uma API para iniciar jobs de LLM pré-criados usando receitas otimizadas para modelos como Llama e Gemma, com suporte a pré-treinamento e pré-treinamento contínuo de checkpoints. O monitoramento de jobs é possível fazendo login no nó de login e examinando arquivos de saída e comandos do Slurm, como squeue.

Terminologia

Esta seção fornece definições de termos e conceitos importantes para entender e usar clusters de treinamento da Gemini Enterprise Agent Platform de maneira eficaz. Esses termos abrangem componentes principais do serviço, considerações arquitetônicas, tecnologias de armazenamento integradas e conceitos fundamentais de machine learning (ML) e MLOps que sustentam o ambiente de treinamento.

Principais conceitos de serviço

  • Uma única máquina virtual (instância do Compute Engine) em um cluster. No contexto do treinamento gerenciado em clusters reservados, um nó se refere a uma máquina virtual (VM) individual que serve como uma única unidade de computação no cluster. Pense nisso como uma das máquinas de trabalho dedicadas que executa uma parte do job de treinamento geral. Cada nó é equipado com recursos específicos, como CPU, memória e aceleradores (por exemplo, GPUs A3 ou A4), e todos trabalham juntos de maneira coordenada para lidar com tarefas de treinamento distribuídas e de grande escala.
nó de login
partição
  • No Slurm, um agrupamento lógico de nós, geralmente usado para separar nós com configurações de hardware diferentes.
receita
  • No contexto do treinamento gerenciado, uma receita é um pacote abrangente e reutilizável que contém tudo o que é necessário para executar uma carga de trabalho de treinamento específica de grande escala.
cluster do Slurm
  • Uma coleção de instâncias do Compute Engine, gerenciada pelo Slurm, que inclui um nó de login e vários nós de trabalho configurados para executar jobs de treinamento. Para mais informações, consulte Gerenciador de cargas de trabalho do Slurm.
nó de trabalho
  • Um nó de trabalho se refere a uma máquina individual ou instância computacional em um cluster responsável por executar tarefas ou realizar trabalhos. Em sistemas como clusters do Kubernetes ou do Ray, os nós são as unidades fundamentais de computação. Para mais informações, consulte O que é computação de alto desempenho (HPC)?.

Arquitetura e rede

rede VPC do consumidor
  • Uma rede VPC do consumidor é uma nuvem privada virtual (VPC) do Google Cloud que acessa de forma privada um serviço hospedado em outra VPC (conhecida como VPC do produtor). Para mais informações, consulte Private Service Connect.
Unidade máxima de transmissão (MTU, na sigla em inglês)
  • O maior tamanho de um pacote de dados que um dispositivo conectado à rede pode transmitir. Tamanhos maiores de MTU (jumbo frames) podem melhorar o desempenho da rede para determinadas cargas de trabalho. Para mais informações, consulte Unidade de transmissão máxima.
acesso a serviços particulares
  • O acesso privado a serviços é uma conexão privada entre sua rede de nuvem privada virtual (VPC) e redes de propriedade do Google ou de provedores de serviços terceirizados. Ele permite que instâncias de máquina virtual (VM) na sua rede VPC se comuniquem com esses serviços usando endereços IP internos, evitando a exposição à Internet pública. Para mais informações, consulte Acesso a serviços particulares.
Peering de rede VPC
  • Uma conexão de rede que permite que duas redes VPC se comuniquem de forma privada. No contexto do treinamento gerenciado em clusters reservados, o peering de rede VPC é um componente essencial para integrar serviços essenciais. Por exemplo, é o método necessário para conectar a VPC do cluster a uma instância do Filestore, que fornece o diretório `/home` compartilhado necessário para todos os nós do cluster.
zone
  • Uma área de implantação específica em uma região do Google Cloud. No contexto do treinamento gerenciado em clusters reservados, para melhor desempenho, todos os componentes do serviço (o cluster, o Filestore e as instâncias do Managed Lustre) precisam ser criados na mesma zona.

Tecnologias de armazenamento integradas

Cloud Storage FUSE
  • Um adaptador FUSE de código aberto que permite ativar buckets do Cloud Storage como um sistema de arquivos em sistemas Linux ou macOS. Para mais informações, consulte Cloud Storage FUSE.
Filestore
  • Um serviço de armazenamento de arquivos totalmente gerenciado e de alto desempenho do Google Cloud, geralmente usado para aplicativos que exigem um sistema de arquivos compartilhado. Para mais informações, consulte Visão geral do Filestore.
Managed Lustre
  • Um sistema de arquivos paralelo e distribuído projetado para computação de alto desempenho. O Managed Lustre do Google Cloud oferece um sistema de arquivos de alta capacidade de processamento para cargas de trabalho exigentes. Para mais informações, consulte Visão geral do Managed Lustre.
nível de desempenho
  • Uma configuração para uma instância do Managed Lustre que define a velocidade de capacidade de processamento (em MBps por TiB) e afeta a capacidade mínima e máxima.

Principais conceitos de ML e MLOps

checkpoint
  • Dados que capturam o estado dos parâmetros de um modelo durante ou após a conclusão do treinamento. Por exemplo, durante o treinamento, é possível: 1. Interromper o treinamento, talvez intencionalmente ou como resultado de determinados erros. 2. Capturar o checkpoint. 3. Mais tarde, recarregar o checkpoint, possivelmente em um hardware diferente. 4. Reiniciar o treinamento. No Gemini, um checkpoint se refere a uma versão específica de um modelo do Gemini treinado em um conjunto de dados específico.
Ajuste supervisionado (SFT)
  • Uma técnica de machine learning em que um modelo pré-treinado é treinado ainda mais em um conjunto de dados menor e rotulado para adaptá-lo a uma tarefa específica.
Vertex AI Inference
  • Um serviço da Vertex AI que permite usar um modelo de machine learning (ML) treinado para fazer inferências de dados novos e não vistos. A Vertex AI fornece serviços para implantar modelos para inferência. Para mais informações, consulte Receber inferências de um modelo treinado personalizado.
Vertex AI Model Registry
  • O Vertex AI Model Registry é um repositório central em que é possível gerenciar o ciclo de vida dos seus modelos de ML. No Vertex AI Model Registry, você tem uma visão geral dos seus modelos para organizar, rastrear e treinar melhor as novas versões. Quando houver uma versão de modelo que você gostaria de implantar, será possível atribuí-la a um endpoint diretamente do registro ou, usando aliases, implantar modelos em um endpoint. Para mais informações, consulte Introdução ao Vertex AI Model Registry.
Vertex AI TensorBoard
  • O Vertex AI TensorBoard é um serviço gerenciado e escalonável no Google Cloud que permite que cientistas de dados e engenheiros de ML visualizem experimentos de machine learning, depurem treinamento de modelo e rastreiem métricas de desempenho usando a interface familiar do TensorBoard de código aberto. Ele se integra perfeitamente ao Vertex AI Training e a outros serviços, fornecendo armazenamento persistente para dados de experimentos e permitindo a análise colaborativa do desenvolvimento de modelos. Para mais informações, consulte Introdução ao Vertex AI TensorBoard.