Opções de consumo para o Hipercomputador de IA

O Hipercomputador de IA tem várias opções de consumo para adquirir recursos de computação. Essas opções atendem a necessidades como duração da carga de trabalho, tolerância a falhas e modelo de infraestrutura. Conheça essas opções e escolha a melhor para seu caso de uso.

Visão geral das opções de consumo

Para comparar as opções de consumo em relação às principais características, use a tabela a seguir:

Opção de consumo Modelo de provisionamento Ideal para Garantia de capacidade Duração Preemptiva Quota Descontos Modelo de alocação
Início flexível Início flexível Cargas de trabalho de curta duração, até sete dias, que podem esperar a capacidade. Melhor esforço Até sete dias Não Cota preemptiva Com desconto (até 53%) nas séries compatíveis Dense para solicitações de redimensionamento de MIG; melhor esforço para VMs independentes.
VMs spot Spot Cargas de trabalho de GPU gerais de curta duração e tolerantes a falhas. Melhor esforço Preemptiva Sim Cota preemptiva Com grande desconto (até 91%) Padrão
Reservas padrão Padrão Cargas de trabalho de GPU gerais críticas que exigem um nível muito alto de garantia de capacidade. Muito alto Muito alto Definido pelo usuário Não Nenhuma cota consumida Taxas com desconto com descontos por compromisso de uso (CUDs)
Reservas adiantadas para blocos de capacidade Vinculada à reserva Treinamento de longa duração e em grande escala em GPU em cluster. Muito alto Ilimitado dentro do período de reserva. Não Aumentada automaticamente Com desconto (até 53%) com CUDs Dense
Reservas adiantadas no modo calendário Vinculada à reserva Cargas de trabalho de GPU em cluster de até 90 dias que exigem capacidade reservada. Muito alto Até 90 dias Não Nenhuma cota consumida Com desconto (até 53%) Dense
VMs sob demanda Padrão Cargas de trabalho de GPU gerais sem duração específica. Melhor esforço Ilimitado Não Cota sob demanda Nenhum (pagamento por uso) Padrão

A opção de consumo usada para implantar a infraestrutura depende se você usa GPU geral ou em cluster.

  • GPU geral: projetada para inferência em pequena escala , desenvolvimento e cargas de trabalho de treinamento em menor escala. Esse tipo de GPU oferece flexibilidade operacional por meio da manutenção assíncrona. Para conferir as opções disponíveis, consulte Opções de consumo para GPU geral.

  • GPU em cluster: projetada para cargas de trabalho de treinamento em grande escala, fortemente acopladas e cargas de trabalho de inferência, RL e modelos de raciocínio em grande escala que exigem alta garantia de capacidade e alocação de recursos densa para minimizar a latência de rede. Para conferir as opções disponíveis, consulte Opções de consumo para GPU em cluster.

Opções de consumo para GPUs gerais

Use as seguintes opções de consumo para adquirir capacidade para GPU geral.

Usar o início flexível

Para executar cargas de trabalho de curta duração que exigem recursos alocados de forma densa, é possível solicitar recursos de computação por até sete dias usando o início flexível. Sempre que os recursos estiverem disponíveis, o Compute Engine vai criar o número solicitado de VMs. É possível interromper VMs de início flexível independentes, mas não é possível interromper VMs de início flexível que um grupo gerenciado de instâncias (MIG) cria por meio de solicitações de redimensionamento. As VMs de início flexível existem até que você as exclua ou até que o Compute Engine exclua as VMs no final da duração da execução.

Cargas de trabalho ideais

  • Pré-treinamento de modelos pequenos
  • Ajuste fino de modelos
  • Simulação de computação de alto desempenho (HPC)
  • Inferência em lote

Principais características

  • Modelo de provisionamento: início flexível.
  • Ampla compatibilidade de hardware: solicite qualquer tipo de máquina de GPU em cluster, exceto A4X Max e A4X.
  • Otimização de latência: aplique uma política de posicionamento compacta a VMs independentes para minimizar a latência de rede.
  • Eficiência de custos: receba um desconto de até 53% em vCPUs, memória, GPUs, e discos SSD locais para as séries de máquinas A4, A3, A2 e G4. As taxas padrão sob demanda se aplicam a outras séries compatíveis. Para mais informações, consulte Preços de início flexível.

Usar spot

Para executar cargas de trabalho tolerantes a falhas, é possível receber recursos de computação imediatamente com base em disponibilidade. Você recebe recursos pelo menor preço possível. No entanto, o Compute Engine pode forçar a interrupção das VMs a qualquer momento para recuperar a capacidade.

Cargas de trabalho ideais

  • Processamento em lote e análise de dados
  • Computação de alto desempenho (HPC) e codificação de mídia

Principais características

  • Modelo de provisionamento: spot.
  • Ampla compatibilidade de hardware: solicite qualquer tipo de máquina de GPU em cluster, exceto A4X Max e A4X.
  • Otimização de latência: aplique uma política de posicionamento compacta a VMs independentes para minimizar a latência de rede.
  • Eficiência de custos: receba um desconto de até 91% em vCPUs, memória, GPUs, e discos SSD locais.

Usar sob demanda

Dica: para aumentar suas chances de conseguir capacidade de GPU geral, use o início flexível ou o spot. Essas opções de consumo oferecem GPUs a um preço com desconto em comparação com os preços sob demanda e foram projetadas para ajudar a aumentar suas chances de conseguir recursos de alta demanda, como GPUs.

Para executar cargas de trabalho sem duração específica, é possível receber recursos de computação imediatamente com base na disponibilidade. As VMs são executadas até que você as interrompa ou exclua.

Cargas de trabalho ideais

  • Inferência e disponibilização do modelo
  • Prototipagem e experimentação

Principais características

  • Modelo de provisionamento: padrão.
  • Disponibilidade imediata: crie instâncias de VM imediatamente sem esperar por agendamento ou aprovação de capacidade.
  • Preços padrão: pague pelos recursos nas taxas padrão sob demanda sem compromissos de longo prazo.
  • Ampla compatibilidade de hardware: use com qualquer série de máquinas de GPU compatível no caminho de GPU geral.

Usar reservas padrão

Para executar cargas de trabalho de GPU gerais críticas que exigem um nível muito alto de garantia de capacidade, é possível usar reservas padrão.

Cargas de trabalho ideais

  • Cargas de trabalho de produção críticas
  • Cargas de trabalho que exigem capacidade garantida

Principais características

  • Modelo de provisionamento: padrão.
  • Garantia de capacidade: oferece uma garantia muito alta de que os recursos estão disponíveis.
  • Preços: as taxas padrão são aplicadas, mas é possível anexar CUDs para economizar.

Opções de consumo para GPU em cluster

Use as seguintes opções de consumo para adquirir capacidade para GPU em cluster.

Usar reservas adiantadas para blocos de capacidade

Para executar cargas de trabalho distribuídas de longa duração e em grande escala que exigem recursos alocados de forma densa, é possível solicitar recursos de computação para um período específico no futuro. Você tem acesso exclusivo a seus recursos reservados durante esse período e pode usar os recursos para criar VMs ou clusters. No final do período de reserva, o Compute Engine faz o seguinte:

  • O Compute Engine exclui a reserva.
  • Com base na ação de encerramento especificada para as VMs, o Compute Engine interrompe ou exclui todas as VMs que usam a reserva.

Cargas de trabalho ideais

  • Pré-treinamento de modelos de fundação
  • Inferência para modelos de fundação em vários hosts

Principais características

  • Modelo de provisionamento: vinculado à reserva.
  • Suporte a máquinas premium: reserve tipos de máquinas A4X Max, A4X, A4, A3 Ultra, A3 Mega ou A3 High (8 GPUs).
  • Requisitos de compromisso: anexe um compromisso baseado em recursos para reservas de um ano ou mais.
  • Modificações dinâmicas: ative as notificações de manutenção de emergência de hardware para uso de jobs da Vertex AI após o início do período.

Usar reservas adiantadas no modo calendário

Para executar cargas de trabalho distribuídas de curta duração que exigem recursos alocados de forma densa, é possível solicitar recursos de computação por até 90 dias. Você tem acesso exclusivo aos recursos reservados durante esse período e pode usar os recursos para criar VMs ou clusters. No final do período de reserva, o Compute Engine faz o seguinte:

  • O Compute Engine exclui a reserva.
  • Com base na ação de encerramento especificada para as VMs, o Compute Engine interrompe ou exclui todas as VMs que usam a reserva.

Cargas de trabalho ideais

  • Pré-treinamento e ajuste fino
  • Simulações e inferências em grande escala

Principais características

  • Modelo de provisionamento: vinculado à reserva.
  • Suporte a séries de máquinas: reserve tipos de máquinas A4, A3 Ultra, A3 Mega ou A3 High (8 GPUs) .
  • Limites de escalonabilidade: reserve até 80 VMs por um máximo de 90 dias.
  • Provisionamento otimizado: use um modelo vinculado à reserva para aumentar suas chances de conseguir GPUs.

Usar o início flexível

Use o início flexível para solicitações de redimensionamento de grupo gerenciado de instâncias (MIG) em cluster quando precisar de recursos alocados de forma densa por até sete dias.

Cargas de trabalho ideais

As VMs de início flexível são ideais para executar cargas de trabalho que podem ser iniciadas a qualquer momento, como as seguintes:

  • Pré-treinamento de modelos pequenos
  • Ajuste fino de modelos
  • Simulação de computação de alto desempenho (HPC)
  • Inferência em lote

Principais características

  • Modelo de provisionamento: início flexível.
  • Alocação de recursos: alocação densa para solicitações de redimensionamento de MIG.
  • Eficiência de custos: receba um desconto de até 53% em vCPUs, memória, GPUs, e discos SSD locais anexados para as séries de máquinas A4, A3, A2 e G4. As taxas padrão sob demanda se aplicam a outras séries compatíveis.

Usar spot

É possível usar VMs spot para cargas de trabalho tolerantes a falhas alocadas de forma densa para conseguir grandes descontos, entendendo que o Compute Engine pode forçar a interrupção das VMs para recuperar a capacidade.

Cargas de trabalho ideais

  • Treinamento distribuído tolerante a falhas
  • Processamento em lote

Principais características

  • Modelo de provisionamento: spot.
  • Preempção: o Compute Engine pode forçar a interrupção das instâncias a qualquer momento.
  • Eficiência de custos: receba um desconto de até 91% em vCPUs, memória, GPUs, e discos SSD locais anexados.

A seguir