Opções de consumo para o Hipercomputador de IA

O Hipercomputador de IA tem várias opções de consumo para adquirir recursos de computação. Essas opções atendem a necessidades como duração da carga de trabalho, tolerância a falhas e modelo de infraestrutura. Conheça essas opções e escolha a melhor para seu caso de uso.

Como alternativa à avaliação manual, você pode pedir ao Gemini no Google Cloud console para comparar as opções de consumo da sua carga de trabalho e orçamento. Para mais informações, consulte Projetar sua infraestrutura de IA com o Gemini.

Visão geral das opções de consumo

Para comparar as opções de consumo nas principais características, use a tabela a seguir:

Opção de consumo Modelo de provisionamento Ideal para Garantia de capacidade Duração Preemptiva Quota Descontos Modelo de alocação
Início flexível Início flexível Cargas de trabalho de curta duração, de até sete dias, que podem esperar a capacidade. Melhor esforço Até sete dias Não Cota preemptiva Com desconto (até 53%) nas séries compatíveis Denso para solicitações de redimensionamento de MIG; melhor esforço para VMs independentes.
VMs spot Spot Cargas de trabalho de GPU geral de curta duração e tolerantes a falhas. Melhor esforço Preemptiva Sim Cota preemptiva Com grande desconto (até 91%) Padrão
Reservas padrão Padrão Cargas de trabalho de GPU geral críticas que exigem um nível muito alto de garantia de capacidade. Muito alto Muito alto Definido pelo usuário Não Nenhuma cota consumida Taxas com desconto com descontos por compromisso de uso (CUDs)
Reservas adiantadas para blocos de capacidade Vinculada à reserva Treinamento de longa duração e em grande escala em GPU em cluster. Muito alto Ilimitado dentro do período de reserva. Não Aumentada automaticamente Com desconto (até 53%) com CUDs Denso
Reservas adiantadas no modo calendário Vinculada à reserva Cargas de trabalho de GPU em cluster de até 90 dias que exigem capacidade reservada. Muito alto Até 90 dias Não Nenhuma cota consumida Com desconto (até 53%) Denso
VMs sob demanda Padrão Cargas de trabalho de GPU geral sem duração específica. Melhor esforço Ilimitado Não Cota sob demanda Nenhum (pagamento por uso) Padrão

A opção de consumo usada para implantar sua infraestrutura depende se você usa GPU geral ou em cluster.

  • GPU geral: projetada para inferência em pequena escala , desenvolvimento e cargas de trabalho de treinamento em menor escala. Esse tipo de GPU oferece flexibilidade operacional por meio da manutenção assíncrona. Para conferir as opções disponíveis, consulte Opções de consumo para GPU geral.

  • GPU em cluster: projetada para cargas de trabalho de treinamento em grande escala, fortemente acopladas e cargas de trabalho de inferência, RL e modelos de raciocínio em grande escala que exigem alta garantia de capacidade e alocação de recursos densa para minimizar a latência de rede. Para conferir as opções disponíveis, consulte Opções de consumo para GPU em cluster.

Opções de consumo para GPUs gerais

Use as seguintes opções de consumo para adquirir capacidade para GPU geral.

Usar o início flexível

Para executar cargas de trabalho de curta duração que exigem recursos alocados de forma densa, você pode solicitar recursos de computação recursos por até sete dias usando o início flexível. Sempre que os recursos estiverem disponíveis, o Compute Engine criará o número solicitado de VMs. É possível interromper VMs de início flexível independentes, mas não é possível interromper VMs de início flexível que um grupo gerenciado de instâncias (MIG) cria por meio de solicitações de redimensionamento. As VMs de início flexível existem até que você as exclua ou até que o Compute Engine exclua as VMs no final da duração da execução.

Cargas de trabalho ideais

  • Pré-treinamento de modelos pequenos
  • Ajuste fino de modelos
  • Simulação de computação de alto desempenho (HPC)
  • Inferência em lote

Principais características

  • Modelo de provisionamento: início flexível.
  • Ampla compatibilidade de hardware: solicite qualquer tipo de máquina de GPU em cluster, exceto A4X Max e A4X.
  • Otimização de latência: aplique uma política de posicionamento compacta a VMs independentes para minimizar a latência de rede.
  • Eficiência de custos: receba um desconto de até 53% em vCPUs, memória, GPUs, e discos SSD locais para as séries de máquinas A4, A3, A2 e G4. As taxas padrão sob demanda se aplicam a outras séries compatíveis. Para mais informações, consulte Preços de início flexível.

Usar spot

Para executar cargas de trabalho tolerantes a falhas, você pode receber recursos de computação imediatamente com base em disponibilidade. Você recebe recursos pelo menor preço possível. No entanto, o Compute Engine pode forçar a interrupção das VMs a qualquer momento para recuperar a capacidade.

Cargas de trabalho ideais

  • Processamento em lote e análise de dados
  • Computação de alto desempenho (HPC) e codificação de mídia

Principais características

  • Modelo de provisionamento: spot.
  • Ampla compatibilidade de hardware: solicite qualquer tipo de máquina de GPU em cluster, exceto A4X Max e A4X.
  • Otimização de latência: aplique uma política de posicionamento compacta a VMs independentes para minimizar a latência de rede.
  • Eficiência de custos: receba um desconto de até 91% em vCPUs, memória, GPUs, e discos SSD locais.

Usar sob demanda

Dica: para aumentar suas chances de conseguir capacidade de GPU geral, use o início flexível ou spot. Essas opções de consumo oferecem GPUs a um preço com desconto em comparação com os preços sob demanda e foram projetadas para ajudar a aumentar suas chances de conseguir recursos de alta demanda, como GPUs.

Para executar cargas de trabalho sem duração específica, você pode receber recursos de computação imediatamente com base na disponibilidade. As VMs são executadas até que você as interrompa ou exclua.

Cargas de trabalho ideais

  • Inferência e disponibilização do modelo
  • Prototipagem e experimentação

Principais características

  • Modelo de provisionamento: padrão.
  • Disponibilidade imediata: crie instâncias de VM imediatamente sem aguardar o agendamento ou a aprovação da capacidade.
  • Preços padrão: pague pelos recursos nas taxas padrão sob demanda sem compromissos de longo prazo.
  • Ampla compatibilidade de hardware: use com qualquer série de máquinas de GPU compatível no caminho de GPU geral.

Usar reservas padrão

Para executar cargas de trabalho de GPU geral críticas que exigem um nível muito alto de garantia de capacidade, você pode usar reservas padrão.

Cargas de trabalho ideais

  • Cargas de trabalho de produção críticas
  • Cargas de trabalho que exigem capacidade garantida

Principais características

  • Modelo de provisionamento: padrão.
  • Garantia de capacidade: oferece uma garantia muito alta de que os recursos estão disponíveis.
  • Preços: as taxas padrão são aplicadas, mas você pode anexar CUDs para economizar.

Opções de consumo para GPU em cluster

Use as seguintes opções de consumo para adquirir capacidade para GPU em cluster.

Usar reservas adiantadas para blocos de capacidade

Para executar cargas de trabalho distribuídas de longa duração e em grande escala que exigem recursos alocados de forma densa, você pode solicitar recursos de computação para um período específico no futuro. Você tem acesso exclusivo a seus recursos reservados durante esse período e pode usar os recursos para criar VMs ou clusters. No final do período de reserva, o Compute Engine faz o seguinte:

  • O Compute Engine exclui a reserva.
  • Com base na ação de encerramento especificada para as VMs, o Compute Engine interrompe ou exclui todas as VMs que usam a reserva.

Cargas de trabalho ideais

  • Pré-treinamento de modelos de fundação
  • Inferência para modelos de fundação em vários hosts

Principais características

  • Modelo de provisionamento: vinculado à reserva.
  • Compatibilidade com máquinas premium: reserve tipos de máquinas A4X Max, A4X, A4, A3 Ultra, A3 Mega ou A3 High (8 GPUs).
  • Requisitos de compromisso: anexe um compromisso baseado em recursos para reservas de um ano ou mais.
  • Modificações dinâmicas: ative as notificações de manutenção de emergência de hardware para uso de jobs da Vertex AI após o início do período.

Usar reservas adiantadas no modo calendário

Para executar cargas de trabalho distribuídas de curta duração que exigem recursos alocados de forma densa, você pode solicitar recursos de computação por até 90 dias. Você tem acesso exclusivo aos recursos reservados durante esse período e pode usar os recursos para criar VMs ou clusters. No final do período de reserva, o Compute Engine faz o seguinte:

  • O Compute Engine exclui a reserva.
  • Com base na ação de encerramento especificada para as VMs, o Compute Engine interrompe ou exclui todas as VMs que usam a reserva.

Cargas de trabalho ideais

  • Pré-treinamento e ajuste fino
  • Simulações e inferências em grande escala

Principais características

  • Modelo de provisionamento: vinculado à reserva.
  • Compatibilidade com séries de máquinas: reserve tipos de máquinas A4, A3 Ultra, A3 Mega ou A3 High (8 GPUs) .
  • Limites de escalonabilidade: reserve até 80 VMs por um máximo de 90 dias.
  • Provisionamento otimizado: use um modelo vinculado à reserva para aumentar suas chances de conseguir GPUs.

Usar o início flexível

Use o início flexível para solicitações de redimensionamento de grupo gerenciado de instâncias (MIG) em cluster quando precisar de recursos alocados de forma densa por até sete dias.

Cargas de trabalho ideais

As VMs de início flexível são ideais para executar cargas de trabalho que podem ser iniciadas a qualquer momento, como as seguintes:

  • Pré-treinamento de modelos pequenos
  • Ajuste fino de modelos
  • Simulação de computação de alto desempenho (HPC)
  • Inferência em lote

Principais características

  • Modelo de provisionamento: início flexível.
  • Alocação de recursos: alocação densa para solicitações de redimensionamento de MIG.
  • Eficiência de custos: você recebe um desconto de até 53% em vCPUs, memória, GPUs, e discos SSD locais anexados para as séries de máquinas A4, A3, A2 e G4. As taxas padrão sob demanda se aplicam a outras séries de máquinas compatíveis.

Usar spot

Você pode usar VMs spot para cargas de trabalho tolerantes a falhas alocadas de forma densa para conseguir grandes descontos, entendendo que o Compute Engine pode forçar a interrupção das VMs para recuperar a capacidade.

Cargas de trabalho ideais

  • Treinamento distribuído tolerante a falhas
  • Processamento em lote

Principais características

  • Modelo de provisionamento: spot.
  • Preempção: o Compute Engine pode forçar a interrupção das instâncias a qualquer momento.
  • Eficiência de custos: receba um desconto de até 91% em vCPUs, memória, GPUs, e discos SSD locais anexados.

A seguir