O Hipercomputador de IA tem várias opções de consumo para adquirir recursos de computação. Essas opções atendem a necessidades como duração da carga de trabalho, tolerância a falhas e modelo de infraestrutura. Conheça essas opções e escolha a melhor para seu caso de uso.
Como alternativa à avaliação manual, você pode pedir ao Gemini no Google Cloud console para comparar as opções de consumo da sua carga de trabalho e orçamento. Para mais informações, consulte Projetar sua infraestrutura de IA com o Gemini.
Visão geral das opções de consumo
Para comparar as opções de consumo nas principais características, use a tabela a seguir:
| Opção de consumo | Modelo de provisionamento | Ideal para | Garantia de capacidade | Duração | Preemptiva | Quota | Descontos | Modelo de alocação |
|---|---|---|---|---|---|---|---|---|
| Início flexível | Início flexível | Cargas de trabalho de curta duração, de até sete dias, que podem esperar a capacidade. | Melhor esforço | Até sete dias | Não | Cota preemptiva | Com desconto (até 53%) nas séries compatíveis | Denso para solicitações de redimensionamento de MIG; melhor esforço para VMs independentes. |
| VMs spot | Spot | Cargas de trabalho de GPU geral de curta duração e tolerantes a falhas. | Melhor esforço | Preemptiva | Sim | Cota preemptiva | Com grande desconto (até 91%) | Padrão |
| Reservas padrão | Padrão | Cargas de trabalho de GPU geral críticas que exigem um nível muito alto de garantia de capacidade. | Muito alto | Muito alto | Definido pelo usuário | Não | Nenhuma cota consumida | Taxas com desconto com descontos por compromisso de uso (CUDs) |
| Reservas adiantadas para blocos de capacidade | Vinculada à reserva | Treinamento de longa duração e em grande escala em GPU em cluster. | Muito alto | Ilimitado dentro do período de reserva. | Não | Aumentada automaticamente | Com desconto (até 53%) com CUDs | Denso |
| Reservas adiantadas no modo calendário | Vinculada à reserva | Cargas de trabalho de GPU em cluster de até 90 dias que exigem capacidade reservada. | Muito alto | Até 90 dias | Não | Nenhuma cota consumida | Com desconto (até 53%) | Denso |
| VMs sob demanda | Padrão | Cargas de trabalho de GPU geral sem duração específica. | Melhor esforço | Ilimitado | Não | Cota sob demanda | Nenhum (pagamento por uso) | Padrão |
A opção de consumo usada para implantar sua infraestrutura depende se você usa GPU geral ou em cluster.
GPU geral: projetada para inferência em pequena escala , desenvolvimento e cargas de trabalho de treinamento em menor escala. Esse tipo de GPU oferece flexibilidade operacional por meio da manutenção assíncrona. Para conferir as opções disponíveis, consulte Opções de consumo para GPU geral.
GPU em cluster: projetada para cargas de trabalho de treinamento em grande escala, fortemente acopladas e cargas de trabalho de inferência, RL e modelos de raciocínio em grande escala que exigem alta garantia de capacidade e alocação de recursos densa para minimizar a latência de rede. Para conferir as opções disponíveis, consulte Opções de consumo para GPU em cluster.
Opções de consumo para GPUs gerais
Use as seguintes opções de consumo para adquirir capacidade para GPU geral.
Usar o início flexível
Para executar cargas de trabalho de curta duração que exigem recursos alocados de forma densa, você pode solicitar recursos de computação recursos por até sete dias usando o início flexível. Sempre que os recursos estiverem disponíveis, o Compute Engine criará o número solicitado de VMs. É possível interromper VMs de início flexível independentes, mas não é possível interromper VMs de início flexível que um grupo gerenciado de instâncias (MIG) cria por meio de solicitações de redimensionamento. As VMs de início flexível existem até que você as exclua ou até que o Compute Engine exclua as VMs no final da duração da execução.
Cargas de trabalho ideais
- Pré-treinamento de modelos pequenos
- Ajuste fino de modelos
- Simulação de computação de alto desempenho (HPC)
- Inferência em lote
Principais características
- Modelo de provisionamento: início flexível.
- Ampla compatibilidade de hardware: solicite qualquer tipo de máquina de GPU em cluster, exceto A4X Max e A4X.
- Otimização de latência: aplique uma política de posicionamento compacta a VMs independentes para minimizar a latência de rede.
- Eficiência de custos: receba um desconto de até 53% em vCPUs, memória, GPUs, e discos SSD locais para as séries de máquinas A4, A3, A2 e G4. As taxas padrão sob demanda se aplicam a outras séries compatíveis. Para mais informações, consulte Preços de início flexível.
Usar spot
Para executar cargas de trabalho tolerantes a falhas, você pode receber recursos de computação imediatamente com base em disponibilidade. Você recebe recursos pelo menor preço possível. No entanto, o Compute Engine pode forçar a interrupção das VMs a qualquer momento para recuperar a capacidade.
Cargas de trabalho ideais
- Processamento em lote e análise de dados
- Computação de alto desempenho (HPC) e codificação de mídia
Principais características
- Modelo de provisionamento: spot.
- Ampla compatibilidade de hardware: solicite qualquer tipo de máquina de GPU em cluster, exceto A4X Max e A4X.
- Otimização de latência: aplique uma política de posicionamento compacta a VMs independentes para minimizar a latência de rede.
- Eficiência de custos: receba um desconto de até 91% em vCPUs, memória, GPUs, e discos SSD locais.
Usar sob demanda
Dica: para aumentar suas chances de conseguir capacidade de GPU geral, use o início flexível ou spot. Essas opções de consumo oferecem GPUs a um preço com desconto em comparação com os preços sob demanda e foram projetadas para ajudar a aumentar suas chances de conseguir recursos de alta demanda, como GPUs.
Para executar cargas de trabalho sem duração específica, você pode receber recursos de computação imediatamente com base na disponibilidade. As VMs são executadas até que você as interrompa ou exclua.
Cargas de trabalho ideais
- Inferência e disponibilização do modelo
- Prototipagem e experimentação
Principais características
- Modelo de provisionamento: padrão.
- Disponibilidade imediata: crie instâncias de VM imediatamente sem aguardar o agendamento ou a aprovação da capacidade.
- Preços padrão: pague pelos recursos nas taxas padrão sob demanda sem compromissos de longo prazo.
- Ampla compatibilidade de hardware: use com qualquer série de máquinas de GPU compatível no caminho de GPU geral.
Usar reservas padrão
Para executar cargas de trabalho de GPU geral críticas que exigem um nível muito alto de garantia de capacidade, você pode usar reservas padrão.
Cargas de trabalho ideais
- Cargas de trabalho de produção críticas
- Cargas de trabalho que exigem capacidade garantida
Principais características
- Modelo de provisionamento: padrão.
- Garantia de capacidade: oferece uma garantia muito alta de que os recursos estão disponíveis.
- Preços: as taxas padrão são aplicadas, mas você pode anexar CUDs para economizar.
Opções de consumo para GPU em cluster
Use as seguintes opções de consumo para adquirir capacidade para GPU em cluster.Usar reservas adiantadas para blocos de capacidade
Para executar cargas de trabalho distribuídas de longa duração e em grande escala que exigem recursos alocados de forma densa, você pode solicitar recursos de computação para um período específico no futuro. Você tem acesso exclusivo a seus recursos reservados durante esse período e pode usar os recursos para criar VMs ou clusters. No final do período de reserva, o Compute Engine faz o seguinte:
- O Compute Engine exclui a reserva.
- Com base na ação de encerramento especificada para as VMs, o Compute Engine interrompe ou exclui todas as VMs que usam a reserva.
Cargas de trabalho ideais
- Pré-treinamento de modelos de fundação
- Inferência para modelos de fundação em vários hosts
Principais características
- Modelo de provisionamento: vinculado à reserva.
- Compatibilidade com máquinas premium: reserve tipos de máquinas A4X Max, A4X, A4, A3 Ultra, A3 Mega ou A3 High (8 GPUs).
- Requisitos de compromisso: anexe um compromisso baseado em recursos para reservas de um ano ou mais.
- Modificações dinâmicas: ative as notificações de manutenção de emergência de hardware para uso de jobs da Vertex AI após o início do período.
Usar reservas adiantadas no modo calendário
Para executar cargas de trabalho distribuídas de curta duração que exigem recursos alocados de forma densa, você pode solicitar recursos de computação por até 90 dias. Você tem acesso exclusivo aos recursos reservados durante esse período e pode usar os recursos para criar VMs ou clusters. No final do período de reserva, o Compute Engine faz o seguinte:
- O Compute Engine exclui a reserva.
- Com base na ação de encerramento especificada para as VMs, o Compute Engine interrompe ou exclui todas as VMs que usam a reserva.
Cargas de trabalho ideais
- Pré-treinamento e ajuste fino
- Simulações e inferências em grande escala
Principais características
- Modelo de provisionamento: vinculado à reserva.
- Compatibilidade com séries de máquinas: reserve tipos de máquinas A4, A3 Ultra, A3 Mega ou A3 High (8 GPUs) .
- Limites de escalonabilidade: reserve até 80 VMs por um máximo de 90 dias.
- Provisionamento otimizado: use um modelo vinculado à reserva para aumentar suas chances de conseguir GPUs.
Usar o início flexível
Use o início flexível para solicitações de redimensionamento de grupo gerenciado de instâncias (MIG) em cluster quando precisar de recursos alocados de forma densa por até sete dias.
Cargas de trabalho ideais
As VMs de início flexível são ideais para executar cargas de trabalho que podem ser iniciadas a qualquer momento, como as seguintes:
- Pré-treinamento de modelos pequenos
- Ajuste fino de modelos
- Simulação de computação de alto desempenho (HPC)
- Inferência em lote
Principais características
- Modelo de provisionamento: início flexível.
- Alocação de recursos: alocação densa para solicitações de redimensionamento de MIG.
- Eficiência de custos: você recebe um desconto de até 53% em vCPUs, memória, GPUs, e discos SSD locais anexados para as séries de máquinas A4, A3, A2 e G4. As taxas padrão sob demanda se aplicam a outras séries de máquinas compatíveis.
Usar spot
Você pode usar VMs spot para cargas de trabalho tolerantes a falhas alocadas de forma densa para conseguir grandes descontos, entendendo que o Compute Engine pode forçar a interrupção das VMs para recuperar a capacidade.
Cargas de trabalho ideais
- Treinamento distribuído tolerante a falhas
- Processamento em lote
Principais características
- Modelo de provisionamento: spot.
- Preempção: o Compute Engine pode forçar a interrupção das instâncias a qualquer momento.
- Eficiência de custos: receba um desconto de até 91% em vCPUs, memória, GPUs, e discos SSD locais anexados.
A seguir
- Para identificar as necessidades da sua carga de trabalho, consulte Identificar as necessidades da carga de trabalho.
- Para criar e usar reservas, consulte Criar e usar reservas.
- Para saber mais sobre VMs spot, consulte Saiba mais sobre VMs spot.
- Para criar uma instância de VM sob demanda, consulte Criar uma instância de VM sob demanda.