O Hipercomputador de IA tem várias opções de consumo para adquirir recursos de computação. Essas opções atendem a necessidades como duração da carga de trabalho, tolerância a falhas e modelo de infraestrutura. Conheça essas opções e escolha a melhor para seu caso de uso.
Visão geral das opções de consumo
Para comparar as opções de consumo em relação às principais características, use a tabela a seguir:
| Opção de consumo | Modelo de provisionamento | Ideal para | Garantia de capacidade | Duração | Preemptiva | Quota | Descontos | Modelo de alocação |
|---|---|---|---|---|---|---|---|---|
| Início flexível | Início flexível | Cargas de trabalho de curta duração, até sete dias, que podem esperar a capacidade. | Melhor esforço | Até sete dias | Não | Cota preemptiva | Com desconto (até 53%) nas séries compatíveis | Dense para solicitações de redimensionamento de MIG; melhor esforço para VMs independentes. |
| VMs spot | Spot | Cargas de trabalho de GPU gerais de curta duração e tolerantes a falhas. | Melhor esforço | Preemptiva | Sim | Cota preemptiva | Com grande desconto (até 91%) | Padrão |
| Reservas padrão | Padrão | Cargas de trabalho de GPU gerais críticas que exigem um nível muito alto de garantia de capacidade. | Muito alto | Muito alto | Definido pelo usuário | Não | Nenhuma cota consumida | Taxas com desconto com descontos por compromisso de uso (CUDs) |
| Reservas adiantadas para blocos de capacidade | Vinculada à reserva | Treinamento de longa duração e em grande escala em GPU em cluster. | Muito alto | Ilimitado dentro do período de reserva. | Não | Aumentada automaticamente | Com desconto (até 53%) com CUDs | Dense |
| Reservas adiantadas no modo calendário | Vinculada à reserva | Cargas de trabalho de GPU em cluster de até 90 dias que exigem capacidade reservada. | Muito alto | Até 90 dias | Não | Nenhuma cota consumida | Com desconto (até 53%) | Dense |
| VMs sob demanda | Padrão | Cargas de trabalho de GPU gerais sem duração específica. | Melhor esforço | Ilimitado | Não | Cota sob demanda | Nenhum (pagamento por uso) | Padrão |
A opção de consumo usada para implantar a infraestrutura depende se você usa GPU geral ou em cluster.
GPU geral: projetada para inferência em pequena escala , desenvolvimento e cargas de trabalho de treinamento em menor escala. Esse tipo de GPU oferece flexibilidade operacional por meio da manutenção assíncrona. Para conferir as opções disponíveis, consulte Opções de consumo para GPU geral.
GPU em cluster: projetada para cargas de trabalho de treinamento em grande escala, fortemente acopladas e cargas de trabalho de inferência, RL e modelos de raciocínio em grande escala que exigem alta garantia de capacidade e alocação de recursos densa para minimizar a latência de rede. Para conferir as opções disponíveis, consulte Opções de consumo para GPU em cluster.
Opções de consumo para GPUs gerais
Use as seguintes opções de consumo para adquirir capacidade para GPU geral.
Usar o início flexível
Para executar cargas de trabalho de curta duração que exigem recursos alocados de forma densa, é possível solicitar recursos de computação por até sete dias usando o início flexível. Sempre que os recursos estiverem disponíveis, o Compute Engine vai criar o número solicitado de VMs. É possível interromper VMs de início flexível independentes, mas não é possível interromper VMs de início flexível que um grupo gerenciado de instâncias (MIG) cria por meio de solicitações de redimensionamento. As VMs de início flexível existem até que você as exclua ou até que o Compute Engine exclua as VMs no final da duração da execução.
Cargas de trabalho ideais
- Pré-treinamento de modelos pequenos
- Ajuste fino de modelos
- Simulação de computação de alto desempenho (HPC)
- Inferência em lote
Principais características
- Modelo de provisionamento: início flexível.
- Ampla compatibilidade de hardware: solicite qualquer tipo de máquina de GPU em cluster, exceto A4X Max e A4X.
- Otimização de latência: aplique uma política de posicionamento compacta a VMs independentes para minimizar a latência de rede.
- Eficiência de custos: receba um desconto de até 53% em vCPUs, memória, GPUs, e discos SSD locais para as séries de máquinas A4, A3, A2 e G4. As taxas padrão sob demanda se aplicam a outras séries compatíveis. Para mais informações, consulte Preços de início flexível.
Usar spot
Para executar cargas de trabalho tolerantes a falhas, é possível receber recursos de computação imediatamente com base em disponibilidade. Você recebe recursos pelo menor preço possível. No entanto, o Compute Engine pode forçar a interrupção das VMs a qualquer momento para recuperar a capacidade.
Cargas de trabalho ideais
- Processamento em lote e análise de dados
- Computação de alto desempenho (HPC) e codificação de mídia
Principais características
- Modelo de provisionamento: spot.
- Ampla compatibilidade de hardware: solicite qualquer tipo de máquina de GPU em cluster, exceto A4X Max e A4X.
- Otimização de latência: aplique uma política de posicionamento compacta a VMs independentes para minimizar a latência de rede.
- Eficiência de custos: receba um desconto de até 91% em vCPUs, memória, GPUs, e discos SSD locais.
Usar sob demanda
Dica: para aumentar suas chances de conseguir capacidade de GPU geral, use o início flexível ou o spot. Essas opções de consumo oferecem GPUs a um preço com desconto em comparação com os preços sob demanda e foram projetadas para ajudar a aumentar suas chances de conseguir recursos de alta demanda, como GPUs.
Para executar cargas de trabalho sem duração específica, é possível receber recursos de computação imediatamente com base na disponibilidade. As VMs são executadas até que você as interrompa ou exclua.
Cargas de trabalho ideais
- Inferência e disponibilização do modelo
- Prototipagem e experimentação
Principais características
- Modelo de provisionamento: padrão.
- Disponibilidade imediata: crie instâncias de VM imediatamente sem esperar por agendamento ou aprovação de capacidade.
- Preços padrão: pague pelos recursos nas taxas padrão sob demanda sem compromissos de longo prazo.
- Ampla compatibilidade de hardware: use com qualquer série de máquinas de GPU compatível no caminho de GPU geral.
Usar reservas padrão
Para executar cargas de trabalho de GPU gerais críticas que exigem um nível muito alto de garantia de capacidade, é possível usar reservas padrão.
Cargas de trabalho ideais
- Cargas de trabalho de produção críticas
- Cargas de trabalho que exigem capacidade garantida
Principais características
- Modelo de provisionamento: padrão.
- Garantia de capacidade: oferece uma garantia muito alta de que os recursos estão disponíveis.
- Preços: as taxas padrão são aplicadas, mas é possível anexar CUDs para economizar.
Opções de consumo para GPU em cluster
Use as seguintes opções de consumo para adquirir capacidade para GPU em cluster.Usar reservas adiantadas para blocos de capacidade
Para executar cargas de trabalho distribuídas de longa duração e em grande escala que exigem recursos alocados de forma densa, é possível solicitar recursos de computação para um período específico no futuro. Você tem acesso exclusivo a seus recursos reservados durante esse período e pode usar os recursos para criar VMs ou clusters. No final do período de reserva, o Compute Engine faz o seguinte:
- O Compute Engine exclui a reserva.
- Com base na ação de encerramento especificada para as VMs, o Compute Engine interrompe ou exclui todas as VMs que usam a reserva.
Cargas de trabalho ideais
- Pré-treinamento de modelos de fundação
- Inferência para modelos de fundação em vários hosts
Principais características
- Modelo de provisionamento: vinculado à reserva.
- Suporte a máquinas premium: reserve tipos de máquinas A4X Max, A4X, A4, A3 Ultra, A3 Mega ou A3 High (8 GPUs).
- Requisitos de compromisso: anexe um compromisso baseado em recursos para reservas de um ano ou mais.
- Modificações dinâmicas: ative as notificações de manutenção de emergência de hardware para uso de jobs da Vertex AI após o início do período.
Usar reservas adiantadas no modo calendário
Para executar cargas de trabalho distribuídas de curta duração que exigem recursos alocados de forma densa, é possível solicitar recursos de computação por até 90 dias. Você tem acesso exclusivo aos recursos reservados durante esse período e pode usar os recursos para criar VMs ou clusters. No final do período de reserva, o Compute Engine faz o seguinte:
- O Compute Engine exclui a reserva.
- Com base na ação de encerramento especificada para as VMs, o Compute Engine interrompe ou exclui todas as VMs que usam a reserva.
Cargas de trabalho ideais
- Pré-treinamento e ajuste fino
- Simulações e inferências em grande escala
Principais características
- Modelo de provisionamento: vinculado à reserva.
- Suporte a séries de máquinas: reserve tipos de máquinas A4, A3 Ultra, A3 Mega ou A3 High (8 GPUs) .
- Limites de escalonabilidade: reserve até 80 VMs por um máximo de 90 dias.
- Provisionamento otimizado: use um modelo vinculado à reserva para aumentar suas chances de conseguir GPUs.
Usar o início flexível
Use o início flexível para solicitações de redimensionamento de grupo gerenciado de instâncias (MIG) em cluster quando precisar de recursos alocados de forma densa por até sete dias.
Cargas de trabalho ideais
As VMs de início flexível são ideais para executar cargas de trabalho que podem ser iniciadas a qualquer momento, como as seguintes:
- Pré-treinamento de modelos pequenos
- Ajuste fino de modelos
- Simulação de computação de alto desempenho (HPC)
- Inferência em lote
Principais características
- Modelo de provisionamento: início flexível.
- Alocação de recursos: alocação densa para solicitações de redimensionamento de MIG.
- Eficiência de custos: receba um desconto de até 53% em vCPUs, memória, GPUs, e discos SSD locais anexados para as séries de máquinas A4, A3, A2 e G4. As taxas padrão sob demanda se aplicam a outras séries compatíveis.
Usar spot
É possível usar VMs spot para cargas de trabalho tolerantes a falhas alocadas de forma densa para conseguir grandes descontos, entendendo que o Compute Engine pode forçar a interrupção das VMs para recuperar a capacidade.
Cargas de trabalho ideais
- Treinamento distribuído tolerante a falhas
- Processamento em lote
Principais características
- Modelo de provisionamento: spot.
- Preempção: o Compute Engine pode forçar a interrupção das instâncias a qualquer momento.
- Eficiência de custos: receba um desconto de até 91% em vCPUs, memória, GPUs, e discos SSD locais anexados.
A seguir
- Para identificar as necessidades da carga de trabalho, consulte Identificar as necessidades da carga de trabalho.
- Para criar e usar reservas, consulte Criar e usar reservas.
- Para saber mais sobre VMs spot, consulte Saiba mais sobre VMs spot.
- Para criar uma instância de VM sob demanda, consulte Criar uma instância de VM sob demanda.