Opzioni di consumo per AI Hypercomputer

AI Hypercomputer offre diverse opzioni di consumo per l'acquisizione di risorse di calcolo. Queste opzioni soddisfano esigenze come la durata del carico di lavoro, la tolleranza agli errori e il modello di infrastruttura. Scopri di più su queste opzioni e scegli quella più adatta al tuo caso d'uso.

Panoramica delle opzioni di consumo

Per confrontare le opzioni di consumo in base alle caratteristiche principali, utilizza la seguente tabella:

Opzione di consumo Modello di provisioning Ideale per Garanzia di capacità Durata Prerilasciabile Quota Sconti Modello di allocazione
Avvio flessibile Avvio flessibile Workload di breve durata fino a sette giorni che possono attendere la capacità. Best effort Fino a sette giorni No Quota prerilasciabile Scontata (fino al 53%) sulle serie supportate Densa per le richieste di ridimensionamento del MIG; best effort per le VM autonome.
VM spot Spot Workload GPU generici di breve durata e a tolleranza di errore. Best effort Prerilasciabile Quota prerilasciabile Profondamente scontata (fino al 91%) Standard
Prenotazioni standard Standard Workload GPU generici critici che richiedono un livello di garanzia molto elevato per la capacità. Molto alta Molto alta Definito dall'utente No Nessuna quota consumata Tariffe scontate con sconti per impegno di utilizzo (CUD)
Prenotazioni future per blocchi di capacità Con prenotazione Addestramento su larga scala e di lunga durata su GPU in cluster. Molto alta Illimitata nel periodo di prenotazione. No Aumento automatico Scontata (fino al 53%) con i CUD Densa
Prenotazioni future in modalità calendario Con prenotazione Workload GPU in cluster fino a 90 giorni che richiedono capacità riservata. Molto alta Fino a 90 giorni No Nessuna quota consumata Scontata (fino al 53%) Densa
VM on demand Standard Workload GPU generici senza durata specifica. Best effort Illimitata No Quota on demand Nessuna (pagamento a consumo) Standard

L'opzione di consumo che utilizzi per eseguire il deployment dell'infrastruttura dipende dal fatto che utilizzi GPU generiche o GPU in cluster.

  • GPU generiche: progettate per workload di inferenza, sviluppo e addestramento su scala ridotta. Questo tipo di GPU offre flessibilità operativa grazie alla manutenzione asincrona. Per visualizzare le opzioni disponibili, consulta Opzioni di consumo per GPU generiche.

  • GPU in cluster: progettate per workload di addestramento su larga scala e strettamente accoppiati e per workload di inferenza, RL e modelli di ragionamento su larga scala che richiedono un'elevata garanzia di capacità e un'allocazione densa delle risorse per ridurre al minimo la latenza di rete. Per visualizzare le opzioni disponibili, consulta Opzioni di consumo per GPU in cluster.

Opzioni di consumo per GPU generiche

Utilizza le seguenti opzioni di consumo per acquisire capacità per le GPU generiche.

Usa avvio flessibile

Per eseguire workload di breve durata che richiedono risorse allocate in modo denso, puoi richiedere risorse di calcolo per un massimo di sette giorni utilizzando l'avvio flessibile. Ogni volta che le risorse sono disponibili, Compute Engine crea il numero di VM richiesto. Puoi arrestare le VM autonome con avvio flessibile, ma non puoi arrestare le VM con avvio flessibile create da un gruppo di istanze gestite (MIG) tramite richieste di ridimensionamento. Le VM con avvio flessibile esistono finché non le elimini o finché Compute Engine non le elimina al termine della durata di esecuzione.

Workload ideali

  • Pre-addestramento di modelli di piccole dimensioni
  • Ottimizzazione del modello
  • Simulazione di computing ad alte prestazioni (HPC)
  • Inferenza batch

Caratteristiche principali

  • Modello di provisioning: avvio flessibile.
  • Ampio supporto hardware: richiedi qualsiasi tipo di macchina GPU in cluster, ad eccezione di A4X Max e A4X.
  • Ottimizzazione della latenza: applica una policy di posizionamento compatto alle VM autonome per ridurre al minimo la latenza di rete.
  • Efficienza in termini di costi: ricevi uno sconto fino al 53% su vCPU, memoria, GPU, e dischi SSD locali per le serie di macchine A4, A3, A2 e G4. Le tariffe on demand standard si applicano alle altre serie supportate. Per ulteriori informazioni, consulta Prezzi dell'avvio flessibile.

Usa spot

Per eseguire workload a tolleranza di errore, puoi ottenere immediatamente risorse di calcolo in base alla disponibilità. Ottieni le risorse al prezzo più basso possibile. Tuttavia, Compute Engine può prerilasciare le VM in qualsiasi momento per recuperare capacità.

Workload ideali

  • Elaborazione batch e analisi dei dati
  • Computing ad alte prestazioni (HPC) e codifica multimediale

Caratteristiche principali

  • Modello di provisioning: spot.
  • Ampio supporto hardware: richiedi qualsiasi tipo di macchina GPU in cluster, ad eccezione di A4X Max e A4X.
  • Ottimizzazione della latenza: applica una policy di posizionamento compatto alle VM autonome per ridurre al minimo la latenza di rete.
  • Efficienza in termini di costi: ricevi uno sconto fino al 91% su vCPU, memoria, GPU, e dischi SSD locali.

Usa on demand

Suggerimento: per aumentare le probabilità di ottenere capacità GPU generica, utilizza l'avvio flessibile o spot. Queste opzioni di consumo offrono GPU a un prezzo scontato rispetto ai prezzi on demand e sono state progettate per aumentare le probabilità di ottenere risorse ad alta richiesta come le GPU.

Per eseguire workload senza durata specifica, puoi ottenere immediatamente risorse di calcolo in base alla disponibilità. Le VM vengono eseguite finché non le arresti o le elimini.

Workload ideali

  • Inferenza ed erogazione del modello
  • Prototipazione e sperimentazione

Caratteristiche principali

  • Modello di provisioning: standard.
  • Disponibilità immediata: crea istanze VM immediatamente senza attendere la pianificazione o l'approvazione della capacità.
  • Prezzi standard: paga le risorse alle tariffe on demand standard senza impegni a lungo termine.
  • Ampio supporto hardware: utilizza con qualsiasi serie di macchine GPU supportata nel percorso GPU generico.

Usa prenotazioni standard

Per eseguire workload GPU generici critici che richiedono un livello di garanzia molto elevato per la capacità, puoi utilizzare le prenotazioni standard.

Workload ideali

  • Workload di produzione critici
  • Workload che richiedono capacità garantita

Caratteristiche principali

  • Modello di provisioning: standard.
  • Garanzia di capacità: fornisce una garanzia molto elevata della disponibilità delle risorse.
  • Prezzi: vengono applicate le tariffe standard, ma puoi allegare i CUD per risparmiare.

Opzioni di consumo per GPU in cluster

Utilizza le seguenti opzioni di consumo per acquisire capacità per le GPU in cluster.

Usa le prenotazioni future per i blocchi di capacità

Per eseguire workload distribuiti di lunga durata e su larga scala che richiedono risorse allocate in modo denso, puoi richiedere risorse di calcolo per un periodo di tempo specifico in futuro. Hai accesso esclusivo a risorse prenotate per quel periodo di tempo e puoi utilizzare le risorse per creare VM o cluster. Al termine del periodo di prenotazione, Compute Engine esegue le seguenti operazioni:

  • Compute Engine elimina la prenotazione.
  • In base all' azione di terminazione specificata per le VM, Compute Engine arresta o elimina le VM che utilizzano la prenotazione.

Workload ideali

  • Modelli di base di pre-addestramento
  • Inferenza per i modelli di base su più host

Caratteristiche principali

  • Modello di provisioning: con prenotazione.
  • Supporto per macchine premium: prenota i tipi di macchine A4X Max, A4X, A4, A3 Ultra, A3 Mega o A3 High (8 GPU).
  • Requisiti di impegno: allega un impegno basato sulle risorse per le prenotazioni di un anno o più.
  • Modifiche dinamiche: attiva le notifiche di manutenzione di emergenza dell'hardware per l'utilizzo dei job Vertex AI dopo l'inizio del periodo.

Usa le prenotazioni future in modalità calendario

Per eseguire workload distribuiti di breve durata che richiedono risorse allocate in modo denso, puoi richiedere risorse di calcolo per un massimo di 90 giorni. Hai accesso esclusivo alle risorse prenotate per quel periodo di tempo e puoi utilizzare le risorse per creare VM o cluster. Al termine del periodo di prenotazione, Compute Engine esegue le seguenti operazioni:

  • Compute Engine elimina la prenotazione.
  • In base all' azione di terminazione specificata per le VM, Compute Engine arresta o elimina le VM che utilizzano la prenotazione.

Workload ideali

  • Pre-addestramento e ottimizzazione
  • Simulazioni e inferenza su larga scala

Caratteristiche principali

  • Modello di provisioning: con prenotazione.
  • Supporto per le serie di macchine: prenota i tipi di macchine A4, A3 Ultra, A3 Mega o A3 High (8 GPU).
  • Limiti di scalabilità: prenota fino a 80 VM per un massimo di 90 giorni.
  • Provisioning ottimizzato: utilizza un modello con prenotazione per aumentare le probabilità di ottenere GPU.

Usa avvio flessibile

Utilizza l'avvio flessibile per le richieste di ridimensionamento del gruppo di istanze gestite (MIG) in cluster quando hai bisogno di risorse allocate in modo denso per un massimo di sette giorni.

Workload ideali

Le VM con avvio flessibile sono ideali per l'esecuzione di workload che possono essere avviati in qualsiasi momento, ad esempio:

  • Pre-addestramento di modelli di piccole dimensioni
  • Ottimizzazione del modello
  • Simulazione di computing ad alte prestazioni (HPC)
  • Inferenza batch

Caratteristiche principali

  • Modello di provisioning: avvio flessibile.
  • Allocazione delle risorse: allocazione densa per le richieste di ridimensionamento del MIG.
  • Efficienza in termini di costi: ricevi uno sconto fino al 53% su vCPU, memoria, GPU, e dischi SSD locali collegati per le serie di macchine A4, A3, A2 e G4. Le tariffe on demand standard si applicano alle altre serie supportate.

Usa spot

Puoi utilizzare le VM spot per workload a tolleranza di errore allocati in modo denso per ottenere sconti elevati, tenendo presente che Compute Engine può prerilasciare le VM per recuperare capacità.

Workload ideali

  • Addestramento distribuito a tolleranza di errore
  • Elaborazione batch

Caratteristiche principali

  • Modello di provisioning: spot.
  • Prerilascio: Compute Engine può prerilasciare le istanze in qualsiasi momento.
  • Efficienza in termini di costi: ricevi uno sconto fino al 91% su vCPU, memoria, GPU, e dischi SSD locali collegati.

Passaggi successivi