Opzioni di consumo per AI Hypercomputer

AI Hypercomputer offre diverse opzioni di consumo per l'acquisizione di risorse di calcolo. Queste opzioni soddisfano esigenze come la durata del carico di lavoro, la tolleranza agli errori e il modello di infrastruttura. Scopri queste opzioni e scegli quella più adatta al tuo caso d'uso.

In alternativa alla valutazione manuale, puoi chiedere a Gemini nella Google Cloud console di confrontare le opzioni di consumo per il tuo carico di lavoro e il tuo budget. Per ulteriori informazioni, consulta Progettare l'infrastruttura AI con Gemini.

Panoramica delle opzioni di consumo

Per confrontare le opzioni di consumo in base alle caratteristiche principali, utilizza la seguente tabella:

Opzione di consumo Modello di provisioning Ideale per Garanzia di capacità Durata Prerilasciabile Quota Sconti Modello di allocazione
Avvio flessibile Avvio flessibile Carichi di lavoro di breve durata fino a sette giorni che possono attendere la capacità. Best effort Fino a sette giorni No Quota prerilasciabile Scontato (fino al 53%) sulle serie supportate Denso per le richieste di ridimensionamento del MIG; best effort per le VM autonome.
VM spot Spot Carichi di lavoro GPU generici di breve durata e a tolleranza di errore. Best effort Prerilasciabile Quota prerilasciabile Profondamente scontato (fino al 91%) Standard
Prenotazioni standard Standard Carichi di lavoro GPU generici critici che richiedono un livello di garanzia molto elevato per la capacità. Molto alta Molto alta Definito dall'utente No Nessuna quota consumata Tariffe scontate con sconti per impegno di utilizzo (CUD)
Prenotazioni future per blocchi di capacità Con prenotazione Addestramento su larga scala e di lunga durata su GPU in cluster. Molto alta Illimitata nel periodo di prenotazione. No Aumento automatico Scontato (fino al 53%) con i CUD Denso
Prenotazioni future in modalità calendario Con prenotazione Carichi di lavoro GPU in cluster fino a 90 giorni che richiedono capacità riservata. Molto alta Fino a 90 giorni No Nessuna quota consumata Scontato (fino al 53%) Denso
VM on demand Standard Carichi di lavoro GPU generici senza una durata specifica. Best effort Illimitato No Quota on demand Nessuno (pagamento a consumo) Standard

L'opzione di consumo che utilizzi per eseguire il deployment dell'infrastruttura dipende dal fatto che utilizzi GPU generiche o GPU in cluster.

  • GPU generiche: progettate per carichi di lavoro di inferenza, sviluppo e addestramento su piccola scala. Questo tipo di GPU offre flessibilità operativa grazie alla manutenzione asincrona. Per visualizzare le opzioni disponibili, consulta Opzioni di consumo per GPU generiche.

  • GPU in cluster: progettate per carichi di lavoro di addestramento su larga scala e strettamente accoppiati e per carichi di lavoro di inferenza, RL e modelli di ragionamento su larga scala che richiedono un'elevata garanzia di capacità e un'allocazione densa delle risorse per ridurre al minimo la latenza di rete. Per visualizzare le opzioni disponibili, consulta Opzioni di consumo per GPU in cluster.

Opzioni di consumo per GPU generiche

Utilizza le seguenti opzioni di consumo per acquisire capacità per le GPU generiche.

Usa avvio flessibile

Per eseguire carichi di lavoro di breve durata che richiedono risorse allocate in modo denso, puoi richiedere risorse di calcolo risorse per un massimo di sette giorni utilizzando l'avvio flessibile. Quando le risorse sono disponibili, Compute Engine crea il numero di VM richiesto. Puoi arrestare le VM autonome con avvio flessibile, ma non puoi arrestare le VM con avvio flessibile create da un gruppo di istanze gestite (MIG) tramite richieste di ridimensionamento. Le VM con avvio flessibile esistono finché non le elimini o finché Compute Engine non le elimina al termine della durata di esecuzione.

Carichi di lavoro ideali

  • Pre-addestramento di modelli di piccole dimensioni
  • Ottimizzazione dei modelli
  • Simulazione di computing ad alte prestazioni (HPC)
  • Inferenza batch

Caratteristiche principali

  • Modello di provisioning: avvio flessibile.
  • Ampio supporto hardware: richiedi qualsiasi tipo di macchina GPU in cluster, ad eccezione di A4X Max e A4X.
  • Ottimizzazione della latenza: applica una policy di posizionamento compatto alle VM autonome per ridurre al minimo la latenza di rete.
  • Efficienza in termini di costi: ricevi uno sconto fino al 53% su vCPU, memoria, GPU, e dischi SSD locali per le serie di macchine A4, A3, A2 e G4. Le tariffe on demand standard si applicano alle altre serie supportate. Per ulteriori informazioni, consulta Prezzi dell'avvio flessibile.

Usa spot

Per eseguire carichi di lavoro a tolleranza di errore, puoi ottenere immediatamente risorse di calcolo in base all' disponibilità. Ottieni le risorse al prezzo più basso possibile. Tuttavia, Compute Engine può prerilasciare le VM in qualsiasi momento per recuperare la capacità.

Carichi di lavoro ideali

  • Elaborazione batch e analisi dei dati
  • Computing ad alte prestazioni (HPC) e codifica multimediale

Caratteristiche principali

  • Modello di provisioning: spot.
  • Ampio supporto hardware: richiedi qualsiasi tipo di macchina GPU in cluster, ad eccezione di A4X Max e A4X.
  • Ottimizzazione della latenza: applica una policy di posizionamento compatto alle VM autonome per ridurre al minimo la latenza di rete.
  • Efficienza in termini di costi: ricevi uno sconto fino al 91% su vCPU, memoria, GPU, e dischi SSD locali.

Usa on demand

Suggerimento: per aumentare le probabilità di ottenere capacità GPU generica, utilizza l'avvio flessibile o spot. Queste opzioni di consumo offrono GPU a un prezzo scontato rispetto ai prezzi on demand e sono state progettate per aumentare le probabilità di ottenere risorse ad alta richiesta come le GPU.

Per eseguire carichi di lavoro senza una durata specifica, puoi ottenere immediatamente risorse di calcolo in base alla disponibilità. Le VM vengono eseguite finché non le arresti o le elimini.

Carichi di lavoro ideali

  • Inferenza ed erogazione del modello
  • Prototipazione e sperimentazione

Caratteristiche principali

  • Modello di provisioning: standard.
  • Disponibilità immediata: crea istanze VM immediatamente senza attendere la pianificazione o l'approvazione della capacità.
  • Prezzi standard: paga le risorse alle tariffe on demand standard senza impegni a lungo termine.
  • Ampio supporto hardware: utilizza con qualsiasi serie di macchine GPU supportata nel percorso GPU generico.

Usa le prenotazioni standard

Per eseguire carichi di lavoro GPU generici critici che richiedono un livello di garanzia molto elevato per la capacità, puoi utilizzare le prenotazioni standard.

Carichi di lavoro ideali

  • Carichi di lavoro di produzione critici
  • Carichi di lavoro che richiedono capacità garantita

Caratteristiche principali

  • Modello di provisioning: standard.
  • Garanzia di capacità: fornisce una garanzia molto elevata della disponibilità delle risorse.
  • Prezzi: vengono applicate le tariffe standard, ma puoi allegare i CUD per risparmiare.

Opzioni di consumo per GPU in cluster

Utilizza le seguenti opzioni di consumo per acquisire capacità per le GPU in cluster.

Usa le prenotazioni future per i blocchi di capacità

Per eseguire carichi di lavoro distribuiti di lunga durata e su larga scala che richiedono risorse allocate in modo denso, puoi richiedere risorse di calcolo per un periodo di tempo specifico in futuro. Hai accesso esclusivo a risorse prenotate per quel periodo di tempo e puoi utilizzarle per creare VM o cluster. Al termine del periodo di prenotazione, Compute Engine esegue le seguenti operazioni:

  • Compute Engine elimina la prenotazione.
  • In base all' azione di terminazione specificata per le VM, Compute Engine arresta o elimina le VM che utilizzano la prenotazione.

Carichi di lavoro ideali

  • Pre-addestramento dei modelli di base
  • Inferenza per i modelli di base su più host

Caratteristiche principali

  • Modello di provisioning: con prenotazione.
  • Supporto per macchine premium: prenota i tipi di macchine A4X Max, A4X, A4, A3 Ultra, A3 Mega o A3 High (8 GPU).
  • Requisiti di impegno: allega un impegno basato sulle risorse per le prenotazioni di un anno o più.
  • Modifiche dinamiche: attiva le notifiche di manutenzione hardware di emergenza per l'utilizzo dei job Vertex AI dopo l'inizio del periodo.

Usa le prenotazioni future in modalità calendario

Per eseguire carichi di lavoro distribuiti di breve durata che richiedono risorse allocate in modo denso, puoi richiedere risorse di calcolo per un massimo di 90 giorni. Hai accesso esclusivo alle risorse prenotate per quel periodo di tempo e puoi utilizzarle per creare VM o cluster. Al termine del periodo di prenotazione, Compute Engine esegue le seguenti operazioni:

  • Compute Engine elimina la prenotazione.
  • In base all' azione di terminazione specificata per le VM, Compute Engine arresta o elimina le VM che utilizzano la prenotazione.

Carichi di lavoro ideali

  • Pre-addestramento e ottimizzazione
  • Simulazioni e inferenza su larga scala

Caratteristiche principali

  • Modello di provisioning: con prenotazione.
  • Supporto per serie di macchine: prenota i tipi di macchine A4, A3 Ultra, A3 Mega o A3 High (8 GPU) .
  • Limiti di scalabilità: prenota fino a 80 VM per un massimo di 90 giorni.
  • Provisioning ottimizzato: utilizza un modello con prenotazione per aumentare le probabilità di ottenere GPU.

Usa avvio flessibile

Utilizza l'avvio flessibile per le richieste di ridimensionamento del gruppo di istanze gestite (MIG) in cluster quando hai bisogno di risorse allocate in modo denso per un massimo di sette giorni.

Carichi di lavoro ideali

Le VM con avvio flessibile sono ideali per l'esecuzione di carichi di lavoro che possono essere avviati in qualsiasi momento, ad esempio:

  • Pre-addestramento di modelli di piccole dimensioni
  • Ottimizzazione dei modelli
  • Simulazione di computing ad alte prestazioni (HPC)
  • Inferenza batch

Caratteristiche principali

  • Modello di provisioning: avvio flessibile.
  • Allocazione delle risorse: allocazione densa per le richieste di ridimensionamento del MIG.
  • Efficienza in termini di costi: ricevi uno sconto fino al 53% su vCPU, memoria, GPU, e dischi SSD locali collegati per le serie di macchine A4, A3, A2 e G4. Le tariffe on demand standard si applicano alle altre serie di macchine supportate.

Usa spot

Puoi utilizzare le VM spot per carichi di lavoro a tolleranza di errore allocati in modo denso per ottenere sconti elevati, tenendo presente che Compute Engine può prerilasciare le VM per recuperare la capacità.

Carichi di lavoro ideali

  • Addestramento distribuito a tolleranza di errore
  • Elaborazione batch

Caratteristiche principali

  • Modello di provisioning: spot.
  • Prerilascio: Compute Engine può prerilasciare le istanze in qualsiasi momento.
  • Efficienza in termini di costi: ricevi uno sconto fino al 91% su vCPU, memoria, GPU, e dischi SSD locali collegati.

Passaggi successivi