AI Hypercomputer offre diverse opzioni di consumo per l'acquisizione di risorse di calcolo. Queste opzioni soddisfano esigenze come la durata del carico di lavoro, la tolleranza agli errori e il modello di infrastruttura. Scopri queste opzioni e scegli quella più adatta al tuo caso d'uso.
In alternativa alla valutazione manuale, puoi chiedere a Gemini nella Google Cloud console di confrontare le opzioni di consumo per il tuo carico di lavoro e il tuo budget. Per ulteriori informazioni, consulta Progettare l'infrastruttura AI con Gemini.
Panoramica delle opzioni di consumo
Per confrontare le opzioni di consumo in base alle caratteristiche principali, utilizza la seguente tabella:
| Opzione di consumo | Modello di provisioning | Ideale per | Garanzia di capacità | Durata | Prerilasciabile | Quota | Sconti | Modello di allocazione |
|---|---|---|---|---|---|---|---|---|
| Avvio flessibile | Avvio flessibile | Carichi di lavoro di breve durata fino a sette giorni che possono attendere la capacità. | Best effort | Fino a sette giorni | No | Quota prerilasciabile | Scontato (fino al 53%) sulle serie supportate | Denso per le richieste di ridimensionamento del MIG; best effort per le VM autonome. |
| VM spot | Spot | Carichi di lavoro GPU generici di breve durata e a tolleranza di errore. | Best effort | Prerilasciabile | Sì | Quota prerilasciabile | Profondamente scontato (fino al 91%) | Standard |
| Prenotazioni standard | Standard | Carichi di lavoro GPU generici critici che richiedono un livello di garanzia molto elevato per la capacità. | Molto alta | Molto alta | Definito dall'utente | No | Nessuna quota consumata | Tariffe scontate con sconti per impegno di utilizzo (CUD) |
| Prenotazioni future per blocchi di capacità | Con prenotazione | Addestramento su larga scala e di lunga durata su GPU in cluster. | Molto alta | Illimitata nel periodo di prenotazione. | No | Aumento automatico | Scontato (fino al 53%) con i CUD | Denso |
| Prenotazioni future in modalità calendario | Con prenotazione | Carichi di lavoro GPU in cluster fino a 90 giorni che richiedono capacità riservata. | Molto alta | Fino a 90 giorni | No | Nessuna quota consumata | Scontato (fino al 53%) | Denso |
| VM on demand | Standard | Carichi di lavoro GPU generici senza una durata specifica. | Best effort | Illimitato | No | Quota on demand | Nessuno (pagamento a consumo) | Standard |
L'opzione di consumo che utilizzi per eseguire il deployment dell'infrastruttura dipende dal fatto che utilizzi GPU generiche o GPU in cluster.
GPU generiche: progettate per carichi di lavoro di inferenza, sviluppo e addestramento su piccola scala. Questo tipo di GPU offre flessibilità operativa grazie alla manutenzione asincrona. Per visualizzare le opzioni disponibili, consulta Opzioni di consumo per GPU generiche.
GPU in cluster: progettate per carichi di lavoro di addestramento su larga scala e strettamente accoppiati e per carichi di lavoro di inferenza, RL e modelli di ragionamento su larga scala che richiedono un'elevata garanzia di capacità e un'allocazione densa delle risorse per ridurre al minimo la latenza di rete. Per visualizzare le opzioni disponibili, consulta Opzioni di consumo per GPU in cluster.
Opzioni di consumo per GPU generiche
Utilizza le seguenti opzioni di consumo per acquisire capacità per le GPU generiche.
Usa avvio flessibile
Per eseguire carichi di lavoro di breve durata che richiedono risorse allocate in modo denso, puoi richiedere risorse di calcolo risorse per un massimo di sette giorni utilizzando l'avvio flessibile. Quando le risorse sono disponibili, Compute Engine crea il numero di VM richiesto. Puoi arrestare le VM autonome con avvio flessibile, ma non puoi arrestare le VM con avvio flessibile create da un gruppo di istanze gestite (MIG) tramite richieste di ridimensionamento. Le VM con avvio flessibile esistono finché non le elimini o finché Compute Engine non le elimina al termine della durata di esecuzione.
Carichi di lavoro ideali
- Pre-addestramento di modelli di piccole dimensioni
- Ottimizzazione dei modelli
- Simulazione di computing ad alte prestazioni (HPC)
- Inferenza batch
Caratteristiche principali
- Modello di provisioning: avvio flessibile.
- Ampio supporto hardware: richiedi qualsiasi tipo di macchina GPU in cluster, ad eccezione di A4X Max e A4X.
- Ottimizzazione della latenza: applica una policy di posizionamento compatto alle VM autonome per ridurre al minimo la latenza di rete.
- Efficienza in termini di costi: ricevi uno sconto fino al 53% su vCPU, memoria, GPU, e dischi SSD locali per le serie di macchine A4, A3, A2 e G4. Le tariffe on demand standard si applicano alle altre serie supportate. Per ulteriori informazioni, consulta Prezzi dell'avvio flessibile.
Usa spot
Per eseguire carichi di lavoro a tolleranza di errore, puoi ottenere immediatamente risorse di calcolo in base all' disponibilità. Ottieni le risorse al prezzo più basso possibile. Tuttavia, Compute Engine può prerilasciare le VM in qualsiasi momento per recuperare la capacità.
Carichi di lavoro ideali
- Elaborazione batch e analisi dei dati
- Computing ad alte prestazioni (HPC) e codifica multimediale
Caratteristiche principali
- Modello di provisioning: spot.
- Ampio supporto hardware: richiedi qualsiasi tipo di macchina GPU in cluster, ad eccezione di A4X Max e A4X.
- Ottimizzazione della latenza: applica una policy di posizionamento compatto alle VM autonome per ridurre al minimo la latenza di rete.
- Efficienza in termini di costi: ricevi uno sconto fino al 91% su vCPU, memoria, GPU, e dischi SSD locali.
Usa on demand
Suggerimento: per aumentare le probabilità di ottenere capacità GPU generica, utilizza l'avvio flessibile o spot. Queste opzioni di consumo offrono GPU a un prezzo scontato rispetto ai prezzi on demand e sono state progettate per aumentare le probabilità di ottenere risorse ad alta richiesta come le GPU.
Per eseguire carichi di lavoro senza una durata specifica, puoi ottenere immediatamente risorse di calcolo in base alla disponibilità. Le VM vengono eseguite finché non le arresti o le elimini.
Carichi di lavoro ideali
- Inferenza ed erogazione del modello
- Prototipazione e sperimentazione
Caratteristiche principali
- Modello di provisioning: standard.
- Disponibilità immediata: crea istanze VM immediatamente senza attendere la pianificazione o l'approvazione della capacità.
- Prezzi standard: paga le risorse alle tariffe on demand standard senza impegni a lungo termine.
- Ampio supporto hardware: utilizza con qualsiasi serie di macchine GPU supportata nel percorso GPU generico.
Usa le prenotazioni standard
Per eseguire carichi di lavoro GPU generici critici che richiedono un livello di garanzia molto elevato per la capacità, puoi utilizzare le prenotazioni standard.
Carichi di lavoro ideali
- Carichi di lavoro di produzione critici
- Carichi di lavoro che richiedono capacità garantita
Caratteristiche principali
- Modello di provisioning: standard.
- Garanzia di capacità: fornisce una garanzia molto elevata della disponibilità delle risorse.
- Prezzi: vengono applicate le tariffe standard, ma puoi allegare i CUD per risparmiare.
Opzioni di consumo per GPU in cluster
Utilizza le seguenti opzioni di consumo per acquisire capacità per le GPU in cluster.Usa le prenotazioni future per i blocchi di capacità
Per eseguire carichi di lavoro distribuiti di lunga durata e su larga scala che richiedono risorse allocate in modo denso, puoi richiedere risorse di calcolo per un periodo di tempo specifico in futuro. Hai accesso esclusivo a risorse prenotate per quel periodo di tempo e puoi utilizzarle per creare VM o cluster. Al termine del periodo di prenotazione, Compute Engine esegue le seguenti operazioni:
- Compute Engine elimina la prenotazione.
- In base all' azione di terminazione specificata per le VM, Compute Engine arresta o elimina le VM che utilizzano la prenotazione.
Carichi di lavoro ideali
- Pre-addestramento dei modelli di base
- Inferenza per i modelli di base su più host
Caratteristiche principali
- Modello di provisioning: con prenotazione.
- Supporto per macchine premium: prenota i tipi di macchine A4X Max, A4X, A4, A3 Ultra, A3 Mega o A3 High (8 GPU).
- Requisiti di impegno: allega un impegno basato sulle risorse per le prenotazioni di un anno o più.
- Modifiche dinamiche: attiva le notifiche di manutenzione hardware di emergenza per l'utilizzo dei job Vertex AI dopo l'inizio del periodo.
Usa le prenotazioni future in modalità calendario
Per eseguire carichi di lavoro distribuiti di breve durata che richiedono risorse allocate in modo denso, puoi richiedere risorse di calcolo per un massimo di 90 giorni. Hai accesso esclusivo alle risorse prenotate per quel periodo di tempo e puoi utilizzarle per creare VM o cluster. Al termine del periodo di prenotazione, Compute Engine esegue le seguenti operazioni:
- Compute Engine elimina la prenotazione.
- In base all' azione di terminazione specificata per le VM, Compute Engine arresta o elimina le VM che utilizzano la prenotazione.
Carichi di lavoro ideali
- Pre-addestramento e ottimizzazione
- Simulazioni e inferenza su larga scala
Caratteristiche principali
- Modello di provisioning: con prenotazione.
- Supporto per serie di macchine: prenota i tipi di macchine A4, A3 Ultra, A3 Mega o A3 High (8 GPU) .
- Limiti di scalabilità: prenota fino a 80 VM per un massimo di 90 giorni.
- Provisioning ottimizzato: utilizza un modello con prenotazione per aumentare le probabilità di ottenere GPU.
Usa avvio flessibile
Utilizza l'avvio flessibile per le richieste di ridimensionamento del gruppo di istanze gestite (MIG) in cluster quando hai bisogno di risorse allocate in modo denso per un massimo di sette giorni.
Carichi di lavoro ideali
Le VM con avvio flessibile sono ideali per l'esecuzione di carichi di lavoro che possono essere avviati in qualsiasi momento, ad esempio:
- Pre-addestramento di modelli di piccole dimensioni
- Ottimizzazione dei modelli
- Simulazione di computing ad alte prestazioni (HPC)
- Inferenza batch
Caratteristiche principali
- Modello di provisioning: avvio flessibile.
- Allocazione delle risorse: allocazione densa per le richieste di ridimensionamento del MIG.
- Efficienza in termini di costi: ricevi uno sconto fino al 53% su vCPU, memoria, GPU, e dischi SSD locali collegati per le serie di macchine A4, A3, A2 e G4. Le tariffe on demand standard si applicano alle altre serie di macchine supportate.
Usa spot
Puoi utilizzare le VM spot per carichi di lavoro a tolleranza di errore allocati in modo denso per ottenere sconti elevati, tenendo presente che Compute Engine può prerilasciare le VM per recuperare la capacità.
Carichi di lavoro ideali
- Addestramento distribuito a tolleranza di errore
- Elaborazione batch
Caratteristiche principali
- Modello di provisioning: spot.
- Prerilascio: Compute Engine può prerilasciare le istanze in qualsiasi momento.
- Efficienza in termini di costi: ricevi uno sconto fino al 91% su vCPU, memoria, GPU, e dischi SSD locali collegati.
Passaggi successivi
- Per identificare le esigenze del tuo carico di lavoro, consulta Identificare le esigenze del carico di lavoro.
- Per creare e utilizzare le prenotazioni, consulta Creare e utilizzare le prenotazioni.
- Per scoprire di più sulle VM spot, consulta Scopri di più sulle VM spot.
- Per creare un'istanza VM on demand, consulta Creare un'istanza VM instance.