Scegliere tra GPU generiche e GPU in cluster

Questo documento fornisce consigli sugli acceleratori, sulle opzioni di consumo e sugli strumenti di deployment più adatti a diversi workload di intelligenza artificiale (AI), machine learning (ML) e computing ad alte prestazioni (HPC). Utilizza questo documento per identificare il deployment migliore per il tuo carico di lavoro.

Per informazioni e consigli sui pilastri dell'infrastruttura per i workload AI, ML e HPC, consulta i seguenti documenti:

Panoramica dei workload

L'architettura AI Hypercomputer supporta i seguenti casi d'uso:

Workload Descrizione Suggerimento
Modelli di base preaddestrati Ciò comporta la creazione di un modello linguistico utilizzando un set di dati di grandi dimensioni. Il risultato del pre-addestramento dei foundation model è un nuovo modello in grado di svolgere attività generali.
I modelli sono classificati in base alle loro dimensioni come segue:
  • Modello pioneristico: modelli ML che vanno da centinaia di miliardi a trilioni di parametri o più. Questi includono modelli linguistici di grandi dimensioni (LLM) come Gemini.
  • Modello di grandi dimensioni: modelli ML che comprendono da decine a centinaia di miliardi di parametri o più.
Visualizza i suggerimenti per i modelli di pre-addestramento
Perfezionamento Ciò comporta l'utilizzo di un modello addestrato e il suo adattamento per eseguire attività specifiche utilizzando set di dati specializzati o altre tecniche. Il fine-tuning viene generalmente eseguito su modelli di grandi dimensioni. Consulta i suggerimenti per l'ottimizzazione dei modelli
Inferenza o pubblicazione Ciò comporta l'utilizzo di un modello addestrato o ottimizzato e la sua messa a disposizione per l'utilizzo da parte di utenti o applicazioni.
I workload di inferenza sono classificati in base alle dimensioni dei modelli come segue:
  • Inferenza per modelli di base su più host: esecuzione dell'inferenza con modelli ML addestrati che comprendono centinaia di miliardi fino a trilioni di parametri o più. Per questi carichi di lavoro di inferenza, il carico di calcolo è condiviso tra più macchine host.
  • Inferenza del foundation model su un singolo host: esecuzione dell'inferenza con modelli ML addestrati che comprendono decine o centinaia di miliardi di parametri. Per questi carichi di lavoro di inferenza, il carico computazionale è limitato a una singola macchina host.
  • Inferenza di modelli di grandi dimensioni: esecuzione dell'inferenza con modelli ML addestrati o ottimizzati che comprendono decine o centinaia di miliardi di parametri.
Visualizza i suggerimenti per l'inferenza
ML per modelli di piccole o medie dimensioni Ciò comporta l'addestramento e la gestione di modelli ML di dimensioni e complessità ridotte, in genere per attività più specializzate. Consulta i suggerimenti per ML per modelli di piccole o medie dimensioni
HPC Si tratta della pratica di aggregazione di risorse di calcolo per ottenere prestazioni superiori a quelle di una singola workstation, un singolo server o computer. L'HPC viene utilizzato per risolvere problemi di ricerca accademica, scienze, progettazione, simulazione e business intelligence. Consulta i consigli per HPC

Suggerimenti per i modelli di pre-addestramento

Per il preaddestramento dei foundation model, grandi cluster di acceleratori leggono continuamente grandi volumi di dati. Questi acceleratori modificano i pesi tramite passaggi in avanti e indietro per apprendere dai dati. Questi job di addestramento vengono eseguiti per settimane o addirittura mesi alla volta.

Le sezioni seguenti descrivono gli acceleratori e le opzioni di consumo che ti consigliamo di utilizzare per il pre-addestramento dei modelli di base.

Acceleratori consigliati

Per il pre-addestramento dei modelli di base su Google Cloud, ti consigliamo di utilizzare i tipi di macchine ottimizzati per l'acceleratore A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 da 141 GB), A3 Mega (NVIDIA H100 da 80 GB) o A3 High (NVIDIA H100 da 80 GB) e di utilizzare un orchestratore per il deployment del cluster.

Per eseguire il deployment di questi cluster di acceleratori, ti consigliamo anche di utilizzare Cluster Director o Cluster Toolkit. Per ulteriori informazioni, consulta la guida al deployment del cluster corrispondente al tipo di macchina che preferisci nella tabella seguente.

Workload Consigli Guida al deployment del cluster
Tipo di macchina Orchestratore
Modelli di base preaddestrati
  • A4X Max (NVIDIA GB300)
  • A4X (NVIDIA GB200)
  • A4 (NVIDIA B200)
GKE Crea un cluster GKE ottimizzato per l'AI con la configurazione predefinita
Slurm
Addestramento di modelli di grandi dimensioni A3 Ultra (NVIDIA H200 141GB) GKE Crea un cluster GKE ottimizzato per l'AI con la configurazione predefinita
Slurm
Addestramento di modelli di grandi dimensioni
  • A3 Mega (NVIDIA H100 da 80 GB)
  • A3 High (NVIDIA H100 da 80 GB)
GKE Massimizzare la larghezza di banda di rete della GPU nei cluster in modalità Standard
Slurm

Opzione di consumo consigliata

Per un elevato livello di garanzia nell'ottenimento di grandi cluster di acceleratori, ti consigliamo di utilizzare una prenotazione. Nello specifico, per ridurre al minimo i costi delle risorse riservate, ti consigliamo di richiedere una durata della prenotazione sufficientemente lunga da ricevere sconti per impegno di utilizzo. Per saperne di più sulle opzioni di consumo, vedi Scegliere un'opzione di consumo.

Suggerimenti per l'ottimizzazione dei modelli

Per ottimizzare i foundation model di grandi dimensioni, cluster più piccoli di acceleratori leggono volumi di dati moderati. Questi acceleratori regolano il modello per eseguire attività specifiche. Questi job di perfezionamento vengono eseguiti per giorni o addirittura settimane.

Le sezioni seguenti descrivono gli acceleratori e l'opzione di consumo consigliati da utilizzare durante la messa a punto dei modelli.

Per ottimizzare i modelli su Google Cloud, ti consigliamo di utilizzare i tipi di macchine A3 Ultra (NVIDIA H200 da 141 GB), A3 Mega (NVIDIA H100 da 80 GB) o A3 High (NVIDIA H100 da 80 GB) ottimizzati per l'acceleratore e di utilizzare un orchestratore per il deployment del cluster.

Per eseguire il deployment di questi cluster di acceleratori, ti consigliamo anche di utilizzare Cluster Director o Cluster Toolkit. Per ulteriori informazioni, consulta la guida al deployment del cluster corrispondente al tipo di macchina che preferisci nella tabella seguente.

Workload Consigli Guida al deployment del cluster
Tipo di macchina Orchestratore
Ottimizzazione di modelli di grandi dimensioni A3 Ultra (NVIDIA H200 141GB) GKE Crea un cluster GKE ottimizzato per l'AI con la configurazione predefinita
Slurm
Ottimizzazione di modelli di grandi dimensioni
  • A3 Mega (NVIDIA H100 da 80 GB)
  • A3 High (NVIDIA H100 da 80 GB)
GKE Massimizzare la larghezza di banda di rete della GPU nei cluster in modalità Standard
Slurm

Opzione di consumo consigliata

Per i workload di perfezionamento, utilizza una prenotazione futura in modalità calendario per eseguire il provisioning delle risorse. Per saperne di più sulle opzioni di consumo, vedi Scegliere un'opzione di consumo.

Consigli per l'inferenza

Le sezioni seguenti descrivono gli acceleratori e le opzioni di consumo consigliati da utilizzare durante l'inferenza.

Acceleratori consigliati

Gli acceleratori consigliati per l'inferenza dipendono dal tipo di inferenza che esegui: multi-host frontier o large model oppure single-host frontier.

Acceleratori consigliati (multi-host)

Per eseguire l'inferenza di modelli di frontiera o di grandi dimensioni su più host su Google Cloud, utilizza un tipo di macchina A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 da 141 GB), A3 Mega (NVIDIA H100 da 80 GB) o A3 High (NVIDIA H100 da 80 GB) ottimizzato per l'acceleratore e implementa la macchina utilizzando un orchestratore. Per eseguire il deployment di questi cluster di acceleratori, ti consigliamo anche di utilizzare Cluster Director o Cluster Toolkit. La tabella fornisce link alle guide al deployment dei cluster per ogni tipo di macchina consigliato.

Workload Consigli Guida al deployment del cluster
Tipo di macchina Orchestratore
Inferenza della frontiera multi-host
  • A4X Max (NVIDIA GB300)
  • A4X (NVIDIA GB200)
  • A4 (NVIDIA B200)
GKE Crea un cluster GKE ottimizzato per l'AI con la configurazione predefinita
Slurm
Inferenza di modelli di grandi dimensioni A3 Ultra (NVIDIA H200 141GB) GKE Crea un cluster GKE ottimizzato per l'AI con la configurazione predefinita
Slurm
Inferenza di modelli di grandi dimensioni
  • A3 Mega (NVIDIA H100 da 80 GB)
  • A3 High (NVIDIA H100 da 80 GB)
GKE Massimizzare la larghezza di banda di rete della GPU nei cluster in modalità Standard
Slurm

Acceleratori consigliati (singolo host)

La tabella descrive gli acceleratori che ti consigliamo di utilizzare per eseguire l'inferenza di frontiera su un singolo host. La tabella fornisce link alle guide al deployment delle VM per ogni tipo di macchina consigliato.

Workload Consigli Guida al deployment delle VM
Tipo di macchina Orchestratore
Inferenza di frontiera e mainstream a host singolo
  • A4 (NVIDIA B200)
  • A3 Ultra (NVIDIA H200 141GB)
N/D Crea un'istanza A4 o A3 Ultra
  • A3 High (NVIDIA H100 da 80 GB)
  • A3 Edge (NVIDIA H100 da 80 GB)
Crea un'istanza A3 High o A3 Edge
G4 (NVIDIA RTX PRO 6000) Crea un'istanza G4
A2 (NVIDIA A100) Crea un'istanza A2
G2 (NVIDIA L4) Crea un'istanza G2
N1 (NVIDIA T4 o V100) Crea un'istanza N1

Opzione di consumo consigliata

Per l'inferenza, utilizza una prenotazione a lunga esecuzione o una prenotazione futura in modalità calendario. Per ulteriori informazioni sulle opzioni di consumo, vedi Scegliere un'opzione di consumo.

Suggerimenti per modelli di piccole o medie dimensioni

Per i carichi di lavoro ML che coinvolgono modelli di dimensioni piccole e medie, raggiungere un equilibrio ottimale tra prezzo e prestazioni è una considerazione fondamentale.

Acceleratori consigliati

La tabella seguente descrive gli acceleratori consigliati da utilizzare per i workload ML di modelli di dimensioni piccole e medie.

Workload Consigli Guida al deployment delle VM
Tipo di macchina Orchestratore
ML per modelli di piccole o medie dimensioni G4 (NVIDIA RTX PRO 6000) N/D Crea un'istanza G4
G2 (NVIDIA L4) Crea un'istanza G2
A2 (NVIDIA A100) Crea un'istanza A2
A3 Edge (NVIDIA H100 da 80 GB) Crea un'istanza A3 Edge
N1 (NVIDIA T4 o V100) Crea un'istanza N1

Consigli per l'HPC (computing ad alte prestazioni)

Per i carichi di lavoro HPC, qualsiasi serie di macchine ottimizzata per l'acceleratore o serie di macchine ottimizzato per il calcolo funziona bene. Se utilizzi una serie di macchine ottimizzate per l'acceleratore, la soluzione migliore dipende dalla quantità di calcoli da trasferire sulla GPU. Per un elenco dettagliato di consigli per i carichi di lavoro HPC, consulta Best practice per l'esecuzione dei carichi di lavoro HPC.

Riepilogo dei consigli

La tabella seguente riepiloga gli acceleratori e le opzioni di consumo consigliati per ogni workload.

Risorsa Suggerimento
Pre-addestramento del modello
Famiglia di macchine Utilizza uno dei seguenti tipi di macchine ottimizzate per l'acceleratore: A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 da 141 GB), A3 Mega (NVIDIA H100 da 80 GB) o A3 High (NVIDIA H100 da 80 GB).
Opzione di consumo "Utilizza prenotazioni future standard
Ottimizzazione del modello
Famiglia di macchine Utilizza i tipi di macchine ottimizzati per l'acceleratore A3 Ultra (NVIDIA H200 da 141 GB), A3 Mega (NVIDIA H100 da 80 GB) o A3 High (NVIDIA H100 da 80 GB).
Opzione di consumo "Utilizza prenotazioni future standard
Inferenza
Famiglia di macchine Utilizza uno dei seguenti tipi di macchina: A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 da 141 GB), A3 Mega (NVIDIA H100 da 80 GB), A3 High (NVIDIA H100 da 80 GB), G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 da 80 GB) o N1 (NVIDIA T4 o V100).
Opzione di consumo Utilizzare prenotazioni, on demand o spot
ML per modelli di piccole o medie dimensioni
Famiglia di macchine Utilizza uno dei seguenti tipi di macchina: G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 80 GB) o N1 (NVIDIA T4 o V100)
Opzione di consumo Utilizzare prenotazioni on demand, spot o standard
Archiviazione Utilizzare Cloud Storage FUSE
HPC (computing ad alte prestazioni)
Consulta la sezione di riepilogo delle best practice per l'esecuzione dei carichi di lavoro HPC

Passaggi successivi