Questo documento fornisce consigli sugli acceleratori, sulle opzioni di consumo e sugli strumenti di deployment più adatti a diversi workload di intelligenza artificiale (AI), machine learning (ML) e computing ad alte prestazioni (HPC). Utilizza questo documento per identificare il deployment migliore per il tuo carico di lavoro.
Per informazioni e consigli sui pilastri dell'infrastruttura per i workload AI, ML e HPC, consulta i seguenti documenti:
- Informazioni sugli acceleratori GPU
- Panoramica del networking GPU
- Panoramica dei servizi di archiviazione
Panoramica dei workload
L'architettura AI Hypercomputer supporta i seguenti casi d'uso:
| Workload | Descrizione | Suggerimento |
|---|---|---|
| Modelli di base preaddestrati | Ciò comporta la creazione di un modello linguistico utilizzando un set di dati di grandi dimensioni. Il
risultato del pre-addestramento dei foundation model è un nuovo modello in grado
di svolgere attività generali. I modelli sono classificati in base alle loro dimensioni come segue:
|
Visualizza i suggerimenti per i modelli di pre-addestramento |
| Perfezionamento | Ciò comporta l'utilizzo di un modello addestrato e il suo adattamento per eseguire attività specifiche utilizzando set di dati specializzati o altre tecniche. Il fine-tuning viene generalmente eseguito su modelli di grandi dimensioni. | Consulta i suggerimenti per l'ottimizzazione dei modelli |
| Inferenza o pubblicazione | Ciò comporta l'utilizzo di un modello addestrato o ottimizzato e la sua
messa a disposizione per l'utilizzo da parte di utenti o applicazioni. I workload di inferenza sono classificati in base alle dimensioni dei modelli come segue:
|
Visualizza i suggerimenti per l'inferenza |
| ML per modelli di piccole o medie dimensioni | Ciò comporta l'addestramento e la gestione di modelli ML di dimensioni e complessità ridotte, in genere per attività più specializzate. | Consulta i suggerimenti per ML per modelli di piccole o medie dimensioni |
| HPC | Si tratta della pratica di aggregazione di risorse di calcolo per ottenere prestazioni superiori a quelle di una singola workstation, un singolo server o computer. L'HPC viene utilizzato per risolvere problemi di ricerca accademica, scienze, progettazione, simulazione e business intelligence. | Consulta i consigli per HPC |
Suggerimenti per i modelli di pre-addestramento
Per il preaddestramento dei foundation model, grandi cluster di acceleratori leggono continuamente grandi volumi di dati. Questi acceleratori modificano i pesi tramite passaggi in avanti e indietro per apprendere dai dati. Questi job di addestramento vengono eseguiti per settimane o addirittura mesi alla volta.
Le sezioni seguenti descrivono gli acceleratori e le opzioni di consumo che ti consigliamo di utilizzare per il pre-addestramento dei modelli di base.
Acceleratori consigliati
Per il pre-addestramento dei modelli di base su Google Cloud, ti consigliamo di utilizzare i tipi di macchine ottimizzati per l'acceleratore A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 da 141 GB), A3 Mega (NVIDIA H100 da 80 GB) o A3 High (NVIDIA H100 da 80 GB) e di utilizzare un orchestratore per il deployment del cluster.
Per eseguire il deployment di questi cluster di acceleratori, ti consigliamo anche di utilizzare Cluster Director o Cluster Toolkit. Per ulteriori informazioni, consulta la guida al deployment del cluster corrispondente al tipo di macchina che preferisci nella tabella seguente.
| Workload | Consigli | Guida al deployment del cluster | |
|---|---|---|---|
| Tipo di macchina | Orchestratore | ||
| Modelli di base preaddestrati |
|
GKE | Crea un cluster GKE ottimizzato per l'AI con la configurazione predefinita |
| Slurm | |||
| Addestramento di modelli di grandi dimensioni | A3 Ultra (NVIDIA H200 141GB) | GKE | Crea un cluster GKE ottimizzato per l'AI con la configurazione predefinita |
| Slurm | |||
| Addestramento di modelli di grandi dimensioni |
|
GKE | Massimizzare la larghezza di banda di rete della GPU nei cluster in modalità Standard |
| Slurm | |||
Opzione di consumo consigliata
Per un elevato livello di garanzia nell'ottenimento di grandi cluster di acceleratori, ti consigliamo di utilizzare una prenotazione. Nello specifico, per ridurre al minimo i costi delle risorse riservate, ti consigliamo di richiedere una durata della prenotazione sufficientemente lunga da ricevere sconti per impegno di utilizzo. Per saperne di più sulle opzioni di consumo, vedi Scegliere un'opzione di consumo.
Suggerimenti per l'ottimizzazione dei modelli
Per ottimizzare i foundation model di grandi dimensioni, cluster più piccoli di acceleratori leggono volumi di dati moderati. Questi acceleratori regolano il modello per eseguire attività specifiche. Questi job di perfezionamento vengono eseguiti per giorni o addirittura settimane.
Le sezioni seguenti descrivono gli acceleratori e l'opzione di consumo consigliati da utilizzare durante la messa a punto dei modelli.
Acceleratori consigliati
Per ottimizzare i modelli su Google Cloud, ti consigliamo di utilizzare i tipi di macchine A3 Ultra (NVIDIA H200 da 141 GB), A3 Mega (NVIDIA H100 da 80 GB) o A3 High (NVIDIA H100 da 80 GB) ottimizzati per l'acceleratore e di utilizzare un orchestratore per il deployment del cluster.
Per eseguire il deployment di questi cluster di acceleratori, ti consigliamo anche di utilizzare Cluster Director o Cluster Toolkit. Per ulteriori informazioni, consulta la guida al deployment del cluster corrispondente al tipo di macchina che preferisci nella tabella seguente.
| Workload | Consigli | Guida al deployment del cluster | |
|---|---|---|---|
| Tipo di macchina | Orchestratore | ||
| Ottimizzazione di modelli di grandi dimensioni | A3 Ultra (NVIDIA H200 141GB) | GKE | Crea un cluster GKE ottimizzato per l'AI con la configurazione predefinita |
| Slurm | |||
| Ottimizzazione di modelli di grandi dimensioni |
|
GKE | Massimizzare la larghezza di banda di rete della GPU nei cluster in modalità Standard |
| Slurm | |||
Opzione di consumo consigliata
Per i workload di perfezionamento, utilizza una prenotazione futura in modalità calendario per eseguire il provisioning delle risorse. Per saperne di più sulle opzioni di consumo, vedi Scegliere un'opzione di consumo.
Consigli per l'inferenza
Le sezioni seguenti descrivono gli acceleratori e le opzioni di consumo consigliati da utilizzare durante l'inferenza.
Acceleratori consigliati
Gli acceleratori consigliati per l'inferenza dipendono dal tipo di inferenza che esegui: multi-host frontier o large model oppure single-host frontier.
Acceleratori consigliati (multi-host)
Per eseguire l'inferenza di modelli di frontiera o di grandi dimensioni su più host su Google Cloud, utilizza un tipo di macchina A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 da 141 GB), A3 Mega (NVIDIA H100 da 80 GB) o A3 High (NVIDIA H100 da 80 GB) ottimizzato per l'acceleratore e implementa la macchina utilizzando un orchestratore. Per eseguire il deployment di questi cluster di acceleratori, ti consigliamo anche di utilizzare Cluster Director o Cluster Toolkit. La tabella fornisce link alle guide al deployment dei cluster per ogni tipo di macchina consigliato.
| Workload | Consigli | Guida al deployment del cluster | |
|---|---|---|---|
| Tipo di macchina | Orchestratore | ||
| Inferenza della frontiera multi-host |
|
GKE | Crea un cluster GKE ottimizzato per l'AI con la configurazione predefinita |
| Slurm | |||
| Inferenza di modelli di grandi dimensioni | A3 Ultra (NVIDIA H200 141GB) | GKE | Crea un cluster GKE ottimizzato per l'AI con la configurazione predefinita |
| Slurm | |||
| Inferenza di modelli di grandi dimensioni |
|
GKE | Massimizzare la larghezza di banda di rete della GPU nei cluster in modalità Standard |
| Slurm | |||
Acceleratori consigliati (singolo host)
La tabella descrive gli acceleratori che ti consigliamo di utilizzare per eseguire l'inferenza di frontiera su un singolo host. La tabella fornisce link alle guide al deployment delle VM per ogni tipo di macchina consigliato.
| Workload | Consigli | Guida al deployment delle VM | |
|---|---|---|---|
| Tipo di macchina | Orchestratore | ||
| Inferenza di frontiera e mainstream a host singolo |
|
N/D | Crea un'istanza A4 o A3 Ultra |
|
Crea un'istanza A3 High o A3 Edge | ||
| G4 (NVIDIA RTX PRO 6000) | Crea un'istanza G4 | ||
| A2 (NVIDIA A100) | Crea un'istanza A2 | ||
| G2 (NVIDIA L4) | Crea un'istanza G2 | ||
| N1 (NVIDIA T4 o V100) | Crea un'istanza N1 | ||
Opzione di consumo consigliata
Per l'inferenza, utilizza una prenotazione a lunga esecuzione o una prenotazione futura in modalità calendario. Per ulteriori informazioni sulle opzioni di consumo, vedi Scegliere un'opzione di consumo.
Suggerimenti per modelli di piccole o medie dimensioni
Per i carichi di lavoro ML che coinvolgono modelli di dimensioni piccole e medie, raggiungere un equilibrio ottimale tra prezzo e prestazioni è una considerazione fondamentale.
Acceleratori consigliati
La tabella seguente descrive gli acceleratori consigliati da utilizzare per i workload ML di modelli di dimensioni piccole e medie.
| Workload | Consigli | Guida al deployment delle VM | |
|---|---|---|---|
| Tipo di macchina | Orchestratore | ||
| ML per modelli di piccole o medie dimensioni | G4 (NVIDIA RTX PRO 6000) | N/D | Crea un'istanza G4 |
| G2 (NVIDIA L4) | Crea un'istanza G2 | ||
| A2 (NVIDIA A100) | Crea un'istanza A2 | ||
| A3 Edge (NVIDIA H100 da 80 GB) | Crea un'istanza A3 Edge | ||
| N1 (NVIDIA T4 o V100) | Crea un'istanza N1 | ||
Consigli per l'HPC (computing ad alte prestazioni)
Per i carichi di lavoro HPC, qualsiasi serie di macchine ottimizzata per l'acceleratore o serie di macchine ottimizzato per il calcolo funziona bene. Se utilizzi una serie di macchine ottimizzate per l'acceleratore, la soluzione migliore dipende dalla quantità di calcoli da trasferire sulla GPU. Per un elenco dettagliato di consigli per i carichi di lavoro HPC, consulta Best practice per l'esecuzione dei carichi di lavoro HPC.
Riepilogo dei consigli
La tabella seguente riepiloga gli acceleratori e le opzioni di consumo consigliati per ogni workload.
| Risorsa | Suggerimento |
|---|---|
| Pre-addestramento del modello | |
| Famiglia di macchine | Utilizza uno dei seguenti tipi di macchine ottimizzate per l'acceleratore: A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 da 141 GB), A3 Mega (NVIDIA H100 da 80 GB) o A3 High (NVIDIA H100 da 80 GB). |
| Opzione di consumo | "Utilizza prenotazioni future standard |
| Ottimizzazione del modello | |
| Famiglia di macchine | Utilizza i tipi di macchine ottimizzati per l'acceleratore A3 Ultra (NVIDIA H200 da 141 GB), A3 Mega (NVIDIA H100 da 80 GB) o A3 High (NVIDIA H100 da 80 GB). |
| Opzione di consumo | "Utilizza prenotazioni future standard |
| Inferenza | |
| Famiglia di macchine | Utilizza uno dei seguenti tipi di macchina: A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 da 141 GB), A3 Mega (NVIDIA H100 da 80 GB), A3 High (NVIDIA H100 da 80 GB), G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 da 80 GB) o N1 (NVIDIA T4 o V100). |
| Opzione di consumo | Utilizzare prenotazioni, on demand o spot |
| ML per modelli di piccole o medie dimensioni | |
| Famiglia di macchine | Utilizza uno dei seguenti tipi di macchina: G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 80 GB) o N1 (NVIDIA T4 o V100) |
| Opzione di consumo | Utilizzare prenotazioni on demand, spot o standard |
| Archiviazione | Utilizzare Cloud Storage FUSE |
| HPC (computing ad alte prestazioni) | |
| Consulta la sezione di riepilogo delle best practice per l'esecuzione dei carichi di lavoro HPC | |
Passaggi successivi
- Scopri come creare un cluster GKE ottimizzato per l'AI.
- Scopri come creare un cluster Slurm completamente gestito.
- Scopri come creare un'istanza ottimizzata per l'AI.