Le GPU (Graphics Processing Unit) sono acceleratori hardware specializzati progettati per elaborare simultaneamente workload massicciamente paralleli. Su Google Cloud, puoi collegare le GPU NVIDIA alle istanze Compute Engine e alle istanze bare metal per accelerare i carichi di lavoro impegnativi, come l'addestramento di intelligenza artificiale (AI) e machine learning (ML), il computing ad alte prestazioni (HPC), il rendering grafico e la transcodifica video.
Questo documento fornisce una panoramica delle GPU in Google Cloud, tra cui i modelli di GPU disponibili, i mapping delle serie di macchine, le caratteristiche delle prestazioni, i casi d'uso ideali e le considerazioni sui prezzi.
Che cos'è una GPU?
Una GPU è un processore massicciamente parallelo originariamente progettato per la grafica computerizzata e si è evoluto in un motore di calcolo essenziale per AI, ML e computing scientifico. A differenza delle unità di elaborazione centrale (CPU), che contengono alcuni core potenti ottimizzati per l'elaborazione sequenziale e a thread singolo, le GPU sono costituite da migliaia di core più piccoli e altamente efficienti progettati per eseguire calcoli matematici contemporaneamente su grandi set di dati.
I componenti architettonici chiave di un sistema GPU sono i seguenti:
Core CUDA: unità di elaborazione vettoriale per uso generico che eseguono istruzioni su più thread paralleli contemporaneamente utilizzando un'architettura SIMT (Single Instruction, Multiple Threads). I core CUDA gestiscono calcoli standard di vettori e in rappresentazione in virgola mobile (come FP32 e FP64), nonché rendering grafico generale e simulazioni fisiche.
Tensor Core: unità di elaborazione specializzate per la moltiplicazione e l'accumulo di matrici (MMA) progettate per accelerare i calcoli delle reti neurali. I Tensor Core offrono accelerazioni esponenziali per l'addestramento e l'inferenza dell'AI in formati di precisione numerica specializzati, tra cui FP4, FP8, INT8, TF32 e FP16/BF16.
Memoria a larghezza di banda elevata: memoria dedicata sul dispositivo che offre una larghezza di banda fino a diversi terabyte al secondo (TBps), ad esempio la memoria a larghezza di banda elevata (HBM) o la memoria GDDR (Graphics Double Data Rate). Questo elevato throughput consente di fornire dati a migliaia di core GPU durante operazioni di matrici intensive.
Interconnessioni ad alta velocità (NVLink e NVSwitch): tecnologie di interconnessione a bassa latenza e larghezza di banda elevata che collegano più GPU sullo stesso server o su più nodi. NVLink fornisce una comunicazione diretta GPU-to-GPU che bypassa il bus PCIe più lento, consentendo ai cluster di GPU di funzionare come un unico pool di memoria dell'acceleratore coerente.
Software per workstation virtuale (NVIDIA RTX vWS): software aziendale che fornisce l'accelerazione grafica virtualizzata per workstation visive remote, progettazione assistita da computer (CAD), creazione di contenuti digitali e modellazione 3D.
Modelli di GPU e serie di macchine
Google Cloud offre GPU NVIDIA di più generazioni per soddisfare diverse esigenze di carico di lavoro e budget. Su Compute Engine, le GPU sono disponibili come serie di macchine ottimizzate per l'acceleratore preconfigurate (serie A e G) o come acceleratori collegabili alle serie di macchine N1 per uso generico.
La tabella seguente riassume le specifiche hardware, i mapping delle serie di macchine, la larghezza di banda di rete e le funzionalità di archiviazione dei modelli di GPU disponibili su Compute Engine:
| Modello di GPU | Serie di macchine | Architettura | Memoria e larghezza di banda della GPU | GPU per istanza di computing | Larghezza di banda di rete massima | SSD locale | Interconnessione | Supporto della workstation virtuale (vWS) NVIDIA RTX |
|---|---|---|---|---|---|---|---|---|
| NVIDIA GB300 | A4X Max | Blackwell Ultra | 279 GB HBM3e (8 TBps) | 4 (NVL72) | 3600 Gbps | 12.000 GiB | NVLink Full Mesh (1800 GBps) | No |
| NVIDIA GB200 | A4X | Blackwell | 186 GB HBM3e (8 TBps) | 4 (NVL72) | 2000 Gbps | 12.000 GiB | NVLink Full Mesh (1800 GBps) | No |
| NVIDIA B200 | A4 | Blackwell | 180 GB HBM3e (8 TBps) | 8 | 3600 Gbps | 12.000 GiB | NVLink Full Mesh (1800 GBps) | No |
| NVIDIA H200 | A3 Ultra | Tramoggia | 141 GB HBM3e (4,8 TBps) | 8 | 3600 Gbps | 12.000 GiB | NVLink Full Mesh (900 GBps) | No |
| NVIDIA H100 | A3 Mega, High, Edge | Tramoggia | 80 GB HBM3 (3,35 TBps) | 1, 2, 4, 8 | Fino a 1000 Gbps | Fino a 6000 GiB | NVLink Full Mesh (900 GBps) | No |
| NVIDIA A100 (80GB) | A2 Ultra | Ampere | 80 GB HBM2e (1,9 TBps) | 1, 2, 4, 8 | 100 Gbps | Fino a 3000 GiB | NVLink Full Mesh (600 GBps) | No |
| NVIDIA A100 (40GB) | A2 Standard | Ampere | 40 GB HBM2 (1,6 TBps) | 1, 2, 4, 8, 16 | 100 Gbps | Fino a 3000 GiB | NVLink Full Mesh (600 GBps) | No |
| NVIDIA RTX PRO 6000 | G4 | Blackwell | 96 GB GDDR7 (1,597 TBps) | 1/8, 1/4, 1/2, 1, 2, 4, 8 | 200 Gbps | Fino a 3000 GiB | PCIe Gen 5 | Sì |
| NVIDIA L4 | G2 | Ada Lovelace | 24 GB GDDR6 (300 GBps) | 1, 2, 4, 8 | 100 Gbps | Fino a 3000 GiB | PCIe Gen 4 | Sì |
| NVIDIA T4 (Fine del supporto imminente) |
N1+T4 | Turing | 16 GB GDDR6 (320 GBps) | 1, 2, 4 | 100 Gbps | Supportato | PCIe Gen 3 | Sì |
| NVIDIA V100 | N1+V100 | Volta | 16 GB HBM2 (900 GBps) | 1, 2, 4, 8 | 100 Gbps | Supportato | NVLink Ring (300 GBps) | No |
| NVIDIA P100 (fine del supporto imminente) |
N1+P100 | Pascal | 16 GB HBM2 (732 GBps) | 1, 2, 4 | 100 Gbps | Supportato | PCIe Gen 3 | Sì |
| NVIDIA P4 (fine del supporto imminente) |
N1+P4 | Pascal | 8 GB GDDR5 (192 GBps) | 1, 2, 4 | 100 Gbps | Supportato | PCIe Gen 3 | Sì |
Caratteristiche delle prestazioni della GPU
La scelta del modello di GPU giusto dipende dalle caratteristiche di calcolo, dai requisiti di memoria, dai formati di precisione e dalle esigenze di scalabilità del tuo workload.
Casi d'uso ideali e requisiti del workload
Le GPU accelerano diversi carichi di lavoro computazionali in AI, visual computing e modellazione scientifica. Per comprendere i requisiti architetturali per ogni categoria di carico di lavoro, seleziona una delle seguenti schede:
Addestramento AI/ML
Modelli di base Frontier e Mixture-of-Experts (MoE): il pre-training di modelli Transformer di grandi dimensioni, architetture multimodali e reti Mixture-of-Experts (MoE) richiede un elevato throughput di Tensor Core, grandi capacità di High Bandwidth Memory (HBM) (fino a 279 GB per GPU) e una larghezza di banda di interconnessione NVLink ad altissima velocità (fino a 1800 GBps) per ridurre al minimo la latenza di sincronizzazione multi-nodo. Serie di macchine consigliata:
- A4X Max (NVIDIA GB300)
- A4X (NVIDIA GB200)
- A4 (NVIDIA B200)
- A3 Ultra (NVIDIA H200)
- A3 Mega (NVIDIA H100)
Per saperne di più, consulta Consigli per i modelli di preaddestramento nella documentazione di AI Hypercomputer.
Ottimizzazione e addestramento moderato del modello: l'adattamento dei modelli di base esistenti utilizzando tecniche come l'ottimizzazione efficiente dei parametri (PEFT) e Low-Rank Adaptation (LoRA) richiede una memoria GPU sufficiente per contenere i pesi e i gradienti del modello senza richiedere il clustering multinodo exascale. Serie di macchine consigliate:
Per saperne di più, consulta Consigli per l'ottimizzazione dei modelli nella documentazione di AI Hypercomputer.
Inferenza AI/ML
Inferenza di modelli di grandi dimensioni (più di 70 miliardi di parametri): l'erogazione di modelli linguistici di grandi dimensioni (LLM) di grandi dimensioni beneficia di un'elevata capacità di memoria a larghezza di banda elevata (HBM3e) (141-186 GB per GPU) per adattare i pesi del modello a un numero inferiore di GPU, riducendo l'overhead di comunicazione tra i chip. Serie di macchine consigliate:
Servizio in tempo reale e ad alto throughput: le query interattive a bassa latenza, le risposte in streaming e la generazione di immagini utilizzano formati numerici quantizzati con accelerazione hardware, come rappresentazione in virgola mobile a 8 bit (FP8), numero intero a 8 bit (INT8) e numero intero a 4 bit (INT4), per massimizzare il throughput delle richieste per dollaro. Serie di macchine consigliata:
- G2 (NVIDIA L4)
- G4 (NVIDIA RTX PRO 6000)
- A3 Edge e High (NVIDIA H100)
Per saperne di più, consulta Consigli per l'inferenza di pubblicazione nella documentazione di AI Hypercomputer.
Grafica e visual computing
CAD 3D, gemelli digitali e workstation virtuali: modellazione 3D interattiva, progettazione assistita da computer (CAD), rendering architettonico e gemelli digitali (come NVIDIA Omniverse) utilizzano core ray tracing (RT) dedicati e workstation virtuali (vWS) NVIDIA RTX per workstation visive remote e GPU virtuali (vGPU) frazionarie. Serie di macchine consigliata:
Elaborazione e transcodifica video: le pipeline di live streaming, la transcodifica video e l'elaborazione dei contenuti multimediali utilizzano motori video NVIDIA Encoder (NVENC) e NVIDIA Decoder (NVDEC) dedicati che supportano i codec AV1, High Efficiency Video Coding (HEVC) e H.264. Serie di macchine consigliata:
HPC e simulazione
Simulazione e modellazione scientifica: applicazioni in dinamica molecolare (come GROMACS e AMBER), fluidodinamica computazionale (CFD), chimica quantistica, astrofisica e previsioni meteorologiche richiedono prestazioni in rappresentazione in virgola mobile a doppia precisione (FP64) a 64 bit elevate e larghezza di banda della memoria elevata. Serie di macchine consigliata:
Per saperne di più, consulta Consigli per l'HPC (computing ad alte prestazioni) nella documentazione di AI Hypercomputer.
Considerazioni sul workload
Le GPU in genere non sono adatte ai seguenti workload:
- Logica sequenziale e a thread singolo: le attività dominate da rami decisionali sequenziali o pipeline di esecuzione seriale hanno un rendimento migliore sulle CPU con frequenze di clock single-core elevate.
- Applicazioni web e microservizi standard: i server web per uso generico, i sistemi di gestione di database relazionali (RDBMS) e i backend API standard senza requisiti di elaborazione AI o grafica non traggono vantaggio dall'accelerazione GPU. Questi workload sono ospitati in modo più conveniente su istanze CPU per uso generico o ottimizzate per il calcolo.
- Carichi di lavoro ottimizzati per XLA e framework compilati con grafici: se i tuoi modelli di deep learning sono creati utilizzando framework come JAX, PyTorch/XLA o TensorFlow, possono sfruttare le ottimizzazioni dei grafici basate sul compilatore (XLA). Se i tuoi modelli traggono vantaggio anche da array sistolici di matrici personalizzate e commutazione di circuiti ottici, valuta architetture di acceleratori alternative progettate per questi paradigmi di esecuzione specifici.
Considerazioni sui prezzi
I seguenti fattori determinano i prezzi delle GPU su Google Cloud:
Il modello di GPU specifico.
Il numero di GPU collegate.
Risorse di cui è stato eseguito il provisioning, come vCPU, memoria di sistema e spazio di archiviazione.
Il modello di consumo che selezioni.
Le sezioni seguenti descrivono i modelli di consumo e le opzioni di sconto disponibili per le GPU in Google Cloud.
Modelli di consumo e acquisto
Puoi eseguire il provisioning delle istanze GPU utilizzando diverse opzioni di consumo a seconda dei requisiti di disponibilità e della tolleranza ai costi:
On demand: prezzi standard con pagamento a consumo (PAYG) fatturati al secondo senza impegno a lungo termine. Le istanze on demand offrono flessibilità completa del ciclo di vita per lo sviluppo, i test e i workload di produzione variabili.
VM spot: istanze di computing con sconti elevati (fino al 60-91% in meno rispetto alle tariffe on demand) che utilizzano la capacitàGoogle Cloud in eccesso. Poiché Google Cloud può arrestare o eliminare le VM spot per recuperare capacità con un preavviso di 30 secondi, queste istanze di computing sono ideali per l'addestramento ML batch a tolleranza di errore, i job batch con checkpoint e il trattamento dati distribuito.
Flex-start VM: opzione di pianificazione dinamica basata su Dynamic Workload Scheduler (DWS) che esegue il provisioning delle risorse GPU in un periodo specificato per i workload a durata fissa (fino a 7 giorni) a tariffe scontate.
Prenotazioni:
- Prenotazioni: puoi prenotare la capacità per le GPU standard e utilizzarla immediatamente.
- Prenotazioni future (modalità calendario e AI Hypercomputer): puoi richiedere di prenotare la capacità GPU in cluster per una data e un'ora future. Se Google Cloud approva la richiesta, puoi iniziare a utilizzare la capacità all'ora specificata e mantenere l'accesso esclusivo fino al termine della prenotazione.
Opzioni di sconto
Sconti per impegno di utilizzo (CUD): offrono sconti sostanziali (fino al 55% per gli impegni triennali o al 37% per gli impegni annuali) in cambio dell'impegno a mantenere un livello continuo di utilizzo delle risorse in una regione specifica. Per i tipi di macchine ottimizzati per l'acceleratore e le GPU collegate, i CUD richiedono l'acquisto di impegni basati sulle risorse collegati alle prenotazioni.
Sconti per utilizzo sostenuto (SUD): sconti automatici applicati alle istanze di computing N1 e alle GPU collegate quando vengono eseguite per più del 25% di un mese di fatturazione. Le serie di macchine ottimizzate per l'acceleratore (serie A e G) non ricevono SUD.
Per i prezzi orari e mensili dettagliati in tutte le regioni, consulta la pagina dei prezzi delle GPU e la pagina dei prezzi delle istanze VM.
Per una matrice dettagliata delle funzionalità relative alla disponibilità delle opzioni di consumo in tutti i tipi di macchine con acceleratore, consulta Disponibilità delle opzioni di consumo per tipo di macchina.
Passaggi successivi
- Esplora le macchine GPU nella famiglia di macchine ottimizzate per l'acceleratore.
- Scopri come creare una VM con GPU collegate.
- Scopri l'architettura di supercomputing AI di Google Cloudnella panoramica di AI Hypercomputer.