Informazioni sulle GPU

Le GPU (Graphics Processing Unit) sono acceleratori hardware specializzati progettati per elaborare simultaneamente workload massicciamente paralleli. Su Google Cloud, puoi collegare le GPU NVIDIA alle istanze Compute Engine e alle istanze bare metal per accelerare i carichi di lavoro impegnativi, come l'addestramento di intelligenza artificiale (AI) e machine learning (ML), il computing ad alte prestazioni (HPC), il rendering grafico e la transcodifica video.

Questo documento fornisce una panoramica delle GPU in Google Cloud, tra cui i modelli di GPU disponibili, i mapping delle serie di macchine, le caratteristiche delle prestazioni, i casi d'uso ideali e le considerazioni sui prezzi.

Che cos'è una GPU?

Una GPU è un processore massicciamente parallelo originariamente progettato per la grafica computerizzata e si è evoluto in un motore di calcolo essenziale per AI, ML e computing scientifico. A differenza delle unità di elaborazione centrale (CPU), che contengono alcuni core potenti ottimizzati per l'elaborazione sequenziale e a thread singolo, le GPU sono costituite da migliaia di core più piccoli e altamente efficienti progettati per eseguire calcoli matematici contemporaneamente su grandi set di dati.

I componenti architettonici chiave di un sistema GPU sono i seguenti:

  • Core CUDA: unità di elaborazione vettoriale per uso generico che eseguono istruzioni su più thread paralleli contemporaneamente utilizzando un'architettura SIMT (Single Instruction, Multiple Threads). I core CUDA gestiscono calcoli standard di vettori e in rappresentazione in virgola mobile (come FP32 e FP64), nonché rendering grafico generale e simulazioni fisiche.

  • Tensor Core: unità di elaborazione specializzate per la moltiplicazione e l'accumulo di matrici (MMA) progettate per accelerare i calcoli delle reti neurali. I Tensor Core offrono accelerazioni esponenziali per l'addestramento e l'inferenza dell'AI in formati di precisione numerica specializzati, tra cui FP4, FP8, INT8, TF32 e FP16/BF16.

  • Memoria a larghezza di banda elevata: memoria dedicata sul dispositivo che offre una larghezza di banda fino a diversi terabyte al secondo (TBps), ad esempio la memoria a larghezza di banda elevata (HBM) o la memoria GDDR (Graphics Double Data Rate). Questo elevato throughput consente di fornire dati a migliaia di core GPU durante operazioni di matrici intensive.

  • Interconnessioni ad alta velocità (NVLink e NVSwitch): tecnologie di interconnessione a bassa latenza e larghezza di banda elevata che collegano più GPU sullo stesso server o su più nodi. NVLink fornisce una comunicazione diretta GPU-to-GPU che bypassa il bus PCIe più lento, consentendo ai cluster di GPU di funzionare come un unico pool di memoria dell'acceleratore coerente.

  • Software per workstation virtuale (NVIDIA RTX vWS): software aziendale che fornisce l'accelerazione grafica virtualizzata per workstation visive remote, progettazione assistita da computer (CAD), creazione di contenuti digitali e modellazione 3D.

Modelli di GPU e serie di macchine

Google Cloud offre GPU NVIDIA di più generazioni per soddisfare diverse esigenze di carico di lavoro e budget. Su Compute Engine, le GPU sono disponibili come serie di macchine ottimizzate per l'acceleratore preconfigurate (serie A e G) o come acceleratori collegabili alle serie di macchine N1 per uso generico.

La tabella seguente riassume le specifiche hardware, i mapping delle serie di macchine, la larghezza di banda di rete e le funzionalità di archiviazione dei modelli di GPU disponibili su Compute Engine:

Modello di GPU Serie di macchine Architettura Memoria e larghezza di banda della GPU GPU per istanza di computing Larghezza di banda di rete massima SSD locale Interconnessione Supporto della workstation virtuale (vWS) NVIDIA RTX
NVIDIA GB300 A4X Max Blackwell Ultra 279 GB HBM3e (8 TBps) 4 (NVL72) 3600 Gbps 12.000 GiB NVLink Full Mesh (1800 GBps) No
NVIDIA GB200 A4X Blackwell 186 GB HBM3e (8 TBps) 4 (NVL72) 2000 Gbps 12.000 GiB NVLink Full Mesh (1800 GBps) No
NVIDIA B200 A4 Blackwell 180 GB HBM3e (8 TBps) 8 3600 Gbps 12.000 GiB NVLink Full Mesh (1800 GBps) No
NVIDIA H200 A3 Ultra Tramoggia 141 GB HBM3e (4,8 TBps) 8 3600 Gbps 12.000 GiB NVLink Full Mesh (900 GBps) No
NVIDIA H100 A3 Mega, High, Edge Tramoggia 80 GB HBM3 (3,35 TBps) 1, 2, 4, 8 Fino a 1000 Gbps Fino a 6000 GiB NVLink Full Mesh (900 GBps) No
NVIDIA A100 (80GB) A2 Ultra Ampere 80 GB HBM2e (1,9 TBps) 1, 2, 4, 8 100 Gbps Fino a 3000 GiB NVLink Full Mesh (600 GBps) No
NVIDIA A100 (40GB) A2 Standard Ampere 40 GB HBM2 (1,6 TBps) 1, 2, 4, 8, 16 100 Gbps Fino a 3000 GiB NVLink Full Mesh (600 GBps) No
NVIDIA RTX PRO 6000 G4 Blackwell 96 GB GDDR7 (1,597 TBps) 1/8, 1/4, 1/2, 1, 2, 4, 8 200 Gbps Fino a 3000 GiB PCIe Gen 5 Sì
NVIDIA L4 G2 Ada Lovelace 24 GB GDDR6 (300 GBps) 1, 2, 4, 8 100 Gbps Fino a 3000 GiB PCIe Gen 4 Sì
NVIDIA T4
(Fine del supporto imminente)
N1+T4 Turing 16 GB GDDR6 (320 GBps) 1, 2, 4 100 Gbps Supportato PCIe Gen 3 Sì
NVIDIA V100 N1+V100 Volta 16 GB HBM2 (900 GBps) 1, 2, 4, 8 100 Gbps Supportato NVLink Ring (300 GBps) No
NVIDIA P100
(fine del supporto imminente)
N1+P100 Pascal 16 GB HBM2 (732 GBps) 1, 2, 4 100 Gbps Supportato PCIe Gen 3 Sì
NVIDIA P4
(fine del supporto imminente)
N1+P4 Pascal 8 GB GDDR5 (192 GBps) 1, 2, 4 100 Gbps Supportato PCIe Gen 3 Sì

Caratteristiche delle prestazioni della GPU

La scelta del modello di GPU giusto dipende dalle caratteristiche di calcolo, dai requisiti di memoria, dai formati di precisione e dalle esigenze di scalabilità del tuo workload.

Casi d'uso ideali e requisiti del workload

Le GPU accelerano diversi carichi di lavoro computazionali in AI, visual computing e modellazione scientifica. Per comprendere i requisiti architetturali per ogni categoria di carico di lavoro, seleziona una delle seguenti schede:

Addestramento AI/ML

Inferenza AI/ML

  • Inferenza di modelli di grandi dimensioni (più di 70 miliardi di parametri): l'erogazione di modelli linguistici di grandi dimensioni (LLM) di grandi dimensioni beneficia di un'elevata capacità di memoria a larghezza di banda elevata (HBM3e) (141-186 GB per GPU) per adattare i pesi del modello a un numero inferiore di GPU, riducendo l'overhead di comunicazione tra i chip. Serie di macchine consigliate:

  • Servizio in tempo reale e ad alto throughput: le query interattive a bassa latenza, le risposte in streaming e la generazione di immagini utilizzano formati numerici quantizzati con accelerazione hardware, come rappresentazione in virgola mobile a 8 bit (FP8), numero intero a 8 bit (INT8) e numero intero a 4 bit (INT4), per massimizzare il throughput delle richieste per dollaro. Serie di macchine consigliata:

    Per saperne di più, consulta Consigli per l'inferenza di pubblicazione nella documentazione di AI Hypercomputer.

Grafica e visual computing

HPC e simulazione

Considerazioni sul workload

Le GPU in genere non sono adatte ai seguenti workload:

  • Logica sequenziale e a thread singolo: le attività dominate da rami decisionali sequenziali o pipeline di esecuzione seriale hanno un rendimento migliore sulle CPU con frequenze di clock single-core elevate.
  • Applicazioni web e microservizi standard: i server web per uso generico, i sistemi di gestione di database relazionali (RDBMS) e i backend API standard senza requisiti di elaborazione AI o grafica non traggono vantaggio dall'accelerazione GPU. Questi workload sono ospitati in modo più conveniente su istanze CPU per uso generico o ottimizzate per il calcolo.
  • Carichi di lavoro ottimizzati per XLA e framework compilati con grafici: se i tuoi modelli di deep learning sono creati utilizzando framework come JAX, PyTorch/XLA o TensorFlow, possono sfruttare le ottimizzazioni dei grafici basate sul compilatore (XLA). Se i tuoi modelli traggono vantaggio anche da array sistolici di matrici personalizzate e commutazione di circuiti ottici, valuta architetture di acceleratori alternative progettate per questi paradigmi di esecuzione specifici.

Considerazioni sui prezzi

I seguenti fattori determinano i prezzi delle GPU su Google Cloud:

  • Il modello di GPU specifico.

  • Il numero di GPU collegate.

  • Risorse di cui è stato eseguito il provisioning, come vCPU, memoria di sistema e spazio di archiviazione.

  • Il modello di consumo che selezioni.

Le sezioni seguenti descrivono i modelli di consumo e le opzioni di sconto disponibili per le GPU in Google Cloud.

Modelli di consumo e acquisto

Puoi eseguire il provisioning delle istanze GPU utilizzando diverse opzioni di consumo a seconda dei requisiti di disponibilità e della tolleranza ai costi:

  • On demand: prezzi standard con pagamento a consumo (PAYG) fatturati al secondo senza impegno a lungo termine. Le istanze on demand offrono flessibilità completa del ciclo di vita per lo sviluppo, i test e i workload di produzione variabili.

  • VM spot: istanze di computing con sconti elevati (fino al 60-91% in meno rispetto alle tariffe on demand) che utilizzano la capacitàGoogle Cloud in eccesso. Poiché Google Cloud può arrestare o eliminare le VM spot per recuperare capacità con un preavviso di 30 secondi, queste istanze di computing sono ideali per l'addestramento ML batch a tolleranza di errore, i job batch con checkpoint e il trattamento dati distribuito.

  • Flex-start VM: opzione di pianificazione dinamica basata su Dynamic Workload Scheduler (DWS) che esegue il provisioning delle risorse GPU in un periodo specificato per i workload a durata fissa (fino a 7 giorni) a tariffe scontate.

  • Prenotazioni:

    • Prenotazioni: puoi prenotare la capacità per le GPU standard e utilizzarla immediatamente.
    • Prenotazioni future (modalità calendario e AI Hypercomputer): puoi richiedere di prenotare la capacità GPU in cluster per una data e un'ora future. Se Google Cloud approva la richiesta, puoi iniziare a utilizzare la capacità all'ora specificata e mantenere l'accesso esclusivo fino al termine della prenotazione.

Opzioni di sconto

  • Sconti per impegno di utilizzo (CUD): offrono sconti sostanziali (fino al 55% per gli impegni triennali o al 37% per gli impegni annuali) in cambio dell'impegno a mantenere un livello continuo di utilizzo delle risorse in una regione specifica. Per i tipi di macchine ottimizzati per l'acceleratore e le GPU collegate, i CUD richiedono l'acquisto di impegni basati sulle risorse collegati alle prenotazioni.

  • Sconti per utilizzo sostenuto (SUD): sconti automatici applicati alle istanze di computing N1 e alle GPU collegate quando vengono eseguite per più del 25% di un mese di fatturazione. Le serie di macchine ottimizzate per l'acceleratore (serie A e G) non ricevono SUD.

Per i prezzi orari e mensili dettagliati in tutte le regioni, consulta la pagina dei prezzi delle GPU e la pagina dei prezzi delle istanze VM.

Per una matrice dettagliata delle funzionalità relative alla disponibilità delle opzioni di consumo in tutti i tipi di macchine con acceleratore, consulta Disponibilità delle opzioni di consumo per tipo di macchina.

Passaggi successivi