Grafikprozessoren (GPUs) sind spezielle Hardwarebeschleuniger, die für die gleichzeitige Verarbeitung von extrem parallelisierten Arbeitslasten entwickelt wurden. AufGoogle Cloudkönnen Sie NVIDIA-GPUs an Compute Engine-Instanzen und Bare-Metal-Instanzen anhängen, um anspruchsvolle Arbeitslasten wie Training für künstliche Intelligenz (KI) und maschinelles Lernen (ML), Hochleistungs-Computing (HPC), Grafikrendering und Videotranscodierung zu beschleunigen.
Dieses Dokument bietet einen Überblick über GPUs in Google Cloud, einschließlich verfügbarer GPU-Modelle, Zuordnungen von Maschinenserien, Leistungsmerkmalen, idealen Anwendungsfällen und Preisüberlegungen.
Was ist eine GPU?
Eine GPU ist ein massiv paralleler Prozessor, der ursprünglich für Computergrafiken entwickelt wurde und sich zu einer wichtigen Rechenmaschine für KI, ML und wissenschaftliches Rechnen entwickelt hat. Im Gegensatz zu Central Processing Units (CPUs), die einige leistungsstarke Kerne enthalten, die für die sequenzielle, Single-Thread-Verarbeitung optimiert sind, bestehen GPUs aus Tausenden von kleineren, hocheffizienten Kernen, die darauf ausgelegt sind, mathematische Berechnungen gleichzeitig für große Datasets durchzuführen.
Die wichtigsten architektonischen Komponenten eines GPU-Systems sind:
CUDA-Kerne: Vektorverarbeitungseinheiten für allgemeine Zwecke, die Anweisungen in mehreren parallelen Threads gleichzeitig mithilfe einer SIMT-Architektur (Single Instruction, Multiple Threads) ausführen. CUDA-Kerne verarbeiten Standardvektor- und Gleitkommaberechnungen (z. B. FP32 und FP64) sowie allgemeines Grafikrendering und physikalische Simulationen.
Tensor Cores: Spezialisierte MMA-Verarbeitungseinheiten (Matrix Multiply-Accumulate), die für die Beschleunigung von Berechnungen für neuronale Netze entwickelt wurden. Tensor Cores bieten exponentielle Geschwindigkeitssteigerungen für KI-Training und ‑Inferenz in spezialisierten numerischen Präzisionsformaten wie FP4, FP8, INT8, TF32 und FP16/BF16.
Speicher mit hoher Bandbreite: Dedizierter On-Device-Speicher, der eine Bandbreite von bis zu mehreren Terabyte pro Sekunde (TBps) bietet, z. B. High Bandwidth Memory (HBM) oder Graphics Double Data Rate (GDDR). Durch diesen hohen Durchsatz werden Tausende von GPU-Kernen bei intensiven Matrixoperationen mit Daten versorgt.
Hochgeschwindigkeits-Interconnect-Verbindungen (NVLink und NVSwitch): Interconnect-Technologien mit hoher Bandbreite und niedriger Latenz, die mehrere GPUs auf demselben Server oder über Knoten hinweg verbinden. NVLink ermöglicht die direkte GPU-zu-GPU-Kommunikation, die den langsameren PCIe-Bus umgeht. So können GPU-Cluster als ein einziger, zusammenhängender Beschleunigerspeicherpool fungieren.
Software für virtuelle Workstations (NVIDIA RTX vWS): Unternehmenssoftware, die virtualisierte Grafikbeschleunigung für visuelle Remote-Workstations, computergestütztes Design (CAD), digitale Inhaltserstellung und 3D-Modellierung bietet.
GPU-Modelle und Maschinenserien
Google Cloud bietet NVIDIA-GPUs verschiedener Generationen an, um unterschiedlichen Arbeitslast- und Budgetanforderungen gerecht zu werden. In Compute Engine sind GPUs entweder als vorkonfigurierte beschleunigungsoptimierte Maschinenserien (A- und G-Serie) oder als anhängbare Beschleuniger in der N1-Maschinenserie für allgemeine Zwecke verfügbar.
In der folgenden Tabelle sind die Hardwarespezifikationen, die Zuordnungen von Maschinenserien, die Netzwerkbandbreite und die Speicherfunktionen der in Compute Engine verfügbaren GPU-Modelle zusammengefasst:
| GPU-Modell | Maschinenserie | Architektur | GPU-Arbeitsspeicher und ‑Bandbreite | GPUs pro Compute-Instanz | Maximale Netzwerkbandbreite | Lokale SSD | Interconnect | Unterstützung für NVIDIA RTX Virtual Workstation (vWS) |
|---|---|---|---|---|---|---|---|---|
| NVIDIA GB300 | A4X Max | Blackwell Ultra | 279 GB HBM3e (8 TB/s) | 4 (NVL72) | 3.600 Gbit/s | 12.000 GiB | NVLink Full Mesh (1.800 GB/s) | Nein |
| NVIDIA GB200 | A4X | Blackwell | 186 GB HBM3e (8 TBps) | 4 (NVL72) | 2.000 Gbit/s | 12.000 GiB | NVLink Full Mesh (1.800 GB/s) | Nein |
| NVIDIA B200 | A4 | Blackwell | 180 GB HBM3e (8 TBps) | 8 | 3.600 Gbit/s | 12.000 GiB | NVLink Full Mesh (1.800 GB/s) | Nein |
| NVIDIA H200 | A3 Ultra | Einfülltrichter | 141 GB HBM3e (4,8 TB/s) | 8 | 3.600 Gbit/s | 12.000 GiB | NVLink Full Mesh (900 GB/s) | Nein |
| NVIDIA H100 | A3 Mega, High, Edge | Einfülltrichter | 80 GB HBM3 (3,35 TBps) | 1, 2, 4, 8 | Bis zu 1.000 Gbit/s | Bis zu 6.000 GiB | NVLink Full Mesh (900 GB/s) | Nein |
| NVIDIA A100 (80 GB) | A2-Ultra | Ampere | 80 GB HBM2e (1,9 TBps) | 1, 2, 4, 8 | 100 Gbit/s | Bis zu 3.000 GiB | NVLink Full Mesh (600 GB/s) | Nein |
| NVIDIA A100 (40 GB) | A2-Standard | Ampere | 40 GB HBM2 (1,6 TB/s) | 1, 2, 4, 8, 16 | 100 Gbit/s | Bis zu 3.000 GiB | NVLink Full Mesh (600 GB/s) | Nein |
| NVIDIA RTX Pro 6000 | G4 | Blackwell | 96 GB GDDR7 (1.597 TB/s) | 1/8, 1/4, 1/2, 1, 2, 4, 8 | 200 Gbit/s | Bis zu 3.000 GiB | PCIe Gen 5 | Ja |
| NVIDIA L4 | G2 | Ada Lovelace | 24 GB GDDR6 (300 GB/s) | 1, 2, 4, 8 | 100 Gbit/s | Bis zu 3.000 GiB | PCIe Gen 4 | Ja |
| NVIDIA T4 (Ende der Unterstützung steht bevor) |
N1+T4 | Turing | 16 GB GDDR6 (320 GB/s) | 1, 2, 4 | 100 Gbit/s | Unterstützt | PCIe Gen 3 | Ja |
| NVIDIA V100 | N1+V100 | Volta | 16 GB HBM2 (900 GB/s) | 1, 2, 4, 8 | 100 Gbit/s | Unterstützt | NVLink Ring (300 GB/s) | Nein |
| NVIDIA P100 (Ende der Unterstützung steht bevor) |
N1+P100 | Pascal | 16 GB HBM2 (732 GB/s) | 1, 2, 4 | 100 Gbit/s | Unterstützt | PCIe Gen 3 | Ja |
| NVIDIA P4 (Ende der Unterstützung steht bevor) |
N1+P4 | Pascal | 8 GB GDDR5 (192 GB/s) | 1, 2, 4 | 100 Gbit/s | Unterstützt | PCIe Gen 3 | Ja |
GPU-Leistungsmerkmale
Die Wahl des richtigen GPU-Modells hängt von den Rechenmerkmalen, den Speicheranforderungen, den Präzisionsformaten und den Skalierbarkeitsanforderungen Ihrer Arbeitslast ab.
Ideale Anwendungsfälle und Arbeitslastanforderungen
GPUs beschleunigen verschiedene Rechenarbeitslasten in den Bereichen KI, visuelles Computing und wissenschaftliche Modellierung. Wenn Sie mehr über die architektonischen Anforderungen für die einzelnen Arbeitslastkategorien erfahren möchten, wählen Sie einen der folgenden Tabs aus:
KI-/ML-Training
Frontier-Fundierungsmodelle und Mixture-of-Experts (MoE): Das Vorabtraining von massiven Transformer-Modellen, multimodalen Architekturen und Mixture-of-Experts (MoE)-Netzwerken erfordert einen hohen Tensor Core-Durchsatz, große HBM-Kapazitäten (High Bandwidth Memory) (bis zu 279 GB pro GPU) und eine ultraschnelle NVLink-Verbindungsbandbreite (bis zu 1.800 GBps), um die Synchronisierungslatenz zwischen mehreren Knoten zu minimieren. Empfohlene Maschinenserie:
- A4X Max (NVIDIA GB300)
- A4X (NVIDIA GB200)
- A4 (NVIDIA B200)
- A3 Ultra (NVIDIA H200)
- A3 Mega (NVIDIA H100)
Weitere Informationen finden Sie in der AI Hypercomputer-Dokumentation unter Recommendations for pre-training models.
Abstimmung und moderates Modelltraining: Die Anpassung vorhandener Fundierungsmodelle mit Techniken wie Parameter-Efficient Fine-Tuning (PEFT) und Low-Rank Adaptation (LoRA) erfordert ausreichend GPU-Arbeitsspeicher, um Modellgewichte und ‑gradienten zu speichern, ohne dass Exascale-Multi-Node-Clustering erforderlich ist. Empfohlene Maschinenreihe:
Weitere Informationen finden Sie in der AI Hypercomputer-Dokumentation unter Empfehlungen zum Feinabstimmen von Modellen.
KI/ML-Inferenz
Inferenz großer Modelle (mehr als 70 Milliarden Parameter): Das Bereitstellen von riesigen Large Language Models (LLMs) profitiert von der hohen Kapazität des High Bandwidth Memory (HBM3e) (141–186 GB pro GPU), um Modellgewichte auf weniger GPUs zu verteilen und so den Kommunikationsaufwand zwischen den Chips zu reduzieren. Empfohlene Maschinenreihe:
Hoher Durchsatz und Echtzeitbereitstellung: Interaktive Anfragen mit geringer Latenz, Streamingantworten und Bildgenerierung verwenden hardwarebeschleunigte quantisierte numerische Formate wie 8-Bit-Gleitkomma (FP8), 8-Bit-Ganzzahl (INT8) und 4-Bit-Ganzzahl (INT4), um den Anfragedurchsatz pro Dollar zu maximieren. Empfohlene Maschinenserie:
- G2 (NVIDIA L4)
- G4 (NVIDIA RTX PRO 6000)
- A3 Edge und High (NVIDIA H100)
Weitere Informationen finden Sie in der AI Hypercomputer-Dokumentation unter Empfehlungen für die Bereitstellung von Inferenz.
Grafik und visuelles Computing
3D-CAD, digitale Zwillinge und virtuelle Workstations: Interaktive 3D-Modellierung, computergestütztes Design (CAD), Architekturrendering und digitale Zwillinge (z. B. NVIDIA Omniverse) verwenden dedizierte Raytracing-Kerne (RT) und NVIDIA RTX Virtual Workstations (vWS) für visuelle Remote-Workstations und fraktionierte virtuelle GPUs (vGPUs). Empfohlene Maschinenserie:
Videoverarbeitung und Transcodierung: Live-Streaming-Pipelines, Videotranscodierung und Medienverarbeitung nutzen dedizierte Hardware-Video-Engines, die NVIDIA Encoder (NVENC) und NVIDIA Decoder (NVDEC) unterstützen und die Codecs AV1, High Efficiency Video Coding (HEVC) und H.264 unterstützen. Empfohlene Maschinenserie:
HPC und Simulation
Wissenschaftliche Simulation und Modellierung: Anwendungen in den Bereichen Molekulardynamik (z. B. GROMACS und AMBER), numerische Strömungsmechanik (Computational Fluid Dynamics, CFD), Quantenchemie, Astrophysik und Wettervorhersage erfordern eine hohe 64-Bit-Gleitkommaleistung (FP64) mit doppelter Genauigkeit und eine hohe Speicherbandbreite. Empfohlene Maschinenserie:
Weitere Informationen finden Sie in der Dokumentation zu AI Hypercomputer unter Empfehlungen für HPC.
Überlegungen zu Arbeitslasten
GPUs sind in der Regel nicht für die folgenden Arbeitslasten geeignet:
- Sequenzielle und Single-Thread-Logik: Aufgaben, die von sequenziellen Entscheidungszweigen oder seriellen Ausführungspipelines dominiert werden, laufen auf CPUs mit hohen Single-Core-Taktfrequenzen besser.
- Standard-Webanwendungen und ‑Mikrodienste: Webserver für allgemeine Zwecke, relationale Datenbankverwaltungssysteme (RDBMS) und Standard-API-Back-Ends ohne KI- oder Grafikverarbeitungsanforderungen profitieren nicht von der GPU-Beschleunigung. Diese Arbeitslasten lassen sich kostengünstiger auf CPU-Instanzen für allgemeine Zwecke oder Computing-optimierte CPU-Instanzen hosten.
- Für XLA und graphkompilierte Frameworks optimierte Arbeitslasten: Wenn Ihre Deep-Learning-Modelle mit Frameworks wie JAX, PyTorch/XLA oder TensorFlow erstellt werden, können sie von compilergesteuerten Graphoptimierungen (XLA) profitieren. Wenn Ihre Modelle auch von benutzerdefinierten Matrix-Systolic-Arrays und optischer Schaltung profitieren, sollten Sie alternative Beschleunigerarchitekturen in Betracht ziehen, die für diese spezifischen Ausführungsparadigmen entwickelt wurden.
Kosten
Die GPU-Preise auf Google Cloudwerden durch die folgenden Faktoren bestimmt:
Das spezifische GPU-Modell.
Die Anzahl der angehängten GPUs.
Bereitgestellte Ressourcen wie vCPUs, Arbeitsspeicher und Speicher.
Das von Ihnen ausgewählte Nutzungsmodell.
In den folgenden Abschnitten werden die verfügbaren Nutzungsmodelle und Rabattoptionen für GPUs in Google Cloudbeschrieben.
Nutzungs- und Kaufmodelle
Sie können GPU-Instanzen mit verschiedenen Verbrauchsoptionen bereitstellen, je nach Verfügbarkeitsanforderungen und Kostentoleranz:
On-Demand: Die Abrechnung erfolgt nach dem Standard-PAYG-Modell (Pay-as-you-go) pro Sekunde ohne langfristige Verpflichtung. On-Demand-Instanzen bieten vollständige Flexibilität für den gesamten Lebenszyklus von Entwicklungs-, Test- und variablen Produktionsarbeitslasten.
Spot-VMs: stark ermäßigte Compute-Instanzen (bis zu 60–91% Rabatt auf On-Demand-Preise), die aus überschüssigerGoogle Cloud -Kapazität stammen. Da Google Cloud Spot-VMs mit einer Vorwarnung von 30 Sekunden beenden oder löschen kann, um Kapazität zurückzugewinnen, eignen sich diese Compute-Instanzen ideal für fehlertolerantes Batch-ML-Training, Batchjobs mit Prüfpunkten und verteilte Datenverarbeitung.
Flex-Start-VMs: Dynamische Planungsoption mit Dynamic Workload Scheduler (DWS), bei der GPU-Ressourcen innerhalb eines bestimmten Zeitraums für Arbeitslasten mit fester Dauer (bis zu 7 Tage) zu rabattierten Preisen bereitgestellt werden.
Reservierungen:
- Reservierungen: Sie können Kapazität für Standard-GPUs reservieren und die reservierte Kapazität sofort nutzen.
- Vorausschauende Reservierungen (Kalendermodus und AI Hypercomputer): Sie können die Reservierung von gruppierter GPU-Kapazität für ein zukünftiges Datum und eine zukünftige Uhrzeit anfordern. Wenn Google Cloud Ihre Anfrage genehmigt, können Sie die Kapazität zum angegebenen Zeitpunkt nutzen und haben bis zum Ende der Reservierung exklusiven Zugriff.
Rabattoptionen
Rabatte für zugesicherte Nutzung (Committed Use Discounts, CUDs): bieten erhebliche Rabatte (bis zu 55% für 3-Jahres-Zusicherungen oder 37% für 1-Jahres-Zusicherungen) im Gegenzug für die Zusicherung, ein kontinuierliches Niveau der Ressourcennutzung in einer bestimmten Region aufrechtzuerhalten. Für beschleunigungsoptimierte Maschinentypen und angehängte GPUs sind für Rabatte für zugesicherte Nutzung ressourcenbasierte Zusicherungen erforderlich, die an Reservierungen angehängt sind.
Rabatte für kontinuierliche Nutzung: automatische Rabatte, die auf N1-Compute-Instanzen und angehängte GPUs angewendet werden, wenn sie mehr als 25% eines Abrechnungsmonats ausgeführt werden. Beschleunigungsoptimierte Maschinenserien (A- und G-Serie) erhalten keine SUDs.
Ausführliche stündliche und monatliche Preise für alle Regionen finden Sie auf der Seite „GPU-Preise“ und der Seite „Preise für VM-Instanzen“.
Eine detaillierte Funktionsmatrix zur Verfügbarkeit von Verbrauchsoptionen für alle Beschleunigermaschinentyen finden Sie unter Verfügbarkeit von Verbrauchsoptionen nach Maschinentyp.
Nächste Schritte
- GPU-Maschinen in der beschleunigungsoptimierten Maschinenfamilie
- VM mit angehängten GPUs erstellen
- Weitere Informationen zur Supercomputing-KI-Architektur von Discover Google Cloudfinden Sie in der Übersicht zu AI Hypercomputer.