GPUs

Grafikprozessoren (GPUs) sind spezielle Hardwarebeschleuniger, die für die gleichzeitige Verarbeitung von extrem parallelisierten Arbeitslasten entwickelt wurden. AufGoogle Cloudkönnen Sie NVIDIA-GPUs an Compute Engine-Instanzen und Bare-Metal-Instanzen anhängen, um anspruchsvolle Arbeitslasten wie Training für künstliche Intelligenz (KI) und maschinelles Lernen (ML), Hochleistungs-Computing (HPC), Grafikrendering und Videotranscodierung zu beschleunigen.

Dieses Dokument bietet einen Überblick über GPUs in Google Cloud, einschließlich verfügbarer GPU-Modelle, Zuordnungen von Maschinenserien, Leistungsmerkmalen, idealen Anwendungsfällen und Preisüberlegungen.

Was ist eine GPU?

Eine GPU ist ein massiv paralleler Prozessor, der ursprünglich für Computergrafiken entwickelt wurde und sich zu einer wichtigen Rechenmaschine für KI, ML und wissenschaftliches Rechnen entwickelt hat. Im Gegensatz zu Central Processing Units (CPUs), die einige leistungsstarke Kerne enthalten, die für die sequenzielle, Single-Thread-Verarbeitung optimiert sind, bestehen GPUs aus Tausenden von kleineren, hocheffizienten Kernen, die darauf ausgelegt sind, mathematische Berechnungen gleichzeitig für große Datasets durchzuführen.

Die wichtigsten architektonischen Komponenten eines GPU-Systems sind:

  • CUDA-Kerne: Vektorverarbeitungseinheiten für allgemeine Zwecke, die Anweisungen in mehreren parallelen Threads gleichzeitig mithilfe einer SIMT-Architektur (Single Instruction, Multiple Threads) ausführen. CUDA-Kerne verarbeiten Standardvektor- und Gleitkommaberechnungen (z. B. FP32 und FP64) sowie allgemeines Grafikrendering und physikalische Simulationen.

  • Tensor Cores: Spezialisierte MMA-Verarbeitungseinheiten (Matrix Multiply-Accumulate), die für die Beschleunigung von Berechnungen für neuronale Netze entwickelt wurden. Tensor Cores bieten exponentielle Geschwindigkeitssteigerungen für KI-Training und ‑Inferenz in spezialisierten numerischen Präzisionsformaten wie FP4, FP8, INT8, TF32 und FP16/BF16.

  • Speicher mit hoher Bandbreite: Dedizierter On-Device-Speicher, der eine Bandbreite von bis zu mehreren Terabyte pro Sekunde (TBps) bietet, z. B. High Bandwidth Memory (HBM) oder Graphics Double Data Rate (GDDR). Durch diesen hohen Durchsatz werden Tausende von GPU-Kernen bei intensiven Matrixoperationen mit Daten versorgt.

  • Hochgeschwindigkeits-Interconnect-Verbindungen (NVLink und NVSwitch): Interconnect-Technologien mit hoher Bandbreite und niedriger Latenz, die mehrere GPUs auf demselben Server oder über Knoten hinweg verbinden. NVLink ermöglicht die direkte GPU-zu-GPU-Kommunikation, die den langsameren PCIe-Bus umgeht. So können GPU-Cluster als ein einziger, zusammenhängender Beschleunigerspeicherpool fungieren.

  • Software für virtuelle Workstations (NVIDIA RTX vWS): Unternehmenssoftware, die virtualisierte Grafikbeschleunigung für visuelle Remote-Workstations, computergestütztes Design (CAD), digitale Inhaltserstellung und 3D-Modellierung bietet.

GPU-Modelle und Maschinenserien

Google Cloud bietet NVIDIA-GPUs verschiedener Generationen an, um unterschiedlichen Arbeitslast- und Budgetanforderungen gerecht zu werden. In Compute Engine sind GPUs entweder als vorkonfigurierte beschleunigungsoptimierte Maschinenserien (A- und G-Serie) oder als anhängbare Beschleuniger in der N1-Maschinenserie für allgemeine Zwecke verfügbar.

In der folgenden Tabelle sind die Hardwarespezifikationen, die Zuordnungen von Maschinenserien, die Netzwerkbandbreite und die Speicherfunktionen der in Compute Engine verfügbaren GPU-Modelle zusammengefasst:

GPU-Modell Maschinenserie Architektur GPU-Arbeitsspeicher und ‑Bandbreite GPUs pro Compute-Instanz Maximale Netzwerkbandbreite Lokale SSD Interconnect Unterstützung für NVIDIA RTX Virtual Workstation (vWS)
NVIDIA GB300 A4X Max Blackwell Ultra 279 GB HBM3e (8 TB/s) 4 (NVL72) 3.600 Gbit/s 12.000 GiB NVLink Full Mesh (1.800 GB/s) Nein
NVIDIA GB200 A4X Blackwell 186 GB HBM3e (8 TBps) 4 (NVL72) 2.000 Gbit/s 12.000 GiB NVLink Full Mesh (1.800 GB/s) Nein
NVIDIA B200 A4 Blackwell 180 GB HBM3e (8 TBps) 8 3.600 Gbit/s 12.000 GiB NVLink Full Mesh (1.800 GB/s) Nein
NVIDIA H200 A3 Ultra Einfülltrichter 141 GB HBM3e (4,8 TB/s) 8 3.600 Gbit/s 12.000 GiB NVLink Full Mesh (900 GB/s) Nein
NVIDIA H100 A3 Mega, High, Edge Einfülltrichter 80 GB HBM3 (3,35 TBps) 1, 2, 4, 8 Bis zu 1.000 Gbit/s Bis zu 6.000 GiB NVLink Full Mesh (900 GB/s) Nein
NVIDIA A100 (80 GB) A2-Ultra Ampere 80 GB HBM2e (1,9 TBps) 1, 2, 4, 8 100 Gbit/s Bis zu 3.000 GiB NVLink Full Mesh (600 GB/s) Nein
NVIDIA A100 (40 GB) A2-Standard Ampere 40 GB HBM2 (1,6 TB/s) 1, 2, 4, 8, 16 100 Gbit/s Bis zu 3.000 GiB NVLink Full Mesh (600 GB/s) Nein
NVIDIA RTX Pro 6000 G4 Blackwell 96 GB GDDR7 (1.597 TB/s) 1/8, 1/4, 1/2, 1, 2, 4, 8 200 Gbit/s Bis zu 3.000 GiB PCIe Gen 5 Ja
NVIDIA L4 G2 Ada Lovelace 24 GB GDDR6 (300 GB/s) 1, 2, 4, 8 100 Gbit/s Bis zu 3.000 GiB PCIe Gen 4 Ja
NVIDIA T4
(Ende der Unterstützung steht bevor)
N1+T4 Turing 16 GB GDDR6 (320 GB/s) 1, 2, 4 100 Gbit/s Unterstützt PCIe Gen 3 Ja
NVIDIA V100 N1+V100 Volta 16 GB HBM2 (900 GB/s) 1, 2, 4, 8 100 Gbit/s Unterstützt NVLink Ring (300 GB/s) Nein
NVIDIA P100
(Ende der Unterstützung steht bevor)
N1+P100 Pascal 16 GB HBM2 (732 GB/s) 1, 2, 4 100 Gbit/s Unterstützt PCIe Gen 3 Ja
NVIDIA P4
(Ende der Unterstützung steht bevor)
N1+P4 Pascal 8 GB GDDR5 (192 GB/s) 1, 2, 4 100 Gbit/s Unterstützt PCIe Gen 3 Ja

GPU-Leistungsmerkmale

Die Wahl des richtigen GPU-Modells hängt von den Rechenmerkmalen, den Speicheranforderungen, den Präzisionsformaten und den Skalierbarkeitsanforderungen Ihrer Arbeitslast ab.

Ideale Anwendungsfälle und Arbeitslastanforderungen

GPUs beschleunigen verschiedene Rechenarbeitslasten in den Bereichen KI, visuelles Computing und wissenschaftliche Modellierung. Wenn Sie mehr über die architektonischen Anforderungen für die einzelnen Arbeitslastkategorien erfahren möchten, wählen Sie einen der folgenden Tabs aus:

KI-/ML-Training

KI/ML-Inferenz

  • Inferenz großer Modelle (mehr als 70 Milliarden Parameter): Das Bereitstellen von riesigen Large Language Models (LLMs) profitiert von der hohen Kapazität des High Bandwidth Memory (HBM3e) (141–186 GB pro GPU), um Modellgewichte auf weniger GPUs zu verteilen und so den Kommunikationsaufwand zwischen den Chips zu reduzieren. Empfohlene Maschinenreihe:

  • Hoher Durchsatz und Echtzeitbereitstellung: Interaktive Anfragen mit geringer Latenz, Streamingantworten und Bildgenerierung verwenden hardwarebeschleunigte quantisierte numerische Formate wie 8-Bit-Gleitkomma (FP8), 8-Bit-Ganzzahl (INT8) und 4-Bit-Ganzzahl (INT4), um den Anfragedurchsatz pro Dollar zu maximieren. Empfohlene Maschinenserie:

    Weitere Informationen finden Sie in der AI Hypercomputer-Dokumentation unter Empfehlungen für die Bereitstellung von Inferenz.

Grafik und visuelles Computing

HPC und Simulation

Überlegungen zu Arbeitslasten

GPUs sind in der Regel nicht für die folgenden Arbeitslasten geeignet:

  • Sequenzielle und Single-Thread-Logik: Aufgaben, die von sequenziellen Entscheidungszweigen oder seriellen Ausführungspipelines dominiert werden, laufen auf CPUs mit hohen Single-Core-Taktfrequenzen besser.
  • Standard-Webanwendungen und ‑Mikrodienste: Webserver für allgemeine Zwecke, relationale Datenbankverwaltungssysteme (RDBMS) und Standard-API-Back-Ends ohne KI- oder Grafikverarbeitungsanforderungen profitieren nicht von der GPU-Beschleunigung. Diese Arbeitslasten lassen sich kostengünstiger auf CPU-Instanzen für allgemeine Zwecke oder Computing-optimierte CPU-Instanzen hosten.
  • Für XLA und graphkompilierte Frameworks optimierte Arbeitslasten: Wenn Ihre Deep-Learning-Modelle mit Frameworks wie JAX, PyTorch/XLA oder TensorFlow erstellt werden, können sie von compilergesteuerten Graphoptimierungen (XLA) profitieren. Wenn Ihre Modelle auch von benutzerdefinierten Matrix-Systolic-Arrays und optischer Schaltung profitieren, sollten Sie alternative Beschleunigerarchitekturen in Betracht ziehen, die für diese spezifischen Ausführungsparadigmen entwickelt wurden.

Kosten

Die GPU-Preise auf Google Cloudwerden durch die folgenden Faktoren bestimmt:

  • Das spezifische GPU-Modell.

  • Die Anzahl der angehängten GPUs.

  • Bereitgestellte Ressourcen wie vCPUs, Arbeitsspeicher und Speicher.

  • Das von Ihnen ausgewählte Nutzungsmodell.

In den folgenden Abschnitten werden die verfügbaren Nutzungsmodelle und Rabattoptionen für GPUs in Google Cloudbeschrieben.

Nutzungs- und Kaufmodelle

Sie können GPU-Instanzen mit verschiedenen Verbrauchsoptionen bereitstellen, je nach Verfügbarkeitsanforderungen und Kostentoleranz:

  • On-Demand: Die Abrechnung erfolgt nach dem Standard-PAYG-Modell (Pay-as-you-go) pro Sekunde ohne langfristige Verpflichtung. On-Demand-Instanzen bieten vollständige Flexibilität für den gesamten Lebenszyklus von Entwicklungs-, Test- und variablen Produktionsarbeitslasten.

  • Spot-VMs: stark ermäßigte Compute-Instanzen (bis zu 60–91% Rabatt auf On-Demand-Preise), die aus überschüssigerGoogle Cloud -Kapazität stammen. Da Google Cloud Spot-VMs mit einer Vorwarnung von 30 Sekunden beenden oder löschen kann, um Kapazität zurückzugewinnen, eignen sich diese Compute-Instanzen ideal für fehlertolerantes Batch-ML-Training, Batchjobs mit Prüfpunkten und verteilte Datenverarbeitung.

  • Flex-Start-VMs: Dynamische Planungsoption mit Dynamic Workload Scheduler (DWS), bei der GPU-Ressourcen innerhalb eines bestimmten Zeitraums für Arbeitslasten mit fester Dauer (bis zu 7 Tage) zu rabattierten Preisen bereitgestellt werden.

  • Reservierungen:

    • Reservierungen: Sie können Kapazität für Standard-GPUs reservieren und die reservierte Kapazität sofort nutzen.
    • Vorausschauende Reservierungen (Kalendermodus und AI Hypercomputer): Sie können die Reservierung von gruppierter GPU-Kapazität für ein zukünftiges Datum und eine zukünftige Uhrzeit anfordern. Wenn Google Cloud Ihre Anfrage genehmigt, können Sie die Kapazität zum angegebenen Zeitpunkt nutzen und haben bis zum Ende der Reservierung exklusiven Zugriff.

Rabattoptionen

Ausführliche stündliche und monatliche Preise für alle Regionen finden Sie auf der Seite „GPU-Preise“ und der Seite „Preise für VM-Instanzen“.

Eine detaillierte Funktionsmatrix zur Verfügbarkeit von Verbrauchsoptionen für alle Beschleunigermaschinentyen finden Sie unter Verfügbarkeit von Verbrauchsoptionen nach Maschinentyp.

Nächste Schritte