Übersicht über geclusterte GPUs

Cluster-GPUs sind für Arbeitslasten im Bereich künstliche Intelligenz (KI) und maschinelles Lernen (ML) optimiert, bei denen verteiltes Training im großen Maßstab, Multi-Host-Inferenz und komplexe Hochleistungs-Computing-Aufgaben (HPC) im Vordergrund stehen.

Mit Cluster-GPUs können Teams Tausende von miteinander verbundenen Beschleunigern als ein einziges, eng gekoppeltes System bereitstellen und skalieren. Dazu werden spezielle Netzwerkstrukturen und synchronisierte Wartung verwendet. Sie sind ideal für Arbeitslasten, die extreme Rechenleistung, Arbeitsspeicher und eine schnelle Netzwerksynchronisierung erfordern. Zu den häufigen Anwendungsfällen gehören das Vortraining von Foundation Models mit Billionen von Parametern, die Bereitstellung von Frontier Models und Simulationen für die Arzneimittelforschung.

Wichtige Merkmale von Cluster-GPUs

  • Synchronisierte Wartung: Google Cloud Aktualisiert alle Knoten im Cluster gleichzeitig, sodass ein Neustart eines einzelnen Knotens einen Job nicht zum Stillstand bringt.
  • Automatisiertes Zustandsmonitoring: Das System erkennt proaktiv Nachzügler und überwacht Hardwarefehler oder stille Datenbeschädigungen.
  • Proaktiver Knotenaustausch: Das System entfernt VMs mit schlechter Leistung und plant sie auf fehlerfreien Maschinen aus einem Ersatzpool neu.
  • Rail-Topologie: Eine Rail-Topologie isoliert den GPU-zu-GPU Traffic von der Standard-Hostkommunikation, um eine jitterfreie Leistung für die massive Multi-Knoten-Koordination zu gewährleisten.
  • Erweiterte Protokolle: Diese Maschinenserien unterstützen Verbindungen mit hoher Bandbreite, einschließlich GPUDirect RDMA (basierend auf RoCE).

Cluster-GPU-Familien und technische Spezifikationen

In diesen Tabellen finden Sie die Arbeitslasten und Hardwarespezifikationen für die Premium-Maschinenserien mit Cluster-GPUs. Für das Exascale-Training verwenden Sie die Serien A4X oder A3 Ultra.

A4X Max und A4X-Serie

Wenn Sie massive Exascale-Foundation Models trainieren oder hochkomplexe Bare-Metal-Hochleistungs-Computing-Simulationen ausführen, verwenden Sie die Maschinenserien A4X Max oder A4X. Diese Serien sind mit NVIDIA GB300 Grace Blackwell Ultra-Superchips ausgestattet, um extreme Rechen- und Arbeitsspeicheranforderungen zu erfüllen.

A4X Max (Bare Metal)

A4X Max Maschinentypen verwenden NVIDIA GB300 Grace Blackwell Ultra-Superchips (nvidia-gb300) und sind ideal für das Training und die Bereitstellung von Foundation Models. A4X Max-Maschinentypen sind als Bare-Metal-Instanzen verfügbar.

A4X Max ist eine Exascale-Plattform, die auf NVIDIA GB300 NVL72 basiert. Jede Maschine hat zwei Sockel mit NVIDIA Grace-CPUs mit Arm Neoverse V2-Kernen. Diese CPUs sind mit vier NVIDIA B300 Blackwell-GPUs mit schneller Chip-zu-Chip (NVLink-C2C) Kommunikation verbunden.

Angehängte NVIDIA GB300 Grace Blackwell Ultra-Superchips
Maschinentyp vCPU-Anzahl1 Instanzarbeitsspeicher (GB) Verbundene lokale SSD (GiB) Anzahl der physischen Netzwerkkarten Maximale Netzwerkbandbreite (Gbit/s)2 GPU-Anzahl GPU-Arbeitsspeicher3
(GB HBM3e)
a4x-maxgpu-4g-metal 144 960 12.000 6 3.600 4 1.116

1 Eine vCPU ist als einzelner Hardware-Hyper-Thread auf einer der verfügbaren CPU-Plattformen implementiert.
2 Die maximale Bandbreite für ausgehenden Traffic darf die angegebene Zahl nicht überschreiten. Die tatsächliche Bandbreite für ausgehenden Traffic hängt von der Ziel-IP-Adresse und anderen Faktoren ab. Weitere Informationen zur Netzwerkbandbreite finden Sie unter Netzwerkbandbreite.
3 Der GPU-Arbeitsspeicher ist der Speicher auf einem GPU-Gerät, der zum temporären Speichern von Daten verwendet werden kann. Er ist vom Arbeitsspeicher der Instanz getrennt und wurde speziell für die höheren Bandbreitenanforderungen grafikintensiver Arbeitslasten entwickelt.

A4X

A4X Maschinentypen verwenden NVIDIA GB200 Grace Blackwell-Superchips (nvidia-gb200) und sind ideal für das Training und die Bereitstellung von Foundation Models.

A4X ist eine Exascale-Plattform, die auf NVIDIA GB200 NVL72 basiert. Jede Maschine hat zwei Sockel mit NVIDIA Grace-CPUs mit Arm Neoverse V2-Kernen. Diese CPUs sind mit vier NVIDIA B200 Blackwell-GPUs mit schneller Chip-zu-Chip (NVLink-C2C) Kommunikation verbunden.

Angehängte NVIDIA GB200 Grace Blackwell-Superchips
Maschinentyp vCPU-Anzahl1 Instanzarbeitsspeicher (GB) Verbundene lokale SSD (GiB) Anzahl der physischen Netzwerkkarten Maximale Netzwerkbandbreite (Gbit/s)2 GPU-Anzahl GPU-Arbeitsspeicher3
(GB HBM3e)
a4x-highgpu-4g 140 884 12.000 6 2.000 4 744

1 Eine vCPU ist als einzelner Hardware-Hyper-Thread auf einer der verfügbaren CPU-Plattformen implementiert.
2 Die maximale Bandbreite für ausgehenden Traffic darf die angegebene Zahl nicht überschreiten. Die tatsächliche Bandbreite für ausgehenden Traffic hängt von der Ziel-IP-Adresse und anderen Faktoren ab. Weitere Informationen zur Netzwerkbandbreite finden Sie unter Netzwerkbandbreite.
3 Der GPU-Arbeitsspeicher ist der Speicher auf einem GPU-Gerät, der zum temporären Speichern von Daten verwendet werden kann. Er ist vom Arbeitsspeicher der Instanz getrennt und wurde speziell für die höheren Bandbreitenanforderungen grafikintensiver Arbeitslasten entwickelt.

A4-Serie

Wenn Sie hochmoderne Foundation Models trainieren möchten, die eine massive parallele Verarbeitung erfordern, verwenden Sie die A4-Maschinenserie, um die Verarbeitungszeit zu optimieren und den Hardware-Durchsatz zu maximieren.

A4 Maschinentypen haben NVIDIA B200 Blackwell-GPUs (nvidia-b200) angehängt und sind ideal für das Training und die Bereitstellung von Foundation Models.

Angehängte NVIDIA B200 Blackwell-GPUs
Maschinentyp vCPU-Anzahl1 Instanzarbeitsspeicher (GB) Verbundene lokale SSD (GiB) Anzahl der physischen Netzwerkkarten Maximale Netzwerkbandbreite (Gbit/s)2 GPU-Anzahl GPU-Arbeitsspeicher3
(GB HBM3e)
a4-highgpu-8g 224 3.968 12.000 10 3.600 8 1.440

1 Eine vCPU ist als einzelner Hardware-Hyper-Thread auf einer der verfügbaren CPU-Plattformen implementiert.
2 Die maximale Bandbreite für ausgehenden Traffic darf die angegebene Zahl nicht überschreiten. Die tatsächliche Bandbreite für ausgehenden Traffic hängt von der Ziel-IP-Adresse und anderen Faktoren ab. Weitere Informationen zur Netzwerkbandbreite finden Sie unter Netzwerkbandbreite.
3 Der GPU-Arbeitsspeicher ist der Speicher auf einem GPU-Gerät, der zum temporären Speichern von Daten verwendet werden kann. Er ist vom Arbeitsspeicher der Instanz getrennt und wurde speziell für die höheren Bandbreitenanforderungen grafikintensiver Arbeitslasten entwickelt.

A3-Serie (Ultra, Mega und High mit 8 GPUs)

Wenn Sie verteilte Trainingsläufe im großen Maßstab ausführen oder Frontier Models auf mehreren Hosts mit großen Datensatztabellen bereitstellen müssen, verwenden Sie die A3-Maschinenserie, um die Netzwerklatenz zwischen Hosts zu minimieren.

A3 Ultra

Angehängte NVIDIA H200-GPUs
Maschinentyp vCPU-Anzahl1 Instanzarbeitsspeicher (GB) Verbundene lokale SSD (GiB) Anzahl der physischen Netzwerkkarten Maximale Netzwerkbandbreite (Gbit/s)2 GPU-Anzahl GPU-Arbeitsspeicher3
(GB HBM3e)
a3-ultragpu-8g 224 2.952 12.000 10 3.600 8 1128

A3 Mega

Angehängte NVIDIA H100-GPUs
Maschinentyp vCPU-Anzahl1 Instanzarbeitsspeicher (GB) Verbundene lokale SSD (GiB) Anzahl der physischen Netzwerkkarten Maximale Netzwerkbandbreite (Gbit/s)2 GPU-Anzahl GPU-Arbeitsspeicher3
(GB HBM3)
a3-megagpu-8g 208 1.872 6.000 9 1.800 8 640

A3 High

Angehängte NVIDIA H100-GPUs
Maschinentyp vCPU-Anzahl1 Instanzarbeitsspeicher (GB) Verbundene lokale SSD (GiB) Anzahl der physischen Netzwerkkarten Maximale Netzwerkbandbreite (Gbit/s)2 GPU-Anzahl GPU-Arbeitsspeicher3
(GB HBM3)
a3-highgpu-1g 26 234 750 1 25 1 80
a3-highgpu-2g 52 468 1.500 1 50 2 160
a3-highgpu-4g 104 936 3.000 1 100 4 320
a3-highgpu-8g 208 1.872 6.000 5 1.000 8 640

1 Eine vCPU ist als einzelner Hardware-Hyper-Thread auf einer der verfügbaren CPU-Plattformen implementiert.
2 Die maximale Bandbreite für ausgehenden Traffic darf die angegebene Zahl nicht überschreiten. Die tatsächliche Bandbreite für ausgehenden Traffic hängt von der Ziel-IP-Adresse und anderen Faktoren ab. Weitere Informationen zur Netzwerkbandbreite finden Sie unter Netzwerkbandbreite.
3 Der GPU-Arbeitsspeicher ist der Speicher auf einem GPU-Gerät, der zum temporären Speichern von Daten verwendet werden kann. Er ist vom Arbeitsspeicher der Instanz getrennt und wurde speziell für die höheren Bandbreitenanforderungen grafikintensiver Arbeitslasten entwickelt.

Kapazität erwerben

Für den Erwerb von Rechenkapazität für Cluster-GPUs ist eine Koordination erforderlich, um Angebot und Nachfrage nach Hochleistungsbeschleunigern zu verwalten. Da sich diese Ressourcen physisch in speziellen Netzwerkstrukturen befinden, müssen Sie sie über verwaltete Workflows anfordern.

Sie können Kapazität über Ihr Account-Management-Team reservieren oder vorausschauende Reservierungen und Dynamic Workload Scheduler verwenden.

Nächste Schritte