Cluster-GPUs sind für Arbeitslasten im Bereich künstliche Intelligenz (KI) und maschinelles Lernen (ML) optimiert, bei denen verteiltes Training im großen Maßstab, Multi-Host-Inferenz und komplexe Hochleistungs-Computing-Aufgaben (HPC) im Vordergrund stehen.
Mit Cluster-GPUs können Teams Tausende von miteinander verbundenen Beschleunigern als ein einziges, eng gekoppeltes System bereitstellen und skalieren. Dazu werden spezielle Netzwerkstrukturen und synchronisierte Wartung verwendet. Sie sind ideal für Arbeitslasten, die extreme Rechenleistung, Arbeitsspeicher und eine schnelle Netzwerksynchronisierung erfordern. Zu den häufigen Anwendungsfällen gehören das Vortraining von Foundation Models mit Billionen von Parametern, die Bereitstellung von Frontier Models und Simulationen für die Arzneimittelforschung.
Wichtige Merkmale von Cluster-GPUs
- Synchronisierte Wartung: Google Cloud Aktualisiert alle Knoten im Cluster gleichzeitig, sodass ein Neustart eines einzelnen Knotens einen Job nicht zum Stillstand bringt.
- Automatisiertes Zustandsmonitoring: Das System erkennt proaktiv Nachzügler und überwacht Hardwarefehler oder stille Datenbeschädigungen.
- Proaktiver Knotenaustausch: Das System entfernt VMs mit schlechter Leistung und plant sie auf fehlerfreien Maschinen aus einem Ersatzpool neu.
- Rail-Topologie: Eine Rail-Topologie isoliert den GPU-zu-GPU Traffic von der Standard-Hostkommunikation, um eine jitterfreie Leistung für die massive Multi-Knoten-Koordination zu gewährleisten.
- Erweiterte Protokolle: Diese Maschinenserien unterstützen Verbindungen mit hoher Bandbreite, einschließlich GPUDirect RDMA (basierend auf RoCE).
Cluster-GPU-Familien und technische Spezifikationen
In diesen Tabellen finden Sie die Arbeitslasten und Hardwarespezifikationen für die Premium-Maschinenserien mit Cluster-GPUs. Für das Exascale-Training verwenden Sie die Serien A4X oder A3 Ultra.
A4X Max und A4X-Serie
Wenn Sie massive Exascale-Foundation Models trainieren oder hochkomplexe Bare-Metal-Hochleistungs-Computing-Simulationen ausführen, verwenden Sie die Maschinenserien A4X Max oder A4X. Diese Serien sind mit NVIDIA GB300 Grace Blackwell Ultra-Superchips ausgestattet, um extreme Rechen- und Arbeitsspeicheranforderungen zu erfüllen.
A4X Max (Bare Metal)
A4X Max
Maschinentypen verwenden NVIDIA GB300 Grace Blackwell Ultra-Superchips (nvidia-gb300) und
sind ideal für das Training und die Bereitstellung von Foundation Models. A4X Max-Maschinentypen sind als Bare-Metal-Instanzen verfügbar.
A4X Max ist eine Exascale-Plattform, die auf NVIDIA GB300 NVL72 basiert. Jede Maschine hat zwei Sockel mit NVIDIA Grace-CPUs mit Arm Neoverse V2-Kernen. Diese CPUs sind mit vier NVIDIA B300 Blackwell-GPUs mit schneller Chip-zu-Chip (NVLink-C2C) Kommunikation verbunden.
| Angehängte NVIDIA GB300 Grace Blackwell Ultra-Superchips | |||||||
|---|---|---|---|---|---|---|---|
| Maschinentyp | vCPU-Anzahl1 | Instanzarbeitsspeicher (GB) | Verbundene lokale SSD (GiB) | Anzahl der physischen Netzwerkkarten | Maximale Netzwerkbandbreite (Gbit/s)2 | GPU-Anzahl | GPU-Arbeitsspeicher3 (GB HBM3e) |
a4x-maxgpu-4g-metal |
144 | 960 | 12.000 | 6 | 3.600 | 4 | 1.116 |
1 Eine vCPU ist als einzelner Hardware-Hyper-Thread auf einer der
verfügbaren CPU-Plattformen implementiert.
2 Die maximale Bandbreite für ausgehenden Traffic darf die angegebene Zahl nicht überschreiten. Die tatsächliche Bandbreite für ausgehenden Traffic hängt von der Ziel-IP-Adresse und anderen Faktoren ab.
Weitere Informationen zur Netzwerkbandbreite finden Sie unter Netzwerkbandbreite.
3 Der GPU-Arbeitsspeicher ist der Speicher auf einem GPU-Gerät, der zum
temporären Speichern von Daten verwendet werden kann. Er ist vom Arbeitsspeicher der Instanz getrennt und wurde speziell für die höheren Bandbreitenanforderungen grafikintensiver Arbeitslasten entwickelt.
A4X
A4X
Maschinentypen verwenden NVIDIA GB200 Grace Blackwell-Superchips (nvidia-gb200) und
sind ideal für das Training und die Bereitstellung von Foundation Models.
A4X ist eine Exascale-Plattform, die auf NVIDIA GB200 NVL72 basiert. Jede Maschine hat zwei Sockel mit NVIDIA Grace-CPUs mit Arm Neoverse V2-Kernen. Diese CPUs sind mit vier NVIDIA B200 Blackwell-GPUs mit schneller Chip-zu-Chip (NVLink-C2C) Kommunikation verbunden.
| Angehängte NVIDIA GB200 Grace Blackwell-Superchips | |||||||
|---|---|---|---|---|---|---|---|
| Maschinentyp | vCPU-Anzahl1 | Instanzarbeitsspeicher (GB) | Verbundene lokale SSD (GiB) | Anzahl der physischen Netzwerkkarten | Maximale Netzwerkbandbreite (Gbit/s)2 | GPU-Anzahl | GPU-Arbeitsspeicher3 (GB HBM3e) |
a4x-highgpu-4g |
140 | 884 | 12.000 | 6 | 2.000 | 4 | 744 |
1 Eine vCPU ist als einzelner Hardware-Hyper-Thread auf einer der
verfügbaren CPU-Plattformen implementiert.
2 Die maximale Bandbreite für ausgehenden Traffic darf die angegebene Zahl nicht überschreiten. Die tatsächliche Bandbreite für ausgehenden Traffic hängt von der Ziel-IP-Adresse und anderen Faktoren ab.
Weitere Informationen zur Netzwerkbandbreite finden Sie unter Netzwerkbandbreite.
3 Der GPU-Arbeitsspeicher ist der Speicher auf einem GPU-Gerät, der zum
temporären Speichern von Daten verwendet werden kann. Er ist vom Arbeitsspeicher der Instanz getrennt und wurde speziell für die höheren Bandbreitenanforderungen grafikintensiver Arbeitslasten entwickelt.
A4-Serie
Wenn Sie hochmoderne Foundation Models trainieren möchten, die eine massive parallele Verarbeitung erfordern, verwenden Sie die A4-Maschinenserie, um die Verarbeitungszeit zu optimieren und den Hardware-Durchsatz zu maximieren.
A4
Maschinentypen haben
NVIDIA B200 Blackwell-GPUs
(nvidia-b200) angehängt und sind ideal für das Training und die Bereitstellung von Foundation Models.
| Angehängte NVIDIA B200 Blackwell-GPUs | |||||||
|---|---|---|---|---|---|---|---|
| Maschinentyp | vCPU-Anzahl1 | Instanzarbeitsspeicher (GB) | Verbundene lokale SSD (GiB) | Anzahl der physischen Netzwerkkarten | Maximale Netzwerkbandbreite (Gbit/s)2 | GPU-Anzahl | GPU-Arbeitsspeicher3 (GB HBM3e) |
a4-highgpu-8g |
224 | 3.968 | 12.000 | 10 | 3.600 | 8 | 1.440 |
1 Eine vCPU ist als einzelner Hardware-Hyper-Thread auf einer der
verfügbaren CPU-Plattformen implementiert.
2 Die maximale Bandbreite für ausgehenden Traffic darf die angegebene Zahl nicht überschreiten. Die tatsächliche Bandbreite für ausgehenden Traffic hängt von der Ziel-IP-Adresse und anderen Faktoren ab.
Weitere Informationen zur Netzwerkbandbreite finden Sie unter
Netzwerkbandbreite.
3 Der GPU-Arbeitsspeicher ist der Speicher auf einem GPU-Gerät, der zum
temporären Speichern von Daten verwendet werden kann. Er ist vom Arbeitsspeicher der Instanz getrennt und wurde speziell für die höheren Bandbreitenanforderungen grafikintensiver Arbeitslasten entwickelt.
A3-Serie (Ultra, Mega und High mit 8 GPUs)
Wenn Sie verteilte Trainingsläufe im großen Maßstab ausführen oder Frontier Models auf mehreren Hosts mit großen Datensatztabellen bereitstellen müssen, verwenden Sie die A3-Maschinenserie, um die Netzwerklatenz zwischen Hosts zu minimieren.
A3 Ultra
| Angehängte NVIDIA H200-GPUs | |||||||
|---|---|---|---|---|---|---|---|
| Maschinentyp | vCPU-Anzahl1 | Instanzarbeitsspeicher (GB) | Verbundene lokale SSD (GiB) | Anzahl der physischen Netzwerkkarten | Maximale Netzwerkbandbreite (Gbit/s)2 | GPU-Anzahl | GPU-Arbeitsspeicher3 (GB HBM3e) |
a3-ultragpu-8g |
224 | 2.952 | 12.000 | 10 | 3.600 | 8 | 1128 |
A3 Mega
| Angehängte NVIDIA H100-GPUs | |||||||
|---|---|---|---|---|---|---|---|
| Maschinentyp | vCPU-Anzahl1 | Instanzarbeitsspeicher (GB) | Verbundene lokale SSD (GiB) | Anzahl der physischen Netzwerkkarten | Maximale Netzwerkbandbreite (Gbit/s)2 | GPU-Anzahl | GPU-Arbeitsspeicher3 (GB HBM3) |
a3-megagpu-8g |
208 | 1.872 | 6.000 | 9 | 1.800 | 8 | 640 |
A3 High
| Angehängte NVIDIA H100-GPUs | |||||||
|---|---|---|---|---|---|---|---|
| Maschinentyp | vCPU-Anzahl1 | Instanzarbeitsspeicher (GB) | Verbundene lokale SSD (GiB) | Anzahl der physischen Netzwerkkarten | Maximale Netzwerkbandbreite (Gbit/s)2 | GPU-Anzahl | GPU-Arbeitsspeicher3 (GB HBM3) |
a3-highgpu-1g |
26 | 234 | 750 | 1 | 25 | 1 | 80 |
a3-highgpu-2g |
52 | 468 | 1.500 | 1 | 50 | 2 | 160 |
a3-highgpu-4g |
104 | 936 | 3.000 | 1 | 100 | 4 | 320 |
a3-highgpu-8g |
208 | 1.872 | 6.000 | 5 | 1.000 | 8 | 640 |
1 Eine vCPU ist als einzelner Hardware-Hyper-Thread auf einer der
verfügbaren CPU-Plattformen implementiert.
2 Die maximale Bandbreite für ausgehenden Traffic darf die angegebene Zahl nicht überschreiten. Die tatsächliche Bandbreite für ausgehenden Traffic hängt von der Ziel-IP-Adresse und anderen Faktoren ab.
Weitere Informationen zur Netzwerkbandbreite finden Sie unter Netzwerkbandbreite.
3 Der GPU-Arbeitsspeicher ist der Speicher auf einem GPU-Gerät, der zum
temporären Speichern von Daten verwendet werden kann. Er ist vom Arbeitsspeicher der Instanz getrennt und wurde speziell für die höheren Bandbreitenanforderungen grafikintensiver Arbeitslasten entwickelt.
Kapazität erwerben
Für den Erwerb von Rechenkapazität für Cluster-GPUs ist eine Koordination erforderlich, um Angebot und Nachfrage nach Hochleistungsbeschleunigern zu verwalten. Da sich diese Ressourcen physisch in speziellen Netzwerkstrukturen befinden, müssen Sie sie über verwaltete Workflows anfordern.
Sie können Kapazität über Ihr Account-Management-Team reservieren oder vorausschauende Reservierungen und Dynamic Workload Scheduler verwenden.
Nächste Schritte
- Informationen zum Erwerb von Kapazität finden Sie unter Verbrauchsoptionen.
- Informationen zum Bewerten Ihrer Infrastrukturanforderungen finden Sie unter Infrastruktur auswählen.
- Informationen zum Planen Ihrer Netzwerktopologie finden Sie unter GPU-Netzwerkanforderungen für Clusterumgebungen.
- Informationen zum Reservieren von Rechenressourcen finden Sie unter Kapazität reservieren.