Allgemeine GPUs sind für Arbeitslasten im Bereich künstliche Intelligenz (KI) und maschinelles Lernen (ML) optimiert, bei denen betriebliche Flexibilität, Ressourcenunabhängigkeit und Kosteneffizienz im Vordergrund stehen.
Mit General-Purpose-GPUs können Teams NVIDIA-Beschleuniger mit vollständiger betrieblicher Autonomie bereitstellen und skalieren. So wird die architektonische Komplexität koordinierter Supercomputing-Cluster umgangen. Sie eignen sich ideal für Arbeitslasten, bei denen Hochverfügbarkeit, Self-Service-Bereitstellung und unabhängige Skalierung im Vordergrund stehen. Häufige Anwendungsfälle sind Echtzeit-Inferenz, RAG, Prototyping und das Training kleiner bis mittelgroßer Modelle.
Wichtige Merkmale von General-Purpose-GPUs
- Betriebliche Flexibilität: Sie können Ressourcen mit Standard-GKE-Schnittstellen (Autopilot und Standard) und Compute Engine-Schnittstellen verwalten, um die Bereitstellung und Skalierung zu vereinfachen.
- Hochverfügbarkeit: Google Cloud Einzelne Instanzen werden unabhängig voneinander aktualisiert. So wird sichergestellt, dass sich Updates auf einem Knoten nicht auf die Verfügbarkeit anderer Knoten auswirken. Ihr Load Balancer kann Traffic umleiten, ohne dass die Bereitstellung von Flotten unterbrochen wird.
- Einfache Vernetzung: Ihre Arbeitslasten verwenden standardmäßige VPC-Dienste (Virtual Private Cloud) und standardmäßiges TCP/IP über gVNIC-Schnittstellen (Google Virtual NIC), um komplexe Fabrics auf Hardwareebene zu vermeiden.
- Kostenoptimierung: Sie können Spot-VMs für fehlertolerante Forschung verwenden und so im Vergleich zu Standard-On-Demand-Preisen bis zu 90% Kosten sparen.
- Self-Service-Erwerb: Sie können Kapazität direkt über Standardreservierungen und On-Demand-Anfragen erwerben, ohne dass von Ihrem Kontoteam verwaltete Workflows erforderlich sind.
Allgemeine GPU-Familien und technische Spezifikationen
Sehen Sie sich die Arbeitslasten und Hardwarespezifikationen für die Maschinenserie „Allgemeine GPU“ an. Für die Bereitstellung mit hohem Durchsatz sollten Sie die A3 Edge-Serie verwenden.
A3-Serie (High mit 1, 2 oder 4 GPUs und Edge)
A3 High (1, 2 oder 4 GPUs)
Wenn Sie Inferenz- oder Standardtrainingsarbeitslasten ausführen, die eine hohe Leistung erfordern, aber keinen synchronisierten Cluster mit 8 GPUs benötigen, verwenden Sie die A3 High-Maschinenserie mit 1, 2 oder 4 angeschlossenen GPUs.
A3 High-Maschinentypen haben NVIDIA H100 SXM-GPUs und eignen sich sowohl für die Inferenz großer Modelle als auch für die Feinabstimmung von Modellen.
| Angehängte NVIDIA H100-GPUs | |||||||
|---|---|---|---|---|---|---|---|
| Maschinentyp | vCPU-Anzahl1 | Instanzarbeitsspeicher (GB) | Verbundene lokale SSD (GiB) | Anzahl der physischen NICs | Maximale Netzwerkbandbreite (Gbit/s)2 | GPU-Anzahl | GPU-Arbeitsspeicher3 (GB HBM3) |
a3-highgpu-1g |
26 | 234 | 750 | 1 | 25 | 1 | 80 |
a3-highgpu-2g |
52 | 468 | 1.500 | 1 | 50 | 2 | 160 |
a3-highgpu-4g |
104 | 936 | 3.000 | 1 | 100 | 4 | 320 |
a3-highgpu-8g |
208 | 1.872 | 6.000 | 5 | 1.000 | 8 | 640 |
1 Eine vCPU ist als einzelner Hardware-Hyper-Thread auf einer der verfügbaren CPU-Plattformen implementiert.
2 Die maximale Bandbreite für ausgehenden Traffic darf die angegebene Zahl nicht überschreiten. Die tatsächliche Bandbreite für ausgehenden Traffic hängt von der Ziel-IP-Adresse und anderen Faktoren ab.
Weitere Informationen zur Netzwerkbandbreite finden Sie unter Netzwerkbandbreite.
3 GPU-Arbeitsspeicher ist der Speicher auf einem GPU-Gerät, der zum temporären Speichern von Daten verwendet werden kann. Es ist vom Arbeitsspeicher der Instanz getrennt und wurde speziell für die höheren Bandbreitenanforderungen grafikintensiver Arbeitslasten entwickelt.
A3 Edge
Wenn Sie verteilte Inferenz-Arbeitslasten mit hohem Durchsatz auf mehreren Hosts ohne koordiniertes Cluster-Fabric ausführen, können Sie die A3 Edge-Serie verwenden, um die Bereitstellung über standardmäßige virtuelle private Netzwerke zu vereinfachen.
A3 Edge-Maschinentypen haben NVIDIA H100 SXM-GPUs und sind speziell für die Bereitstellung konzipiert. Sie sind in einer begrenzten Anzahl von Regionen verfügbar.
| Angehängte NVIDIA H100-GPUs | |||||||
|---|---|---|---|---|---|---|---|
| Maschinentyp | vCPU-Anzahl1 | Instanzarbeitsspeicher (GB) | Verbundene lokale SSD (GiB) | Anzahl der physischen NICs | Maximale Netzwerkbandbreite (Gbit/s)2 | GPU-Anzahl | GPU-Arbeitsspeicher3 (GB HBM3) |
a3-edgegpu-8g |
208 | 1.872 | 6.000 | 5 |
|
8 | 640 |
A2-Serie (Standard und Ultra)
Wenn Sie leistungsstarkes Single-Node-Modellbereitstellung oder das Feinabstimmen von Modellen im kleinen Maßstab benötigen, verwenden Sie die A2-Maschinenserie, um auf dedizierte NVIDIA A100-GPU-Ressourcen zuzugreifen.
A2-Ultra
| Angehängte NVIDIA A100-GPUs mit 80 GB | ||||||
|---|---|---|---|---|---|---|
| Maschinentyp | vCPU-Anzahl1 | Instanzarbeitsspeicher (GB) | Verbundene lokale SSD (GiB) | Maximale Netzwerkbandbreite (Gbit/s)2 | GPU-Anzahl | GPU-Arbeitsspeicher3 (GB HBM2e) |
a2-ultragpu-1g |
12 | 170 | 375 | 24 | 1 | 80 |
a2-ultragpu-2g |
24 | 340 | 750 | 32 | 2 | 160 |
a2-ultragpu-4g |
48 | 680 | 1.500 | 50 | 4 | 320 |
a2-ultragpu-8g |
96 | 1.360 | 3.000 | 100 | 8 | 640 |
1 Eine vCPU ist als einzelner Hardware-Hyper-Thread auf einer der verfügbaren CPU-Plattformen implementiert.
2 Die maximale Bandbreite für ausgehenden Traffic darf die angegebene Zahl nicht überschreiten. Die tatsächliche Bandbreite für ausgehenden Traffic hängt von der Ziel-IP-Adresse und anderen Faktoren ab.
Weitere Informationen zur Netzwerkbandbreite finden Sie unter Netzwerkbandbreite.
3 GPU-Arbeitsspeicher ist der Speicher auf einem GPU-Gerät, der zum temporären Speichern von Daten verwendet werden kann. Es ist vom Arbeitsspeicher der Instanz getrennt und wurde speziell für die höheren Bandbreitenanforderungen grafikintensiver Arbeitslasten entwickelt.
A2-Standard
| Angehängte NVIDIA A100-GPUs mit 40 GB | ||||||
|---|---|---|---|---|---|---|
| Maschinentyp | vCPU-Anzahl1 | Instanzarbeitsspeicher (GB) | Unterstützung lokaler SSDs | Maximale Netzwerkbandbreite (Gbit/s)2 | GPU-Anzahl | GPU-Arbeitsspeicher3 (GB HBM2) |
a2-highgpu-1g |
12 | 85 | Ja | 24 | 1 | 40 |
a2-highgpu-2g |
24 | 170 | Ja | 32 | 2 | 80 |
a2-highgpu-4g |
48 | 340 | Ja | 50 | 4 | 160 |
a2-highgpu-8g |
96 | 680 | Ja | 100 | 8 | 320 |
a2-megagpu-16g |
96 | 1.360 | Ja | 100 | 16 | 640 |
1 Eine vCPU ist als einzelner Hardware-Hyper-Thread auf einer der verfügbaren CPU-Plattformen implementiert.
2 Die maximale Bandbreite für ausgehenden Traffic darf die angegebene Zahl nicht überschreiten. Die tatsächliche Bandbreite für ausgehenden Traffic hängt von der Ziel-IP-Adresse und anderen Faktoren ab.
Weitere Informationen zur Netzwerkbandbreite finden Sie unter Netzwerkbandbreite.
3 GPU-Arbeitsspeicher ist der Speicher auf einem GPU-Gerät, der zum temporären Speichern von Daten verwendet werden kann. Es ist vom Arbeitsspeicher der Instanz getrennt und wurde speziell für die höheren Bandbreitenanforderungen grafikintensiver Arbeitslasten entwickelt.
G4-Serie
Wenn Ihr Team kostengünstige Inferenz- oder Standard-Grafikrendering-Arbeitslasten benötigt, verwenden Sie die G4-Maschinenserie mit NVIDIA RTX PRO 6000-GPUs.
G4-Maschinentypen verwenden
NVIDIA RTX PRO 6000 Blackwell Server Edition-GPUs (nvidia-rtx-pro-6000) und eignen sich für NVIDIA Omniverse-Simulationsarbeitslasten, grafikintensive Anwendungen, Videotranscodierung und virtuelle Desktops. G4-Maschinentypen bieten im Vergleich zu Maschinentypen der A-Serie auch eine kostengünstige Lösung für die Durchführung von Single-Host-Inferenz und Modelloptimierung.
| Angehängte NVIDIA RTX PRO 6000-GPUs | |||||||
|---|---|---|---|---|---|---|---|
| Maschinentyp | vCPU-Anzahl1 | Instanzarbeitsspeicher (GB) | Maximal unterstützte Titanium-SSD (GiB)2 | Anzahl der physischen NICs | Maximale Netzwerkbandbreite (Gbit/s)3 | GPU-Anzahl | GPU-Arbeitsspeicher4 (GB GDDR7) |
g4-standard-6 |
6 | 22 | 0 | 1 | 20 | 1/8 | 12 |
g4-standard-12 |
12 | 45 | 375 | 1 | 20 | 1/4 | 24 |
g4-standard-24 |
24 | 90 | 750 | 1 | 20 | 1/2 | 48 |
g4-standard-48 |
48 | 180 | 1.500 | 1 | 50 | 1 | 96 |
g4-standard-96 |
96 | 360 | 3.000 | 1 | 100 | 2 | 192 |
g4-standard-192 |
192 | 720 | 6.000 | 1 | 200 | 4 | 384 |
g4-standard-384 |
384 | 1.440 | 12.000 | 2 | 400 | 8 | 768 |
*GPU-Arbeitsspeicher ist der Speicher, der auf einem GPU-Gerät verfügbar ist und zum temporären Speichern von Daten verwendet werden kann. Es ist vom Arbeitsspeicher der Instanz getrennt und wurde speziell für die höheren Bandbreitenanforderungen beschleunigter Arbeitslasten wie Machine Learning und grafikintensive Arbeitslasten entwickelt.
G2-Serie
Wenn Sie Mainstream-Echtzeit-Inferenzanwendungen oder RAG-Pipelines (Retrieval-Augmented Generation) bereitstellen, verwenden Sie die G2-Maschinenreihe, um Leistung und Kosteneffizienz mit NVIDIA L4-GPUs in Einklang zu bringen.
| Angehängte NVIDIA L4-GPUs | |||||||
|---|---|---|---|---|---|---|---|
| Maschinentyp | vCPU-Anzahl1 | Standard-Instanzarbeitsspeicher (GB) | Benutzerdefinierter Instanzarbeitsspeicherbereich (GB) | Maximal unterstützte lokale SSD (GiB) | Maximale Netzwerkbandbreite (Gbit/s)2 | GPU-Anzahl | GPU-Arbeitsspeicher3 (GB GDDR6) |
g2-standard-4 |
4 | 16 | 16 bis 32 | 375 | 10 | 1 | 24 |
g2-standard-8 |
8 | 32 | 32 bis 54 | 375 | 16 | 1 | 24 |
g2-standard-12 |
12 | 48 | 48 bis 54 | 375 | 16 | 1 | 24 |
g2-standard-16 |
16 | 64 | 54 bis 64 | 375 | 32 | 1 | 24 |
g2-standard-24 |
24 | 96 | 96 bis 108 | 750 | 32 | 2 | 48 |
g2-standard-32 |
32 | 128 | 96 bis 128 | 375 | 32 | 1 | 24 |
g2-standard-48 |
48 | 192 | 192 bis 216 | 1.500 | 50 | 4 | 96 |
g2-standard-96 |
96 | 384 | 384 bis 432 | 3.000 | 100 | 8 | 192 |
1 Eine vCPU ist als einzelner Hardware-Hyper-Thread auf einer der verfügbaren CPU-Plattformen implementiert.
2 Die maximale Bandbreite für ausgehenden Traffic darf die angegebene Zahl nicht überschreiten. Die tatsächliche Bandbreite für ausgehenden Traffic hängt von der Ziel-IP-Adresse und anderen Faktoren ab.
Weitere Informationen zur Netzwerkbandbreite finden Sie unter Netzwerkbandbreite.
3 GPU-Arbeitsspeicher ist der Speicher auf einem GPU-Gerät, der zum temporären Speichern von Daten verwendet werden kann. Es ist vom Arbeitsspeicher der Instanz getrennt und wurde speziell für die höheren Bandbreitenanforderungen grafikintensiver Arbeitslasten entwickelt.
N1-Serie (NVIDIA T4 oder V100)
Wenn Sie kostengünstige Tests durchführen oder Inferenz auf Einstiegsniveau mit geringer Parallelität ausführen möchten, verwenden Sie die N1-Maschinenserie, um NVIDIA T4- oder V100-GPUs anzuhängen.
NVIDIA T4
| Beschleunigertyp | GPU-Anzahl | GPU-Arbeitsspeicher1 (GB GDDR6) | vCPU Anzahl | Instanzarbeitsspeicher (GB) | Unterstützung lokaler SSDs |
|---|---|---|---|---|---|
nvidia-tesla-t4 oder nvidia-tesla-t4-vws
|
1 | 16 | 1 bis 48 | 1 bis 312 | Ja |
| 2 | 32 | 1 bis 48 | 1 bis 312 | Ja | |
| 4 | 64 | 1 bis 96 | 1 bis 624 | Ja |
NVIDIA V100
| Beschleunigertyp | GPU-Anzahl | GPU-Arbeitsspeicher1 (GB HBM2) | vCPU Anzahl | Instanzarbeitsspeicher (GB) | Unterstützung lokaler SSDs2 |
|---|---|---|---|---|---|
nvidia-tesla-v100 |
1 | 16 | 1 bis 12 | 1 bis 78 | Ja |
| 2 | 32 | 1 bis 24 | 1 bis 156 | Ja | |
| 4 | 64 | 1 bis 48 | 1 bis 312 | Ja | |
| 8 | 128 | 1 bis 96 | 1 bis 624 | Ja |
Kapazitätsbeschaffung
Allgemeine GPU-Beschleuniger verwenden die standardmäßige Self-Service-Bereitstellung. Sie können Kapazität über Standardreservierungen, On-Demand-Anfragen oder Spot-VMs erhalten. Da es bei On-Demand-Kapazität zu Engpässen kommen kann, sollten Sie nach Möglichkeit Spot-VMs oder Flex-Start-VMs verwenden.
Nächste Schritte
- Informationen zum Erwerb von Kapazität finden Sie unter Nutzungsoptionen.
- Informationen zum Bewerten Ihrer Infrastrukturanforderungen finden Sie unter Infrastruktur auswählen.
- Informationen zu den Netzwerkdiensten für GPUs finden Sie unter GPU-Netzwerkübersicht.
- Informationen zum Prozess und zu den Entscheidungen, die Sie beim Starten eines Clusters treffen müssen, finden Sie unter KI-Infrastruktur planen und erstellen.