Allgemeine Übersicht über GPUs

Allgemeine GPUs sind für Arbeitslasten im Bereich künstliche Intelligenz (KI) und maschinelles Lernen (ML) optimiert, bei denen betriebliche Flexibilität, Ressourcenunabhängigkeit und Kosteneffizienz im Vordergrund stehen.

Mit General-Purpose-GPUs können Teams NVIDIA-Beschleuniger mit vollständiger betrieblicher Autonomie bereitstellen und skalieren. So wird die architektonische Komplexität koordinierter Supercomputing-Cluster umgangen. Sie eignen sich ideal für Arbeitslasten, bei denen Hochverfügbarkeit, Self-Service-Bereitstellung und unabhängige Skalierung im Vordergrund stehen. Häufige Anwendungsfälle sind Echtzeit-Inferenz, RAG, Prototyping und das Training kleiner bis mittelgroßer Modelle.

Wichtige Merkmale von General-Purpose-GPUs

  • Betriebliche Flexibilität: Sie können Ressourcen mit Standard-GKE-Schnittstellen (Autopilot und Standard) und Compute Engine-Schnittstellen verwalten, um die Bereitstellung und Skalierung zu vereinfachen.
  • Hochverfügbarkeit: Google Cloud Einzelne Instanzen werden unabhängig voneinander aktualisiert. So wird sichergestellt, dass sich Updates auf einem Knoten nicht auf die Verfügbarkeit anderer Knoten auswirken. Ihr Load Balancer kann Traffic umleiten, ohne dass die Bereitstellung von Flotten unterbrochen wird.
  • Einfache Vernetzung: Ihre Arbeitslasten verwenden standardmäßige VPC-Dienste (Virtual Private Cloud) und standardmäßiges TCP/IP über gVNIC-Schnittstellen (Google Virtual NIC), um komplexe Fabrics auf Hardwareebene zu vermeiden.
  • Kostenoptimierung: Sie können Spot-VMs für fehlertolerante Forschung verwenden und so im Vergleich zu Standard-On-Demand-Preisen bis zu 90% Kosten sparen.
  • Self-Service-Erwerb: Sie können Kapazität direkt über Standardreservierungen und On-Demand-Anfragen erwerben, ohne dass von Ihrem Kontoteam verwaltete Workflows erforderlich sind.

Allgemeine GPU-Familien und technische Spezifikationen

Sehen Sie sich die Arbeitslasten und Hardwarespezifikationen für die Maschinenserie „Allgemeine GPU“ an. Für die Bereitstellung mit hohem Durchsatz sollten Sie die A3 Edge-Serie verwenden.

A3-Serie (High mit 1, 2 oder 4 GPUs und Edge)

A3 High (1, 2 oder 4 GPUs)

Wenn Sie Inferenz- oder Standardtrainingsarbeitslasten ausführen, die eine hohe Leistung erfordern, aber keinen synchronisierten Cluster mit 8 GPUs benötigen, verwenden Sie die A3 High-Maschinenserie mit 1, 2 oder 4 angeschlossenen GPUs.

A3 High-Maschinentypen haben NVIDIA H100 SXM-GPUs und eignen sich sowohl für die Inferenz großer Modelle als auch für die Feinabstimmung von Modellen.

Angehängte NVIDIA H100-GPUs
Maschinentyp vCPU-Anzahl1 Instanzarbeitsspeicher (GB) Verbundene lokale SSD (GiB) Anzahl der physischen NICs Maximale Netzwerkbandbreite (Gbit/s)2 GPU-Anzahl GPU-Arbeitsspeicher3
(GB HBM3)
a3-highgpu-1g 26 234 750 1 25 1 80
a3-highgpu-2g 52 468 1.500 1 50 2 160
a3-highgpu-4g 104 936 3.000 1 100 4 320
a3-highgpu-8g 208 1.872 6.000 5 1.000 8 640

1 Eine vCPU ist als einzelner Hardware-Hyper-Thread auf einer der verfügbaren CPU-Plattformen implementiert.
2 Die maximale Bandbreite für ausgehenden Traffic darf die angegebene Zahl nicht überschreiten. Die tatsächliche Bandbreite für ausgehenden Traffic hängt von der Ziel-IP-Adresse und anderen Faktoren ab. Weitere Informationen zur Netzwerkbandbreite finden Sie unter Netzwerkbandbreite.
3 GPU-Arbeitsspeicher ist der Speicher auf einem GPU-Gerät, der zum temporären Speichern von Daten verwendet werden kann. Es ist vom Arbeitsspeicher der Instanz getrennt und wurde speziell für die höheren Bandbreitenanforderungen grafikintensiver Arbeitslasten entwickelt.

A3 Edge

Wenn Sie verteilte Inferenz-Arbeitslasten mit hohem Durchsatz auf mehreren Hosts ohne koordiniertes Cluster-Fabric ausführen, können Sie die A3 Edge-Serie verwenden, um die Bereitstellung über standardmäßige virtuelle private Netzwerke zu vereinfachen.

A3 Edge-Maschinentypen haben NVIDIA H100 SXM-GPUs und sind speziell für die Bereitstellung konzipiert. Sie sind in einer begrenzten Anzahl von Regionen verfügbar.

Angehängte NVIDIA H100-GPUs
Maschinentyp vCPU-Anzahl1 Instanzarbeitsspeicher (GB) Verbundene lokale SSD (GiB) Anzahl der physischen NICs Maximale Netzwerkbandbreite (Gbit/s)2 GPU-Anzahl GPU-Arbeitsspeicher3
(GB HBM3)
a3-edgegpu-8g 208 1.872 6.000 5
  • 600: für asia-south1 und northamerica-northeast2
  • 400: für alle anderen A3 Edge-Regionen
8 640

A2-Serie (Standard und Ultra)

Wenn Sie leistungsstarkes Single-Node-Modellbereitstellung oder das Feinabstimmen von Modellen im kleinen Maßstab benötigen, verwenden Sie die A2-Maschinenserie, um auf dedizierte NVIDIA A100-GPU-Ressourcen zuzugreifen.

A2-Ultra

Angehängte NVIDIA A100-GPUs mit 80 GB
Maschinentyp vCPU-Anzahl1 Instanzarbeitsspeicher (GB) Verbundene lokale SSD (GiB) Maximale Netzwerkbandbreite (Gbit/s)2 GPU-Anzahl GPU-Arbeitsspeicher3
(GB HBM2e)
a2-ultragpu-1g 12 170 375 24 1 80
a2-ultragpu-2g 24 340 750 32 2 160
a2-ultragpu-4g 48 680 1.500 50 4 320
a2-ultragpu-8g 96 1.360 3.000 100 8 640

1 Eine vCPU ist als einzelner Hardware-Hyper-Thread auf einer der verfügbaren CPU-Plattformen implementiert.
2 Die maximale Bandbreite für ausgehenden Traffic darf die angegebene Zahl nicht überschreiten. Die tatsächliche Bandbreite für ausgehenden Traffic hängt von der Ziel-IP-Adresse und anderen Faktoren ab. Weitere Informationen zur Netzwerkbandbreite finden Sie unter Netzwerkbandbreite.
3 GPU-Arbeitsspeicher ist der Speicher auf einem GPU-Gerät, der zum temporären Speichern von Daten verwendet werden kann. Es ist vom Arbeitsspeicher der Instanz getrennt und wurde speziell für die höheren Bandbreitenanforderungen grafikintensiver Arbeitslasten entwickelt.

A2-Standard

Angehängte NVIDIA A100-GPUs mit 40 GB
Maschinentyp vCPU-Anzahl1 Instanzarbeitsspeicher (GB) Unterstützung lokaler SSDs Maximale Netzwerkbandbreite (Gbit/s)2 GPU-Anzahl GPU-Arbeitsspeicher3
(GB HBM2)
a2-highgpu-1g 12 85 Ja 24 1 40
a2-highgpu-2g 24 170 Ja 32 2 80
a2-highgpu-4g 48 340 Ja 50 4 160
a2-highgpu-8g 96 680 Ja 100 8 320
a2-megagpu-16g 96 1.360 Ja 100 16 640

1 Eine vCPU ist als einzelner Hardware-Hyper-Thread auf einer der verfügbaren CPU-Plattformen implementiert.
2 Die maximale Bandbreite für ausgehenden Traffic darf die angegebene Zahl nicht überschreiten. Die tatsächliche Bandbreite für ausgehenden Traffic hängt von der Ziel-IP-Adresse und anderen Faktoren ab. Weitere Informationen zur Netzwerkbandbreite finden Sie unter Netzwerkbandbreite.
3 GPU-Arbeitsspeicher ist der Speicher auf einem GPU-Gerät, der zum temporären Speichern von Daten verwendet werden kann. Es ist vom Arbeitsspeicher der Instanz getrennt und wurde speziell für die höheren Bandbreitenanforderungen grafikintensiver Arbeitslasten entwickelt.

G4-Serie

Wenn Ihr Team kostengünstige Inferenz- oder Standard-Grafikrendering-Arbeitslasten benötigt, verwenden Sie die G4-Maschinenserie mit NVIDIA RTX PRO 6000-GPUs.

G4-Maschinentypen verwenden NVIDIA RTX PRO 6000 Blackwell Server Edition-GPUs (nvidia-rtx-pro-6000) und eignen sich für NVIDIA Omniverse-Simulationsarbeitslasten, grafikintensive Anwendungen, Videotranscodierung und virtuelle Desktops. G4-Maschinentypen bieten im Vergleich zu Maschinentypen der A-Serie auch eine kostengünstige Lösung für die Durchführung von Single-Host-Inferenz und Modelloptimierung.

Angehängte NVIDIA RTX PRO 6000-GPUs
Maschinentyp vCPU-Anzahl1 Instanzarbeitsspeicher (GB) Maximal unterstützte Titanium-SSD (GiB)2 Anzahl der physischen NICs Maximale Netzwerkbandbreite (Gbit/s)3 GPU-Anzahl GPU-Arbeitsspeicher4
(GB GDDR7)
g4-standard-6 6 22 0 1 20 1/8 12
g4-standard-12 12 45 375 1 20 1/4 24
g4-standard-24 24 90 750 1 20 1/2 48
g4-standard-48 48 180 1.500 1 50 1 96
g4-standard-96 96 360 3.000 1 100 2 192
g4-standard-192 192 720 6.000 1 200 4 384
g4-standard-384 384 1.440 12.000 2 400 8 768

*GPU-Arbeitsspeicher ist der Speicher, der auf einem GPU-Gerät verfügbar ist und zum temporären Speichern von Daten verwendet werden kann. Es ist vom Arbeitsspeicher der Instanz getrennt und wurde speziell für die höheren Bandbreitenanforderungen beschleunigter Arbeitslasten wie Machine Learning und grafikintensive Arbeitslasten entwickelt.

G2-Serie

Wenn Sie Mainstream-Echtzeit-Inferenzanwendungen oder RAG-Pipelines (Retrieval-Augmented Generation) bereitstellen, verwenden Sie die G2-Maschinenreihe, um Leistung und Kosteneffizienz mit NVIDIA L4-GPUs in Einklang zu bringen.

Angehängte NVIDIA L4-GPUs
Maschinentyp vCPU-Anzahl1 Standard-Instanzarbeitsspeicher (GB) Benutzerdefinierter Instanzarbeitsspeicherbereich (GB) Maximal unterstützte lokale SSD (GiB) Maximale Netzwerkbandbreite (Gbit/s)2 GPU-Anzahl GPU-Arbeitsspeicher3 (GB GDDR6)
g2-standard-4 4 16 16 bis 32 375 10 1 24
g2-standard-8 8 32 32 bis 54 375 16 1 24
g2-standard-12 12 48 48 bis 54 375 16 1 24
g2-standard-16 16 64 54 bis 64 375 32 1 24
g2-standard-24 24 96 96 bis 108 750 32 2 48
g2-standard-32 32 128 96 bis 128 375 32 1 24
g2-standard-48 48 192 192 bis 216 1.500 50 4 96
g2-standard-96 96 384 384 bis 432 3.000 100 8 192

1 Eine vCPU ist als einzelner Hardware-Hyper-Thread auf einer der verfügbaren CPU-Plattformen implementiert.
2 Die maximale Bandbreite für ausgehenden Traffic darf die angegebene Zahl nicht überschreiten. Die tatsächliche Bandbreite für ausgehenden Traffic hängt von der Ziel-IP-Adresse und anderen Faktoren ab. Weitere Informationen zur Netzwerkbandbreite finden Sie unter Netzwerkbandbreite.
3 GPU-Arbeitsspeicher ist der Speicher auf einem GPU-Gerät, der zum temporären Speichern von Daten verwendet werden kann. Es ist vom Arbeitsspeicher der Instanz getrennt und wurde speziell für die höheren Bandbreitenanforderungen grafikintensiver Arbeitslasten entwickelt.

N1-Serie (NVIDIA T4 oder V100)

Wenn Sie kostengünstige Tests durchführen oder Inferenz auf Einstiegsniveau mit geringer Parallelität ausführen möchten, verwenden Sie die N1-Maschinenserie, um NVIDIA T4- oder V100-GPUs anzuhängen.

NVIDIA T4

Beschleunigertyp GPU-Anzahl GPU-Arbeitsspeicher1 (GB GDDR6) vCPU Anzahl Instanzarbeitsspeicher (GB) Unterstützung lokaler SSDs
nvidia-tesla-t4 oder
nvidia-tesla-t4-vws
1 16 1 bis 48 1 bis 312 Ja
2 32 1 bis 48 1 bis 312 Ja
4 64 1 bis 96 1 bis 624 Ja

NVIDIA V100

Beschleunigertyp GPU-Anzahl GPU-Arbeitsspeicher1 (GB HBM2) vCPU Anzahl Instanzarbeitsspeicher (GB) Unterstützung lokaler SSDs2
nvidia-tesla-v100 1 16 1 bis 12 1 bis 78 Ja
2 32 1 bis 24 1 bis 156 Ja
4 64 1 bis 48 1 bis 312 Ja
8 128 1 bis 96 1 bis 624 Ja

Kapazitätsbeschaffung

Allgemeine GPU-Beschleuniger verwenden die standardmäßige Self-Service-Bereitstellung. Sie können Kapazität über Standardreservierungen, On-Demand-Anfragen oder Spot-VMs erhalten. Da es bei On-Demand-Kapazität zu Engpässen kommen kann, sollten Sie nach Möglichkeit Spot-VMs oder Flex-Start-VMs verwenden.

Nächste Schritte