Zwischen allgemeinen und gruppierten GPUs auswählen

In diesem Dokument finden Sie Empfehlungen für die Beschleuniger, Nutzungsoptionen und Bereitstellungstools, die sich am besten für verschiedene Arbeitslasten aus den Bereichen künstliche Intelligenz (KI), maschinelles Lernen (ML) und Hochleistungs-Computing (HPC) eignen. Dieses Dokument soll Ihnen helfen, die beste Bereitstellung für Ihre Arbeitslast zu ermitteln.

Informationen und Empfehlungen zu Infrastruktursäulen für KI-, ML- und HPC-Arbeitslasten finden Sie in den folgenden Dokumenten:

Arbeitslasten – Übersicht

Die AI Hypercomputer-Architektur unterstützt die folgenden Anwendungsfälle:

Arbeitslast Beschreibung Empfehlung
Foundation Models vortrainieren Dazu wird ein Sprachmodell mit einem großen Dataset erstellt. Das Ergebnis des Vortrainings von Foundation Models ist ein neues Modell, das sich gut für allgemeine Aufgaben eignet.
Modelle werden anhand ihrer Größe in folgende Kategorien eingeteilt:
  • Frontier-Modell: ML-Modelle mit Hunderten Milliarden bis Billionen oder mehr Parametern. Dazu gehören Large Language Models (LLMs) wie Gemini.
  • Großes Modell:ML-Modelle mit mehreren zehn bis mehreren hundert Milliarden Parametern oder mehr.
Empfehlungen für das Vortraining von Modellen
Feinabstimmung Dabei wird ein trainiertes Modell mithilfe von spezialisierten Datasets oder anderen Techniken an bestimmte Aufgaben angepasst. Die Feinabstimmung wird in der Regel bei großen Modellen durchgeführt. Empfehlungen zum Feinabstimmen von Modellen
Inferenz oder Bereitstellung Dabei wird ein trainiertes oder feinabgestimmtes Modell für die Nutzung durch Nutzer oder Anwendungen verfügbar gemacht.
Inferenzarbeitslasten werden anhand der Größe der Modelle in folgende Kategorien unterteilt:
  • Inferenz für Foundation Models auf mehreren Hosts: Inferenz mit trainierten ML-Modellen mit Hunderten von Milliarden bis hin zu Billionen von Parametern oder mehr. Bei diesen Inferenzarbeitslasten wird die Rechenlast auf mehrere Hostmaschinen verteilt.
  • Inferenz mit Foundation-Modellen auf einem einzelnen Host: Inferenz mit trainierten ML-Modellen mit zehn bis hunderten von Milliarden von Parametern. Bei diesen Inferenzarbeitslasten ist die Rechenlast auf einen einzelnen Hostcomputer beschränkt.
  • Inferenz mit großen Modellen:Inferenz mit trainierten oder feinabgestimmten ML-Modellen mit Dutzenden bis Hunderten von Milliarden von Parametern.
Empfehlungen für die Inferenz
ML für kleine oder mittelgroße Modelle Dazu gehört das Trainieren und Bereitstellen von ML-Modellen, die in Größe und Komplexität kleiner sind, in der Regel für spezialisiertere Aufgaben. Empfehlungen für ML für kleine oder mittelgroße Modelle
HPC Dabei werden Rechenressourcen aggregiert, um eine höhere Leistung zu erzielen als mit einer einzelnen Workstation, einem Server oder Computer. HPC wird zur Lösung von Problemen in der akademischen Forschung, Wissenschaft, im Design, in der Simulation und in der Business Intelligence eingesetzt. Empfehlungen für HPC

Empfehlungen für das Vortrainieren von Modellen

Für das Vortraining von Foundation Models werden große Cluster von Beschleunigern verwendet, die kontinuierlich große Datenmengen lesen. Diese Beschleuniger passen Gewichte durch Vorwärts- und Rückwärtsdurchläufe an, um aus den Daten zu lernen. Diese Trainingsjobs werden über Wochen oder sogar Monate hinweg ausgeführt.

In den folgenden Abschnitten werden die Beschleuniger und Verbrauchsoptionen beschrieben, die wir für das Vortraining von Basismodellen empfehlen.

Empfohlene Beschleuniger

Für das Vortrainieren von Foundation Models auf Google Cloudempfehlen wir die Verwendung von beschleunigungsoptimierten Maschinentypen A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 GB), A3 Mega (NVIDIA H100 80 GB) oder A3 High (NVIDIA H100 80 GB) und die Bereitstellung des Clusters mit einem Orchestrator.

Für die Bereitstellung dieser Accelerator-Cluster empfehlen wir außerdem die Verwendung von Cluster Director oder Cluster Toolkit. Weitere Informationen finden Sie in der entsprechenden Anleitung zur Clusterbereitstellung für den von Ihnen ausgewählten Maschinentyp in der folgenden Tabelle.

Arbeitslasten Empfehlungen Leitfaden für die Clusterbereitstellung
Maschinentyp Orchestrator
Foundation Models vortrainieren
  • A4X Max (NVIDIA GB300)
  • A4X (NVIDIA GB200)
  • A4 (NVIDIA B200)
GKE KI-optimierten GKE-Cluster mit Standardkonfiguration erstellen
Slurm
Training großer Modelle A3 Ultra (NVIDIA H200 141 GB) GKE KI-optimierten GKE-Cluster mit Standardkonfiguration erstellen
Slurm
Training großer Modelle
  • A3 Mega (NVIDIA H100 80 GB)
  • A3 High (NVIDIA H100 80 GB)
GKE GPU-Netzwerkbandbreite in Clustern im Standard-Modus maximieren
Slurm

Empfohlene Nutzungsoption

Wenn Sie große Cluster von Beschleunigern mit hoher Wahrscheinlichkeit erhalten möchten, empfehlen wir, eine Reservierung zu verwenden. Um die Kosten für reservierte Ressourcen zu minimieren, empfehlen wir, eine Reservierungsdauer anzufordern, die lang genug ist, um Rabatte für zugesicherte Nutzung zu erhalten. Weitere Informationen zu den Nutzungsoptionen finden Sie unter Nutzungsoption auswählen.

Empfehlungen zum Feinabstimmen von Modellen

Zum Feinabstimmen großer Foundation Models werden von kleineren Beschleunigerclustern moderate Datenmengen gelesen. Diese Beschleuniger passen das Modell an, um bestimmte Aufgaben auszuführen. Diese Feinabstimmungsjobs können Tage oder sogar Wochen dauern.

In den folgenden Abschnitten werden die empfohlenen Beschleuniger und Verbrauchsoptionen für das Fine-Tuning von Modellen beschrieben.

Für das Feinabstimmen von Modellen auf Google Cloudempfehlen wir die Verwendung von beschleunigeroptimierten Maschinentypen A3 Ultra (NVIDIA H200 141 GB), A3 Mega (NVIDIA H100 80 GB) oder A3 High (NVIDIA H100 80 GB) und die Bereitstellung des Clusters mit einem Orchestrator.

Für die Bereitstellung dieser Accelerator-Cluster empfehlen wir außerdem die Verwendung von Cluster Director oder Cluster Toolkit. Weitere Informationen finden Sie in der entsprechenden Anleitung zur Clusterbereitstellung für den von Ihnen ausgewählten Maschinentyp in der folgenden Tabelle.

Arbeitslasten Empfehlungen Leitfaden für die Clusterbereitstellung
Maschinentyp Orchestrator
Große Modelle abstimmen A3 Ultra (NVIDIA H200 141 GB) GKE KI-optimierten GKE-Cluster mit Standardkonfiguration erstellen
Slurm
Große Modelle abstimmen
  • A3 Mega (NVIDIA H100 80 GB)
  • A3 High (NVIDIA H100 80 GB)
GKE GPU-Netzwerkbandbreite in Clustern im Standard-Modus maximieren
Slurm

Empfohlene Nutzungsoption

Für Arbeitslasten zum Feinabstimmen können Sie Ressourcen mit einer vorausschauenden Reservierung im Kalendermodus bereitstellen. Weitere Informationen zu den Nutzungsoptionen finden Sie unter Nutzungsoption auswählen.

Empfehlungen für Inferenz

In den folgenden Abschnitten werden die empfohlenen Beschleuniger und Nutzungsoptionen für die Inferenz beschrieben.

Empfohlene Beschleuniger

Die empfohlenen Beschleuniger für die Inferenz hängen davon ab, ob Sie eine Grenzmodellinferenz mit mehreren Hosts oder mit einem einzelnen Host durchführen.

Empfohlene Beschleuniger (Multi-Host)

Wenn Sie die Inferenz von Grenz- oder großen Modellen mit mehreren Hosts auf Google Cloudausführen möchten, verwenden Sie die beschleunigeroptimierten Maschinentypen A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 GB), A3 Mega (NVIDIA H100 80 GB) oder A3 High (NVIDIA H100 80 GB) und stellen Sie die Maschine mit einem Orchestrator bereit. Für die Bereitstellung dieser Accelerator-Cluster empfehlen wir außerdem die Verwendung von Cluster Director oder Cluster Toolkit. Die Tabelle enthält Links zu Anleitungen zur Clusterbereitstellung für jeden empfohlenen Maschinentyp.

Arbeitslasten Empfehlungen Leitfaden für die Clusterbereitstellung
Maschinentyp Orchestrator
Grenzlinieninferenz mit mehreren Hosts
  • A4X Max (NVIDIA GB300)
  • A4X (NVIDIA GB200)
  • A4 (NVIDIA B200)
GKE KI-optimierten GKE-Cluster mit Standardkonfiguration erstellen
Slurm
Inferenz für große Modelle A3 Ultra (NVIDIA H200 141 GB) GKE KI-optimierten GKE-Cluster mit Standardkonfiguration erstellen
Slurm
Inferenz für große Modelle
  • A3 Mega (NVIDIA H100 80 GB)
  • A3 High (NVIDIA H100 80 GB)
GKE GPU-Netzwerkbandbreite in Clustern im Standard-Modus maximieren
Slurm

Empfohlene Beschleuniger (einzelner Host)

In der Tabelle sind die Beschleuniger aufgeführt, die wir für die Grenzschichtinferenz auf einem einzelnen Host empfehlen. Die Tabelle enthält Links zu VM-Bereitstellungsanleitungen für jeden empfohlenen Maschinentyp.

Arbeitslasten Empfehlungen Bereitstellungsanleitung für VMs
Maschinentyp Orchestrator
Grenz- und Mainstream-Inferenz mit einem einzelnen Host
  • A4 (NVIDIA B200)
  • A3 Ultra (NVIDIA H200 141 GB)
A4- oder A3 Ultra-Instanz erstellen
  • A3 High (NVIDIA H100 80 GB)
  • A3 Edge (NVIDIA H100 80 GB)
A3 High- oder A3 Edge-Instanz erstellen
G4 (NVIDIA RTX PRO 6000) G4-Instanz erstellen
A2 (NVIDIA A100) A2-Instanz erstellen
G2 (NVIDIA L4) G2-Instanz erstellen
N1 (NVIDIA T4 oder V100) N1-Instanz erstellen

Empfohlene Nutzungsoption

Verwenden Sie für die Inferenz entweder eine Reservierung mit langer Laufzeit oder eine vorausschauende Reservierung im Kalendermodus. Weitere Informationen zu den Verbrauchsoptionen finden Sie unter Verbrauchsoption auswählen.

Empfehlungen für kleine oder mittelgroße Modelle

Bei ML-Arbeitslasten mit kleinen bis mittelgroßen Modellen ist ein optimales Gleichgewicht zwischen Preis und Leistung von entscheidender Bedeutung.

Empfohlene Beschleuniger

Die folgende Tabelle enthält die empfohlenen Beschleuniger für ML-Arbeitslasten mit kleinen bis mittelgroßen Modellen.

Arbeitslasten Empfehlungen Bereitstellungsanleitung für VMs
Maschinentyp Orchestrator
ML für kleine oder mittelgroße Modelle G4 (NVIDIA RTX PRO 6000) G4-Instanz erstellen
G2 (NVIDIA L4) G2-Instanz erstellen
A2 (NVIDIA A100) A2-Instanz erstellen
A3 Edge (NVIDIA H100 80 GB) A3 Edge-Instanz erstellen
N1 (NVIDIA T4 oder V100) N1-Instanz erstellen

Empfehlungen für HPC

Für HPC-Arbeitslasten eignet sich jede beschleunigungsoptimierte Maschinenserie oder computing-optimierte Maschinenserie. Wenn Sie eine beschleunigungsoptimierte Maschinenserie verwenden, hängt die beste Lösung davon ab, wie viel Rechenaufwand an die GPU ausgelagert werden muss. Eine detaillierte Liste mit Empfehlungen für HPC-Arbeitslasten finden Sie unter Best Practices zum Ausführen von HPC-Arbeitslasten.

Zusammenfassung der Empfehlungen

In der folgenden Tabelle sind die empfohlenen Beschleuniger und Verbrauchsoptionen für die einzelnen Arbeitslasten zusammengefasst.

Ressource Empfehlung
Modell-Vortraining
Maschinenfamilie Verwenden Sie einen der folgenden beschleunigungsoptimierten Maschinentypen: A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 GB), A3 Mega (NVIDIA H100 80 GB) oder A3 High (NVIDIA H100 80 GB).
Nutzungsoption „Standardmäßige vorausschauende Reservierungen verwenden“
Modellabstimmung
Maschinenfamilie Verwenden Sie die beschleunigungsoptimierten Maschinentypen A3 Ultra (NVIDIA H200 mit 141 GB), A3 Mega (NVIDIA H100 mit 80 GB) oder A3 High (NVIDIA H100 mit 80 GB).
Nutzungsoption „Standardmäßige vorausschauende Reservierungen verwenden“
Inferenz
Maschinenfamilie Verwenden Sie einen der folgenden Maschinentypen: A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 GB), A3 Mega (NVIDIA H100 80 GB), A3 High (NVIDIA H100 80 GB), G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 80 GB) oder N1 (NVIDIA T4 oder V100)
Nutzungsoption Reservierungen, On-Demand- oder Spot-Instanzen verwenden
ML für kleine oder mittelgroße Modelle
Maschinenfamilie Verwenden Sie einen der folgenden Maschinentypen: G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 80 GB) oder N1 (NVIDIA T4 oder V100).
Nutzungsoption On-Demand-, Spot- oder Standardreservierungen verwenden
Speicher Cloud Storage FUSE verwenden
HPC (Hochleistungs-Computing)
Zusammenfassung der Best Practices zum Ausführen von HPC-Arbeitslasten

Nächste Schritte