In diesem Dokument finden Sie Empfehlungen für die Beschleuniger, Nutzungsoptionen und Bereitstellungstools, die sich am besten für verschiedene Arbeitslasten aus den Bereichen künstliche Intelligenz (KI), maschinelles Lernen (ML) und Hochleistungs-Computing (HPC) eignen. Dieses Dokument soll Ihnen helfen, die beste Bereitstellung für Ihre Arbeitslast zu ermitteln.
Informationen und Empfehlungen zu Infrastruktursäulen für KI-, ML- und HPC-Arbeitslasten finden Sie in den folgenden Dokumenten:
Arbeitslasten – Übersicht
Die AI Hypercomputer-Architektur unterstützt die folgenden Anwendungsfälle:
| Arbeitslast | Beschreibung | Empfehlung |
|---|---|---|
| Foundation Models vortrainieren | Dazu wird ein Sprachmodell mit einem großen Dataset erstellt. Das Ergebnis des Vortrainings von Foundation Models ist ein neues Modell, das sich gut für allgemeine Aufgaben eignet. Modelle werden anhand ihrer Größe in folgende Kategorien eingeteilt:
|
Empfehlungen für das Vortraining von Modellen |
| Feinabstimmung | Dabei wird ein trainiertes Modell mithilfe von spezialisierten Datasets oder anderen Techniken an bestimmte Aufgaben angepasst. Die Feinabstimmung wird in der Regel bei großen Modellen durchgeführt. | Empfehlungen zum Feinabstimmen von Modellen |
| Inferenz oder Bereitstellung | Dabei wird ein trainiertes oder feinabgestimmtes Modell für die Nutzung durch Nutzer oder Anwendungen verfügbar gemacht. Inferenzarbeitslasten werden anhand der Größe der Modelle in folgende Kategorien unterteilt:
|
Empfehlungen für die Inferenz |
| ML für kleine oder mittelgroße Modelle | Dazu gehört das Trainieren und Bereitstellen von ML-Modellen, die in Größe und Komplexität kleiner sind, in der Regel für spezialisiertere Aufgaben. | Empfehlungen für ML für kleine oder mittelgroße Modelle |
| HPC | Dabei werden Rechenressourcen aggregiert, um eine höhere Leistung zu erzielen als mit einer einzelnen Workstation, einem Server oder Computer. HPC wird zur Lösung von Problemen in der akademischen Forschung, Wissenschaft, im Design, in der Simulation und in der Business Intelligence eingesetzt. | Empfehlungen für HPC |
Empfehlungen für das Vortrainieren von Modellen
Für das Vortraining von Foundation Models werden große Cluster von Beschleunigern verwendet, die kontinuierlich große Datenmengen lesen. Diese Beschleuniger passen Gewichte durch Vorwärts- und Rückwärtsdurchläufe an, um aus den Daten zu lernen. Diese Trainingsjobs werden über Wochen oder sogar Monate hinweg ausgeführt.
In den folgenden Abschnitten werden die Beschleuniger und Verbrauchsoptionen beschrieben, die wir für das Vortraining von Basismodellen empfehlen.
Empfohlene Beschleuniger
Für das Vortrainieren von Foundation Models auf Google Cloudempfehlen wir die Verwendung von beschleunigungsoptimierten Maschinentypen A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 GB), A3 Mega (NVIDIA H100 80 GB) oder A3 High (NVIDIA H100 80 GB) und die Bereitstellung des Clusters mit einem Orchestrator.
Für die Bereitstellung dieser Accelerator-Cluster empfehlen wir außerdem die Verwendung von Cluster Director oder Cluster Toolkit. Weitere Informationen finden Sie in der entsprechenden Anleitung zur Clusterbereitstellung für den von Ihnen ausgewählten Maschinentyp in der folgenden Tabelle.
| Arbeitslasten | Empfehlungen | Leitfaden für die Clusterbereitstellung | |
|---|---|---|---|
| Maschinentyp | Orchestrator | ||
| Foundation Models vortrainieren |
|
GKE | KI-optimierten GKE-Cluster mit Standardkonfiguration erstellen |
| Slurm | |||
| Training großer Modelle | A3 Ultra (NVIDIA H200 141 GB) | GKE | KI-optimierten GKE-Cluster mit Standardkonfiguration erstellen |
| Slurm | |||
| Training großer Modelle |
|
GKE | GPU-Netzwerkbandbreite in Clustern im Standard-Modus maximieren |
| Slurm | |||
Empfohlene Nutzungsoption
Wenn Sie große Cluster von Beschleunigern mit hoher Wahrscheinlichkeit erhalten möchten, empfehlen wir, eine Reservierung zu verwenden. Um die Kosten für reservierte Ressourcen zu minimieren, empfehlen wir, eine Reservierungsdauer anzufordern, die lang genug ist, um Rabatte für zugesicherte Nutzung zu erhalten. Weitere Informationen zu den Nutzungsoptionen finden Sie unter Nutzungsoption auswählen.
Empfehlungen zum Feinabstimmen von Modellen
Zum Feinabstimmen großer Foundation Models werden von kleineren Beschleunigerclustern moderate Datenmengen gelesen. Diese Beschleuniger passen das Modell an, um bestimmte Aufgaben auszuführen. Diese Feinabstimmungsjobs können Tage oder sogar Wochen dauern.
In den folgenden Abschnitten werden die empfohlenen Beschleuniger und Verbrauchsoptionen für das Fine-Tuning von Modellen beschrieben.
Empfohlene Beschleuniger
Für das Feinabstimmen von Modellen auf Google Cloudempfehlen wir die Verwendung von beschleunigeroptimierten Maschinentypen A3 Ultra (NVIDIA H200 141 GB), A3 Mega (NVIDIA H100 80 GB) oder A3 High (NVIDIA H100 80 GB) und die Bereitstellung des Clusters mit einem Orchestrator.
Für die Bereitstellung dieser Accelerator-Cluster empfehlen wir außerdem die Verwendung von Cluster Director oder Cluster Toolkit. Weitere Informationen finden Sie in der entsprechenden Anleitung zur Clusterbereitstellung für den von Ihnen ausgewählten Maschinentyp in der folgenden Tabelle.
| Arbeitslasten | Empfehlungen | Leitfaden für die Clusterbereitstellung | |
|---|---|---|---|
| Maschinentyp | Orchestrator | ||
| Große Modelle abstimmen | A3 Ultra (NVIDIA H200 141 GB) | GKE | KI-optimierten GKE-Cluster mit Standardkonfiguration erstellen |
| Slurm | |||
| Große Modelle abstimmen |
|
GKE | GPU-Netzwerkbandbreite in Clustern im Standard-Modus maximieren |
| Slurm | |||
Empfohlene Nutzungsoption
Für Arbeitslasten zum Feinabstimmen können Sie Ressourcen mit einer vorausschauenden Reservierung im Kalendermodus bereitstellen. Weitere Informationen zu den Nutzungsoptionen finden Sie unter Nutzungsoption auswählen.
Empfehlungen für Inferenz
In den folgenden Abschnitten werden die empfohlenen Beschleuniger und Nutzungsoptionen für die Inferenz beschrieben.
Empfohlene Beschleuniger
Die empfohlenen Beschleuniger für die Inferenz hängen davon ab, ob Sie eine Grenzmodellinferenz mit mehreren Hosts oder mit einem einzelnen Host durchführen.
Empfohlene Beschleuniger (Multi-Host)
Wenn Sie die Inferenz von Grenz- oder großen Modellen mit mehreren Hosts auf Google Cloudausführen möchten, verwenden Sie die beschleunigeroptimierten Maschinentypen A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 GB), A3 Mega (NVIDIA H100 80 GB) oder A3 High (NVIDIA H100 80 GB) und stellen Sie die Maschine mit einem Orchestrator bereit. Für die Bereitstellung dieser Accelerator-Cluster empfehlen wir außerdem die Verwendung von Cluster Director oder Cluster Toolkit. Die Tabelle enthält Links zu Anleitungen zur Clusterbereitstellung für jeden empfohlenen Maschinentyp.
| Arbeitslasten | Empfehlungen | Leitfaden für die Clusterbereitstellung | |
|---|---|---|---|
| Maschinentyp | Orchestrator | ||
| Grenzlinieninferenz mit mehreren Hosts |
|
GKE | KI-optimierten GKE-Cluster mit Standardkonfiguration erstellen |
| Slurm | |||
| Inferenz für große Modelle | A3 Ultra (NVIDIA H200 141 GB) | GKE | KI-optimierten GKE-Cluster mit Standardkonfiguration erstellen |
| Slurm | |||
| Inferenz für große Modelle |
|
GKE | GPU-Netzwerkbandbreite in Clustern im Standard-Modus maximieren |
| Slurm | |||
Empfohlene Beschleuniger (einzelner Host)
In der Tabelle sind die Beschleuniger aufgeführt, die wir für die Grenzschichtinferenz auf einem einzelnen Host empfehlen. Die Tabelle enthält Links zu VM-Bereitstellungsanleitungen für jeden empfohlenen Maschinentyp.
| Arbeitslasten | Empfehlungen | Bereitstellungsanleitung für VMs | |
|---|---|---|---|
| Maschinentyp | Orchestrator | ||
| Grenz- und Mainstream-Inferenz mit einem einzelnen Host |
|
– | A4- oder A3 Ultra-Instanz erstellen |
|
A3 High- oder A3 Edge-Instanz erstellen | ||
| G4 (NVIDIA RTX PRO 6000) | G4-Instanz erstellen | ||
| A2 (NVIDIA A100) | A2-Instanz erstellen | ||
| G2 (NVIDIA L4) | G2-Instanz erstellen | ||
| N1 (NVIDIA T4 oder V100) | N1-Instanz erstellen | ||
Empfohlene Nutzungsoption
Verwenden Sie für die Inferenz entweder eine Reservierung mit langer Laufzeit oder eine vorausschauende Reservierung im Kalendermodus. Weitere Informationen zu den Verbrauchsoptionen finden Sie unter Verbrauchsoption auswählen.
Empfehlungen für kleine oder mittelgroße Modelle
Bei ML-Arbeitslasten mit kleinen bis mittelgroßen Modellen ist ein optimales Gleichgewicht zwischen Preis und Leistung von entscheidender Bedeutung.
Empfohlene Beschleuniger
Die folgende Tabelle enthält die empfohlenen Beschleuniger für ML-Arbeitslasten mit kleinen bis mittelgroßen Modellen.
| Arbeitslasten | Empfehlungen | Bereitstellungsanleitung für VMs | |
|---|---|---|---|
| Maschinentyp | Orchestrator | ||
| ML für kleine oder mittelgroße Modelle | G4 (NVIDIA RTX PRO 6000) | – | G4-Instanz erstellen |
| G2 (NVIDIA L4) | G2-Instanz erstellen | ||
| A2 (NVIDIA A100) | A2-Instanz erstellen | ||
| A3 Edge (NVIDIA H100 80 GB) | A3 Edge-Instanz erstellen | ||
| N1 (NVIDIA T4 oder V100) | N1-Instanz erstellen | ||
Empfehlungen für HPC
Für HPC-Arbeitslasten eignet sich jede beschleunigungsoptimierte Maschinenserie oder computing-optimierte Maschinenserie. Wenn Sie eine beschleunigungsoptimierte Maschinenserie verwenden, hängt die beste Lösung davon ab, wie viel Rechenaufwand an die GPU ausgelagert werden muss. Eine detaillierte Liste mit Empfehlungen für HPC-Arbeitslasten finden Sie unter Best Practices zum Ausführen von HPC-Arbeitslasten.
Zusammenfassung der Empfehlungen
In der folgenden Tabelle sind die empfohlenen Beschleuniger und Verbrauchsoptionen für die einzelnen Arbeitslasten zusammengefasst.
| Ressource | Empfehlung |
|---|---|
| Modell-Vortraining | |
| Maschinenfamilie | Verwenden Sie einen der folgenden beschleunigungsoptimierten Maschinentypen: A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 GB), A3 Mega (NVIDIA H100 80 GB) oder A3 High (NVIDIA H100 80 GB). |
| Nutzungsoption | „Standardmäßige vorausschauende Reservierungen verwenden“ |
| Modellabstimmung | |
| Maschinenfamilie | Verwenden Sie die beschleunigungsoptimierten Maschinentypen A3 Ultra (NVIDIA H200 mit 141 GB), A3 Mega (NVIDIA H100 mit 80 GB) oder A3 High (NVIDIA H100 mit 80 GB). |
| Nutzungsoption | „Standardmäßige vorausschauende Reservierungen verwenden“ |
| Inferenz | |
| Maschinenfamilie | Verwenden Sie einen der folgenden Maschinentypen: A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 GB), A3 Mega (NVIDIA H100 80 GB), A3 High (NVIDIA H100 80 GB), G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 80 GB) oder N1 (NVIDIA T4 oder V100) |
| Nutzungsoption | Reservierungen, On-Demand- oder Spot-Instanzen verwenden |
| ML für kleine oder mittelgroße Modelle | |
| Maschinenfamilie | Verwenden Sie einen der folgenden Maschinentypen: G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 80 GB) oder N1 (NVIDIA T4 oder V100). |
| Nutzungsoption | On-Demand-, Spot- oder Standardreservierungen verwenden |
| Speicher | Cloud Storage FUSE verwenden |
| HPC (Hochleistungs-Computing) | |
| Zusammenfassung der Best Practices zum Ausführen von HPC-Arbeitslasten | |
Nächste Schritte
- KI-optimierten GKE-Cluster erstellen
- Vollständig verwalteten Slurm-Cluster erstellen
- KI-optimierte Instanz erstellen