AI Hypercomputer bietet eine vertikal integrierte Infrastruktur, die für anspruchsvolle Arbeitslasten im Bereich künstliche Intelligenz (KI) und maschinelles Lernen (ML) optimiert ist. Leistungsstarke NVIDIA-GPUs werden danach kategorisiert, wie das System ihre Lebenszyklusereignisse und Wartung verarbeitet: Allgemeine GPUs und Cluster-GPUs.
Informationen zum Ermitteln der optimalen Infrastrukturkategorie für Ihre Arbeitslast finden Sie unter Beschleunigerinfrastruktur auswählen.
Allgemeine GPUs
Allgemeine GPUs werden als unabhängige Rechen einheiten verwaltet. Dazu werden Standard-Compute Engine- und Google Kubernetes Engine (GKE)-APIs verwendet, um sie direkt in die Steuerungsebene von Google Cloudzu integrieren.
Zu den allgemeinen GPUs gehören die folgenden Maschinenserien:
- A3 High mit 1, 2 oder 4 (NVIDIA H100)-GPUs: Optimiert für Standard-Trainings- und Inferenzarbeitslasten, für die kein synchronisierter Cluster mit 8 GPUs erforderlich ist.
- A3 Edge (NVIDIA H100): Optimiert für die Inferenz, die mit hohem Durchsatz auf mehrere Hosts verteilt wird, und verwendet dabei das Standard-VPC-Netzwerk.
- A2 (NVIDIA A100): Optimiert für die Bereitstellung auf einem einzelnen Knoten mit hoher Leistung und für die Feinabstimmung im kleinen Maßstab.
- G4 (NVIDIA RTX PRO 6000): Optimiert für kostengünstige Inferenz- und Grafikarbeitslasten der Einstiegsklasse.
- G2 (NVIDIA L4): Optimiert für Mainstream-Inferenz und RAG.
- N1 (NVIDIA T4 oder V100): Optimiert für Inferenz- und Forschungsaufgaben der Einstiegsklasse, bei denen die Kosten wichtiger sind als leistungsstarke Verbindungen.
Cluster-GPUs
Cluster-GPUs werden als einzelnes, eng gekoppeltes System aus Tausenden von miteinander verbundenen Beschleunigern mit Cluster Director verwaltet.
Zu den Cluster-GPUs gehören die folgenden Maschinenserien:
- A4X Max (NVIDIA GB300): Entwickelt für das Training im Exascale-Bereich auf Bare-Metal-Systemen und für Hochleistungs-Computing, mit NVIDIA GB300 Grace Blackwell Ultra-Superchips.
- A4X (NVIDIA GB200) und A4 (NVIDIA B200): Entwickelt für das Training von Foundation Models und das Training von Foundation Models im Exascale-Bereich.
- A3 Ultra (NVIDIA H200), A3 Mega (NVIDIA H100) und A3 High mit 8 (NVIDIA H100)-GPUs: Optimiert für verteiltes Training im großen Maßstab und Inferenz mit mehreren Hosts mit riesigen Datentabellen.
Überlegungen zur GPU-Leistung
Um die Leistung Ihrer Arbeitslast zu bewerten und zu optimieren, können Sie Messwerte auf Hardwareebene wie die Auslastung von CUDA- und Tensor-Cores verfolgen. Informationen zum Überwachen Ihrer Ressourcen und zum Bewerten der Leistung in allgemeinen und Cluster-Umgebungen finden Sie unter:
- Monitoring-Dashboards: Verfolgen Sie die GPU Auslastung und die Arbeitsspeichernutzung in Echtzeit für einzelne eigenständige Instanzen oder orchestrierte Clusterflotten.
- Rezepte für Goodput-Messwerte: Messen Sie den Prozentsatz der Zeit, in der Ihre Beschleuniger nützliche Berechnungen ausführen im Vergleich zum System-Overhead. Dies wird für verteiltes Training im großen Maßstab auf Cluster-Hardware dringend empfohlen.
Nächste Schritte
- Informationen zum Bewerten Ihrer Infrastrukturanforderungen finden Sie unter Beschleunigerinfrastruktur auswählen.
- Informationen zum Prozess und zu den Entscheidungen, die Sie beim Starten eines Clusters treffen müssen, finden Sie unter KI-Infrastruktur planen und erstellen.