AI Hypercomputer ist ein integriertes Supercomputing-System, das für Ihre Arbeitslasten im Bereich künstliche Intelligenz (KI) und maschinelles Lernen (ML) optimiert ist. Es ist das einheitliche Portfolio für Google Clouddie KI-Infrastruktur von und bietet einen zentralen Einstiegspunkt, um leistungsoptimierte Hardware, offene Software und flexible Nutzungsmodelle zu erkunden, zu konfigurieren und bereitzustellen.
AI Hypercomputer umfasst Systemdesign und Best Practices, um die Effizienz über den gesamten KI-Entwicklungszyklus hinweg zu steigern – von Prototyping und Entwicklung bis hin zu Training im großen Maßstab und Bereitstellung in Echtzeit.
Systemarchitektur
AI Hypercomputer integriert diese drei Komponenten vertikal, um den Goodput zu maximieren. Der Goodput ist ein Maß für die tatsächliche Produktivität beim maschinellen Lernen:
- Leistungsoptimierte Infrastruktur: bietet Beschleuniger (NVIDIA-GPUs
und Google Cloud -TPUs), Netzwerke und Speicherressourcen.
- GPUs: werden danach kategorisiert, wie das System ihre Lebenszyklusereignisse
und Wartung verarbeitet:
- Allgemeine GPUs: Infrastruktur , die als unabhängige Compute-Einheiten mit asynchroner Wartung verwaltet wird.
- Cluster-GPUs: Hochleistungs cluster, die als einzelnes, eng gekoppeltes System mit synchronisierter Wartung verwaltet werden.
- TPUs: verwenden Hardware, die für die Ausführung großer Matrixoperationen entwickelt wurde, und haben einen On-Chip-Arbeitsspeicher mit hoher Bandbreite (HBM) für größere Modelle und Batch größen. TPUs können in Gruppen, sogenannten Slices, verbunden werden, die Ihre Arbeitslasten mit geringen oder gar keinen Codeänderungen skalieren. Informationen zur TPU Infrastruktur finden Sie in der Cloud TPU-Dokumentation.
- GPUs: werden danach kategorisiert, wie das System ihre Lebenszyklusereignisse
und Wartung verarbeitet:
- Offene Software: bietet optimierte Versionen von Frameworks für maschinelles Lernen
(PyTorch, JAX und TensorFlow) und Orchestrierungsplattformen. Sie haben folgende Möglichkeiten, um Ihre Beschleuniger bereitzustellen und zu verwalten:
- Google Kubernetes Engine für automatisiertes containerbasiertes Autoscaling
- Slurm über Cluster Director
- Cluster Toolkit-Blueprints
- Nutzungsoptionen: bietet flexible Bereitstellungsoptionen basierend auf Ihren
Arbeitslastanforderungen:
- Flex-Start-VMs, Spot-VMs und Reservierungen: bieten flexible Optionen für verschiedene Arbeitslasten.
- Dynamic Workload Scheduler: bietet atomare Bereitstellung für ganze Blöcke miteinander verbundener Knoten für Training im großen Maßstab.
Vorteile
- Hohe Leistung und hoher Goodput: Optimieren Sie die Scheduling- und Laufzeitebenen um den Goodput zu maximieren. So können Beschleuniger mehr Zeit für produktive Berechnungen und weniger Zeit für System-Overhead aufwenden.
- Integrierte Zuverlässigkeit: Sie haben Zugriff auf spezielle Zuverlässigkeitsfunktionen:
- Cluster-GPUs: umfassen automatisiertes Hardware-Systemdiagnose und proaktiven Knotenaustausch.
- Allgemeine GPUs: verwenden die standardmäßige Google Cloud automatische Knotenreparatur, um die Verfügbarkeit auf Pod-Ebene für Bereitstellungs flotten aufrechtzuerhalten.
- Optimierter Speicher: Verwenden Sie Speicherdienste mit hohem Durchsatz wie Google Cloud Managed Lustre und Cloud Storage Rapid, um E/A Engpässe zu vermeiden.
Anwendungsfälle
AI Hypercomputer erfüllt die Anforderungen dieser Anwendungsfälle:
| Anwendungsfall | Beispielarbeitslasten |
|---|---|
| KI- und ML-Arbeitslasten im großen Maßstab |
|
| Inferenz und Modellbereitstellung |
|
| Prototyping und Entwicklung |
|
Nächste Schritte
- Informationen zur leistungsoptimierten Infrastruktur von AI Hypercomputer:
- Nutzungsmodelle ansehen
- Informationen zur Clusterverwaltung