Accelerator-Infrastruktur auswählen

In diesem Dokument erfahren Sie, welche Beschleunigerinfrastruktur für Ihre Arbeitslasten im Bereich künstliche Intelligenz (KI) und maschinelles Lernen (ML) optimal ist. Dabei wird die Lebenszyklusphase berücksichtigt, z. B. Prototyping im kleinen Maßstab, Inferenz in Echtzeit und umfangreiches verteiltes Training. AI Hypercomputer unterteilt Beschleunigerangebote in zwei Kategorien: allgemeine GPUs und Cluster-GPUs.

GPU-Infrastruktur

AI Hypercomputer bietet zwei verschiedene Kategorien von GPUs. Jede Kategorie hat ein eigenes Verwaltungsmodell, das bestimmt, wie das System Lebenszyklusereignisse verarbeitet, die Wartung verwaltet und das Netzwerk für Ihre Arbeitslast optimiert:

Verwaltungsmodell für allgemeine GPUs

Das Verwaltungsmodell für allgemeine GPUs ist für Arbeitslasten konzipiert, bei denen Ressourcenunabhängigkeit und Hochverfügbarkeit Priorität haben. Dieses Modell verwendet die Standard Google Cloud verwaltungsebene und bietet Teams, die bereits Compute Engine oder GKE verwenden, eine vertraute Umgebung.

  • Wartung:asynchron. Einzelne Instanzen werden unabhängig voneinander aktualisiert. In einer Bereitstellungsflotte mit mehreren Knoten hat ein Wartungsereignis auf einem Knoten keine Auswirkungen auf die Verfügbarkeit anderer Knoten. So kann der Traffic an fehlerfreie Knoten weitergeleitet werden, ohne dass der gesamte Job unterbrochen wird.

  • Primäre Anwendungsfälle:Empfohlen für Standardaufgaben wie Inferenz in Echtzeit, Modellbereitstellung, Prototyping im kleinen Maßstab und Entwicklungsumgebungen, in denen keine Supercomputer-Skalierung erforderlich ist.

Maschinenserien für allgemeine GPUs

Die folgenden Maschinenserien sind allgemeine GPUs:

  • G2 (L4)
  • G4 (RTX PRO 6000)
  • A2 (A100)
  • N1+T4
  • A3 Edge
  • A3 High (1, 2 oder 4 GPUs)

Technische Informationen zu den einzelnen Maschinen für allgemeine GPUs finden Sie unter GPU-Maschinentypen.

Verwaltungsmodell für Cluster-GPUs

Das Verwaltungsmodell für Cluster-GPUs ist eine Supercomputer-Umgebung, die für umfangreiches verteiltes Training entwickelt wurde. Ressourcen werden als einzelnes, eng gekoppeltes System mit einem Cluster-GPU-Stack verwaltet.

  • Wartung:koordiniert. Dieses Modell koordiniert Wartungsereignisse, um eng gekoppelte Arbeitslasten zu unterstützen. Für verteiltes Training können Sie die synchronisierte Wartung verwenden, bei der Updates gleichzeitig auf allen Knoten angewendet werden. So wird verhindert, dass Knotenstarts Jobs unterbrechen, und der Goodput wird maximiert. Dieses Modell bietet auch Wartungsbenachrichtigungen für 90 Tage.

  • Primäre Anwendungsfälle:Entwickelt für das Trainieren von Exascale-Foundation Models mit Billionen von Parametern oder für komplexe HPC-Simulationen (Hochleistungs-Computing) wie die Entwicklung von Arzneimitteln und die Proteinfaltung.

Maschinenserien für Cluster-GPUs

Die folgenden Maschinenserien sind Cluster-GPUs:

  • A4X
  • A4 (Blackwell)
  • A3 Ultra
  • A3 Mega
  • A3 High (8 GPUs)

Technische Informationen zu den einzelnen Maschinen für Cluster-GPUs finden Sie unter GPU-Maschinentypen.

Funktionsmatrix

Vergleichen Sie die technischen und betrieblichen Merkmale der Verwaltungsmodelle für allgemeine GPUs und Cluster-GPUs:

Merkmal Verwaltungsmodell für allgemeine GPUs Verwaltungsmodell für Cluster-GPUs
Primäre Anwendungsfälle Inferenz, Modellbereitstellung, Prototyping und Entwicklung Umfangreiches verteiltes Training und HPC
Wartung Asynchron:Unabhängige Knotenaktualisierungen ermöglichen die Umleitung des Traffics, ohne dass Jobs unterbrochen werden Koordiniert:Unterstützt clusterweite koordinierte (synchronisierte) Updates, um Knoten synchron zu halten und den Goodput zu maximieren
Zielhardware G2 (L4), G4 (RTX PRO 6000), A2 (A100), N1+T4, A3 Edge und A3 High (1, 2 oder 4 GPUs) A4X, A4 (Blackwell), A3 Ultra, A3 Mega und A3 High (8 GPUs)
Netzwerk Standard-VPC-Netzwerk über gVNIC-Schnittstellen (mit Ausnahme von A3 Edge, das GPUDirect-TCPX über mehrere VPCs verwendet) Spezialisierte Fabrics mit niedriger Latenz (RDMA, RoCE, TCPX oder NVIDIA NVLink)
Verwaltungsstack Standard Google Cloud ebene (Compute Engine oder GKE) Spezialisierter Verwaltungsstack (z. B. Cluster Director)
Zuverlässigkeit Automatische Knotenreparatur und Pod-Uptime auf Standardebene Spezialisierte Resource and Recovery Suite

Entscheidungsmatrix

Mit dieser Matrix können Sie ermitteln, welche Hardwarefamilien zu Ihrer spezifischen Arbeitslast passen:

Wenn Ihre Arbeitslast Folgendes umfasst... Empfohlene GPU-Infrastruktur Empfohlene Maschinenserie
Prototyping und Entwicklung Allgemeine GPUs G2, G4, A2, N1+T4, A3 Edge
Inferenz in Echtzeit (< 100 Mrd. Parameter) Allgemeine GPUs G2, G4, A2, N1+T4, A3 Edge
Inferenz über mehrere GPUs Cluster-GPUs A3, A4
Umfangreiches Training und Inferenz Cluster-GPUs A4, A3-Serie
Training im großen Maßstab (> 500 Mrd. Parameter) und disaggregierte Inferenz Cluster-GPUs A4X Max, A4X, A4

Einen detaillierten Entscheidungsbaum, der Modellarchitekturen direkt Hardware zuordnet, finden Sie unter Beschleuniger auswählen.

Nachdem Sie diese Hauptkriterien festgelegt haben, wählen Sie eine Orchestrierungsplattform aus. Diese Wahl hängt davon ab, ob Ihr Team eine automatisierte Verwaltung oder eine detaillierte Kontrolle über das Betriebssystem und die Treiber bevorzugt.

Nächste Schritte