Cluster-GPUs wie die Maschinenserien A4X Max, A4X, A4, A3 Ultra, A3 Mega, und A3 High (8 GPUs) wurden entwickelt, um die Ausführung von KI-Clustern (künstliche Intelligenz) und ML-Clustern (maschinelles Lernen) im großen Maßstab zu ermöglichen. Sie bieten die folgenden Funktionen für die Clusterverwaltung:

Die meisten Funktionen für die Clusterverwaltung werden nur für reservierungsgebundene Kapazitätunterstützt. Das ist die Infrastruktur, die das reservierungsgebundene Bereitstellungsmodellverwendet, das nur Cluster-GPU-Maschinentyen unterstützt. Für Kapazität, die ein anderes Bereitstellungsmodell verwendet, sind nur die folgenden Funktionen für die Clusterverwaltung verfügbar:

Colocation von KI-Infrastrukturressourcen

Wenn Sie Cluster-GPUs wie A4X Max, A4X, A4, A3 Ultra, A3 Mega und A3 High (8 GPUs) verwenden, können Sie Hostmaschinen anfordern, die von Compute Engine so nah wie möglich beieinander bereitgestellt werden. Diese Maschinen bieten die folgenden Funktionen:

Diese Ressourcenanordnung minimiert Netzwerk-Hops und optimiert die niedrigste Netzwerklatenz. Wenn Sie Blöcke von beschleunigungsoptimierten Maschinen bereitstellen möchten, die von Compute Engine dicht zugewiesen werden, haben Sie folgende Möglichkeiten:

Platzierung unter Berücksichtigung der Clustertopologie

Nachdem Sie Cluster-GPUs erstellt haben, können Sie Topologieinformationen auf Knoten- und Clusterebene abrufen. Diese Informationen helfen Ihnen bei Folgendem:

  • Anpassen des Designs Ihrer Anwendung oder Arbeitslast, um die Netzwerklatenz weiter zu minimieren

  • Verstehen und Beheben von Problemen mit Netzwerklatenz und ‑leistung für Instanzen, die häufig miteinander kommunizieren Diese Probleme können auftreten, wenn sich die Instanzen unerwartet weit voneinander entfernt befinden.

Topologieinformationen werden folgendermaßen unterstützt:

  • Topologieinformationen funktionieren am besten mit reservierungsgebundener Kapazität. Diese ist erforderlich, um die Topologie einer Reservierung anzusehen.

  • Bei Spot-VMs werden Topologieinformationen nur angezeigt, wenn eine Maschine eine Richtlinie für kompakte Platzierung oder eine Arbeitslastrichtlinie verwendet.

Weitere Informationen finden Sie unter:

Clusterbetriebsmodus

Wenn Sie reservierungsgebundene Kapazität reservieren, um Compute-Instanzen oder ‑Cluster zu erstellen, bestimmt der reservierte Maschinentyp den Betriebsmodus des Clusters für die Instanzen. In diesem Modus wird festgelegt, wie sich Ihre Instanzen nach Hostfehlern oder fehlerhaften Hostberichten verhalten. Die verfügbaren Betriebsmodi für eine Instanz sind der verwaltete Modus, in dem Compute Engine alle fehlerhaften Maschinen automatisch ersetzt, aber einen Teil der reservierten Kapazität zurückhält, damit Ihre Instanzen die erforderlichen Ressourcen für den Neustart haben. Oder der Modus mit voller Kapazität, in dem Sie Zugriff auf die gesamte reservierte Kapazität haben, aber für die Verwaltung von Fehlern und geplanter Wartung verantwortlich sind.

Weitere Informationen finden Sie unter Betriebsmodus der Reservierung.

Clusterwartungsplanung und ‑steuerung

Sie steuern die Wartung von Cluster-GPUs mithilfe der topologieabhängigen Planung in einem Ressourcenblock. Mit dieser Funktion können Sie Upgrades synchronisieren, damit Ihre Arbeitslasten widerstandsfähiger gegen Hostereignisse sind und Unterbrechungen minimiert werden. Dieser Ansatz trägt dazu bei, den Nutzdurchsatz Ihrer Arbeitslast zu verbessern.

Um die vollständige Kontrolle über Wartungsereignisse zu haben, können Sie die folgenden Funktionen verwenden:

Wartungsplanungstyp

Wenn Sie reservierungsgebundene Kapazität reservieren, um Compute-Instanzen oder ‑Cluster von Cluster-GPUs zu erstellen, können Sie festlegen, wie Compute Engine die Infrastruktur wartet, auf der Ihre Instanzen ausgeführt werden. Je nach Maschinentyp, den Sie für Ihre Instanzen verwenden möchten, können Sie zwischen synchronisierter Wartung für alle Instanzen (gruppiert) oder unterschiedlichen Wartungsplänen (unabhängig) wählen.

Weitere Informationen finden Sie unter Wartungsplanungstypen.

Hostereignisse verwalten

Nachdem Sie Cluster-GPUs erstellt und Ihre Arbeitslast gestartet haben, können Sie Benachrichtigungen einrichten und erhalten, wenn die Wartung für Ihre Instanzen oder reservierten Blöcke geplant, gestartet oder abgeschlossen ist. Sie können die Wartung auch vor dem geplanten Zeitpunkt für eine Instanz oder einen reservierten Block ansehen und bei Bedarf manuell starten. Mit diesen Optionen können Sie Ausfallzeiten für Ihre Arbeitslasten proaktiv steuern und minimieren.

Weitere Informationen finden Sie unter:

Cluster-Monitoring- und Diagnosetools

Für Monitoring und Fehlerbehebung umfassen Cluster-GPU-Maschinentypen die folgenden Dienste für reservierungsgebundene Kapazität:

Nächste Schritte