Terminologie

Die folgenden Nutzungsbedingungen gelten für AI Hypercomputer.

Beschleuniger
Ein spezialisiertes Hardwaregerät wie eine GPU oder TPU, das bestimmte Aufgaben wie Machine-Learning-Arbeitslasten effizienter ausführen kann als ein Allzweckprozessor.

Block
Eine Sammlung von Unterblöcken, die über ein nicht blockierendes Hochgeschwindigkeitsnetzwerk miteinander verbunden sind und eine hohe Bandbreite für alle Hostmaschinen im Block bieten.

Cluster
Eine Sammlung von Blöcken, die über ein Hochgeschwindigkeitsnetzwerk miteinander verbunden sind. Jeder Cluster ist global eindeutig. Bei A4X-, A4-, A3 Ultra-, A3 Mega- und A3 High-Maschinen (8 GPUs) bietet ein Cluster ein gemeinsames, nicht blockierendes Netzwerk für Ihre Blöcke mit Beschleunigerkapazität. Innerhalb eines Clusters ist die Kommunikation zwischen Knoten (Ost-West Traffic) für die gesamte Sammlung von Blöcken nicht blockierend.

Cluster-GPU
Eine Kategorie von Maschinenfamilien für GPUs, einschließlich A4X, A4, A3 Ultra, A3 Mega und A3 High (8 GPUs). Mit Cluster-GPUs können Teams Tausende von miteinander verbundenen Beschleunigern als ein einziges, eng gekoppeltes System bereitstellen und skalieren. Dazu werden spezielle Netzwerkstrukturen und synchronisierte Wartung verwendet. Sie eignen sich ideal für Arbeitslasten, die eine extreme Rechenleistung, viel Arbeitsspeicher und eine schnelle Netzwerksynchronisierung erfordern. Zu den häufigen Anwendungsfällen gehören das Vortrainieren von Foundation Models mit Billionen von Parametern, das Bereitstellen von Frontier Models und Simulationen für die Arzneimittelforschung.

Notfallwartung
Wird manchmal auch als Notwartung bezeichnet. Ein ungeplanter Wartungsvorgang, der durch ein kritisches Hardware-, Software- oder Sicherheitsproblem verursacht wird. Bei unterstützten Beschleunigermaschinen wird bei einer Notfallwartung eine Vorabbenachrichtigung gesendet, anstatt dass es zu einer sofortigen Unterbrechung kommt. So haben Sie Zeit, Ihre Arbeitslasten ordnungsgemäß zu beenden und optional die Reparatur auszulösen, bevor das System die VMs beendet.

Allgemeine GPU
Eine Kategorie von GPU-Maschinenfamilien, einschließlich G2, G4, A2, N1+T4 und A3 Edge. Mit allgemeinen GPUs können Teams NVIDIA-Beschleuniger mit vollständiger betrieblicher Autonomie bereitstellen und skalieren, ohne sich mit der architektonischen Komplexität koordinierter Supercomputer-Cluster auseinandersetzen zu müssen. Sie eignen sich ideal für Arbeitslasten, bei denen hohe Verfügbarkeit, Self-Service-Bereitstellung und unabhängige Skalierung im Vordergrund stehen. Zu den häufigen Anwendungsfällen gehören Echtzeit-Inferenz, RAG, Prototyping und das Training kleiner bis mittelgroßer Modelle.

Netzwerkstruktur
Eine Hochgeschwindigkeitsnetzwerkinfrastruktur, die eine hohe Bandbreite und niedrige Latenz für alle Blöcke und Google Cloud Dienste in einem Cluster bietet. Die Struktur verwendet die Architektur des Jupiter Netzwerks. Zur Optimierung der Leistung werden in der Struktur softwaredefinierte Netzwerk- und optische Switches verwendet.

Knoten oder Host
Ein einzelner physischer Server im Rechenzentrum. Jedem Host sind Rechenressourcen wie Beschleuniger zugeordnet. Anzahl und Konfiguration dieser Rechenressourcen hängen von der Maschinenfamilie ab. Compute Engine-Instanzen werden auf einem physischen Host bereitgestellt.

Eine NVLink-Domain, auch Unterblock genannt, ist die Kerneinheit der Kapazität für A4X Max- und A4X-Maschinen. Eine NVLink-Domain besteht aus 18 A4X Max- oder A4X-Instanzen (72 GPUs), die über ein NVLink-System mit mehreren Knoten verbunden sind.

Unterblock
Eine Gruppe von Hosts und zugehöriger Verbindungshardware, die sich in einem einzigen physischen Block befinden. Im Zusammenhang mit A4X Max- und A4X-Maschinen wird ein Unterblock auch als NVLink-Domain bezeichnet.

Superblock
Eine physische Gruppierung miteinander verbundener Maschinen in Rechenzentren. Wenn Sie Maschinen in einem Superblock platzieren, erreichen Sie den extremen Netzwerkdurchsatz und die Latenz im Submillisekundenbereich, die für die Ausführung eng gekoppelter Trainingsarbeitslasten erforderlich sind.

Weitere Informationen

In den folgenden Dokumenten finden Sie weitere Erklärungen zu den Begriffen, die für die entsprechenden Themen relevant sind: