Terminologie

Die folgenden Bedingungen gelten für AI Hypercomputer.

Accelerator
Ein spezialisiertes Hardwaregerät wie eine GPU oder TPU, das bestimmte Aufgaben wie Machine-Learning-Arbeitslasten effizienter ausführen kann als ein Prozessor für allgemeine Zwecke.

Block
Eine Sammlung miteinander verbundener Unterblöcke. Innerhalb eines Blocks ist jede GPU über das Netzwerk erreichbar, was eine Kommunikation mit extrem niedriger Latenz für Ihre verteilten Trainingsaufgaben ermöglicht.

Cluster
Eine Sammlung miteinander verbundener Blöcke, die durch ein Hochgeschwindigkeitsnetzwerk verbunden sind. Das nicht blockierende Netzwerk von Ost nach West ermöglicht es Ihnen, umfangreiche Trainingsjobs auf Tausende von GPUs zu skalieren, ohne dass es zu Leistungs- oder Bandbreitenengpässen kommt.

Clustered GPU
Eine Kategorie von Maschinenfamilien für GPUs, darunter A4X, A4, A3 Ultra, A3 Mega und A3 High (8 GPUs). Mit gruppierten GPUs können Teams Tausende von miteinander verbundenen Beschleunigern als ein einziges, eng gekoppeltes System bereitstellen und skalieren. Dazu werden spezielle Netzwerke und synchronisierte Wartung verwendet. Sie eignen sich ideal für Arbeitslasten, die extreme Rechenleistung, Arbeitsspeicher und eine schnelle Netzwerksynchronisierung erfordern. Zu den häufigen Anwendungsfällen gehören das Vortrainieren von Foundation Models mit Billionen von Parametern, das Bereitstellen von Frontier Models und Simulationen für die Arzneimittelforschung.

Emergent maintenance
Wird manchmal auch als Notfallwartung bezeichnet. Ein ungeplanter Wartungsvorgang, der durch ein kritisches Hardware-, Software- oder Sicherheitsproblem verursacht wird. Bei unterstützten Beschleuniger-Maschinentypen erhalten Sie bei einer Notfallwartung eine Vorabbenachrichtigung anstelle einer sofortigen Unterbrechung. So haben Sie Zeit, Ihre Arbeitslasten ordnungsgemäß zu beenden und optional die Reparatur auszulösen, bevor das System die VMs beendet.

General GPU
Eine Kategorie von GPU-Maschinenfamilien, darunter G2, G4, A2, N1+T4 und A3 Edge. Mit allgemeinen GPUs können Teams NVIDIA-Beschleuniger mit vollständiger betrieblicher Autonomie bereitstellen und skalieren, ohne die architektonische Komplexität koordinierter Supercomputercluster zu berücksichtigen. Sie eignen sich ideal für Arbeitslasten, bei denen Hochverfügbarkeit, Self-Service-Bereitstellung und unabhängige Skalierung im Vordergrund stehen. Zu den häufigen Anwendungsfällen gehören Echtzeitinferenz, RAG, Prototyping und das Training kleiner bis mittelgroßer Modelle.

Network fabric
Ein Netzwerk bietet eine Verbindung mit hoher Bandbreite und niedriger Latenz zwischen allen Blöcken und Google Cloud Diensten in einem Cluster. Jupiter ist die Netzwerkarchitektur von Google-Rechenzentren, die softwaredefiniertes Networking und optische Schalter verwendet, um das Netzwerk weiterzuentwickeln und seine Leistung zu optimieren.

Node or host
Ein einzelner physischer Server im Rechenzentrum. Jeder Host hat zugeordnete Rechenressourcen wie Beschleuniger. Die Anzahl und Konfiguration dieser Rechenressourcen hängt von der Maschinenfamilie ab. Compute Engine-Instanzen werden auf einem physischen Host bereitgestellt.

Eine NVLink-Domain, auch Unterblock genannt, ist die Grundeinheit der Kapazität für A4X Max- und A4X-Maschinen. Eine NVLink-Domain besteht aus 18 A4X Max- oder A4X-Instanzen (72 GPUs), die über ein NVLink-System mit mehreren Knoten verbunden sind.

Sub-block
Eine Gruppe von Hosts und zugehöriger Verbindungshardware, die sich in einem einzigen physischen Rack befinden. Im Zusammenhang mit A4X Max- und A4X-Maschinen wird ein Unterblock auch als NVLink-Domain bezeichnet.

Superblock
Eine physische Gruppierung miteinander verbundener Maschinen in Rechenzentren. Wenn Sie Maschinen in einem Superblock platzieren, erreichen Sie den extremen Netzwerkdurchsatz und die Latenz im Submillisekundenbereich, die für die Ausführung eng gekoppelter Trainingsarbeitslasten erforderlich sind.

Weitere Informationen

In den folgenden Dokumenten finden Sie weitere Erklärungen zu den Begriffen, die für die entsprechenden Themen relevant sind: