Nutzungsoptionen für AI Hypercomputer

AI Hypercomputer bietet verschiedene Nutzungsoptionen für den Erwerb von Rechenressourcen. Diese Optionen berücksichtigen Anforderungen wie die Dauer der Arbeitslast, Fehlertoleranz und das Infrastrukturmodell. Informieren Sie sich über diese Optionen und wählen Sie die beste für Ihren Anwendungsfall aus.

Übersicht der Nutzungsoptionen

In der folgenden Tabelle können Sie die Nutzungsoptionen anhand wichtiger Merkmale vergleichen:

Nutzungsoption Bereitstellungsmodell Optimal für Kapazitätsgarantie Lebensdauer Auf Abruf Quota Rabatte Zuweisungsmodell
Flex-Start Flex-Start Kurze Arbeitslasten von bis zu sieben Tagen, die auf Kapazität warten können. Best-Effort-Ansatz Bis zu sieben Tage Nein Kontingent auf Abruf Rabatt (bis zu 53%) auf unterstützte Serien Vollbesetzt für Anfragen zur Größenanpassung von MIGs; Best-Effort-Ansatz für eigenständige VMs.
Spot-VMs Spot Fehlertolerante, kurze Arbeitslasten mit allgemeinen GPUs. Best-Effort-Ansatz Auf Abruf Ja Kontingent auf Abruf Hoher Rabatt (bis zu 91%) Standard
Standardreservierungen Standard Kritische Arbeitslasten mit allgemeinen GPUs, die eine sehr hohe Kapazitätsgarantie erfordern. Sehr hoch Sehr hoch Benutzerdefiniert Nein Kein Kontingentverbrauch Rabattierte Preise mit Rabatten für zugesicherte Nutzung (CUDs)
Vorausschauende Reservierungen für Kapazitätsblöcke Reservierungsgebunden Umfangreiches, lang laufendes Training auf Cluster-GPUs. Sehr hoch Unbegrenzt innerhalb des Reservierungszeitraums. Nein Automatisch erhöht Rabatt (bis zu 53%) mit CUDs Vollbesetzt
Vorausschauende Reservierungen im Kalendermodus Reservierungsgebunden Cluster-GPU-Arbeitslasten von bis zu 90 Tagen, für die reservierte Kapazität erforderlich ist. Sehr hoch Bis zu 90 Tage Nein Kein Kontingentverbrauch Rabatt (bis zu 53%) Vollbesetzt
On-Demand-VMs Standard Arbeitslasten mit allgemeinen GPUs ohne bestimmte Dauer. Best-Effort-Ansatz Unbegrenzt Nein On-Demand-Kontingent Keine (Pay as you go) Standard

Die Nutzungsoption, die Sie zum Bereitstellen Ihrer Infrastruktur verwenden, hängt davon ab, ob Sie allgemeine GPUs oder Cluster-GPUs verwenden.

  • Allgemeine GPUs: für kleinere Inferenz-, Entwicklungs- und kleinere Trainingsarbeitslasten. Diese Art von GPU bietet betriebliche Flexibilität durch asynchrone Wartung. Die verfügbaren Optionen finden Sie unter Nutzungsoptionen für allgemeine GPUs.

  • Cluster-GPUs: für umfangreiche, eng gekoppelte Trainingsarbeitslasten und umfangreiche Inferenz-, RL- und Reasoning-Modellarbeitslasten, die eine hohe Kapazitätsgarantie und eine dichte Ressourcenzuweisung erfordern, um die Netzwerklatenz zu minimieren. Die verfügbaren Optionen finden Sie unter Nutzungsoptionen für Cluster-GPUs.

Nutzungsoptionen für allgemeine GPUs

Verwenden Sie die folgenden Nutzungsoptionen, um Kapazität für allgemeine GPUs zu erwerben.

Flex-Start verwenden

Wenn Sie kurze Arbeitslasten ausführen möchten, für die dicht zugewiesene Ressourcen erforderlich sind, können Sie mit Flex-Start Rechen ressourcen für bis zu sieben Tage anfordern. Sobald Ressourcen verfügbar sind, erstellt Compute Engine die von Ihnen angeforderte Anzahl von VMs. Sie können eigenständige Flex-Start-VMs beenden, aber keine Flex-Start-VMs, die von einer verwalteten Instanz gruppe (MIG) über Anfragen zur Größenanpassung erstellt wurden. Flex-Start-VMs sind so lange vorhanden, bis Sie sie löschen oder bis Compute Engine die VMs am Ende ihrer Ausführungsdauer löscht.

Geeignete Arbeitslasten

  • Vortraining kleiner Modelle
  • Modellabstimmung
  • HPC-Simulation (Hochleistungs-Computing)
  • Batchinferenz

Wichtige Merkmale

  • Bereitstellungsmodell: Flex-Start.
  • Breite Hardwareunterstützung: Fordern Sie einen beliebigen Cluster-GPU Maschinentyp an, außer A4X Max und A4X.
  • Latenzoptimierung: Wenden Sie eine Richtlinie für kompakte Platzierung auf eigenständige VMs an, um die Netzwerklatenz zu minimieren.
  • Kosteneffizienz: Sie erhalten einen Rabatt von bis zu 53% auf vCPUs, Arbeitsspeicher, GPUs, und lokale SSDs für die Maschinenreihen A4, A3, A2 und G4. Für andere unterstützte Serien gelten die Standard-On-Demand-Preise. Weitere Informationen finden Sie unter Flex-Start-Preise.

Spot verwenden

Wenn Sie fehlertolerante Arbeitslasten ausführen möchten, können Sie Rechenressourcen sofort basierend auf Verfügbarkeit erhalten. Sie erhalten Ressourcen zum niedrigstmöglichen Preis. Compute Engine kann VMs jedoch jederzeit vorzeitig beenden, um Kapazitäten freizugeben.

Geeignete Arbeitslasten

  • Batchverarbeitung und Datenanalyse
  • Hochleistungs-Computing (HPC) und Media-Encoding

Wichtige Merkmale

  • Bereitstellungsmodell: Spot.
  • Breite Hardwareunterstützung: Fordern Sie einen beliebigen Cluster-GPU Maschinentyp an, außer A4X Max und A4X.
  • Latenzoptimierung: Wenden Sie eine Richtlinie für kompakte Platzierung auf eigenständige VMs an, um die Netzwerklatenz zu minimieren.
  • Kosteneffizienz: Sie erhalten einen Rabatt von bis zu 91% auf vCPUs, Arbeitsspeicher, GPUs, und lokale SSDs.

On demand verwenden

Tipp: Wenn Sie Ihre Chancen auf allgemeine GPU-Kapazität erhöhen möchten, verwenden Sie Flex-Start oder Spot. Diese Nutzungsoptionen bieten GPUs zu einem reduzierten Preis im Vergleich zu On-Demand-Preisen und wurden entwickelt, um Ihre Chancen auf stark nachgefragte Ressourcen wie GPUs zu erhöhen.

Wenn Sie Arbeitslasten ohne bestimmte Dauer ausführen möchten, können Sie Rechenressourcen sofort basierend auf der Verfügbarkeit erhalten. VMs werden ausgeführt, bis Sie sie beenden oder löschen.

Geeignete Arbeitslasten

  • Inferenz und Modellbereitstellung
  • Prototyping und Tests

Wichtige Merkmale

  • Bereitstellungsmodell: Standard.
  • Sofortige Verfügbarkeit: Erstellen Sie sofort VM-Instanzen, ohne auf die Kapazitätsplanung oder Genehmigung zu warten.
  • Standardpreise: Zahlen Sie für Ressourcen zu Standard-On-Demand-Preisen ohne langfristige Verpflichtungen.
  • Breite Hardwareunterstützung: Kann mit jeder unterstützten GPU-Maschinenserie im allgemeinen GPU-Pfad verwendet werden.

Standardreservierungen verwenden

Wenn Sie kritische Arbeitslasten mit allgemeinen GPUs ausführen möchten, die eine sehr hohe Kapazitätsgarantie erfordern, können Sie Standardreservierungen verwenden.

Geeignete Arbeitslasten

  • Kritische Produktionsarbeitslasten
  • Arbeitslasten, die zugesicherte Kapazität erfordern

Wichtige Merkmale

  • Bereitstellungsmodell: Standard.
  • Kapazitätsgarantie: Bietet eine sehr hohe Garantie, dass Ressourcen verfügbar sind.
  • Preise: Es gelten die Standardpreise, aber Sie können CUDs für Einsparungen anhängen.

Nutzungsoptionen für Cluster-GPUs

Verwenden Sie die folgenden Nutzungsoptionen, um Kapazität für Cluster-GPUs zu erwerben.

Vorausschauende Reservierungen für Kapazitätsblöcke verwenden

Wenn Sie lang laufende, umfangreiche verteilte Arbeitslasten ausführen möchten, für die dicht zugewiesene Ressourcen erforderlich sind, können Sie Rechenressourcen für einen bestimmten Zeitpunkt in der Zukunft anfordern. Sie haben für diesen Zeitraum exklusiven Zugriff auf Ihre reservierten Ressourcen und können die Ressourcen verwenden, um VMs oder Cluster zu erstellen. Am Ende des Reservierungszeitraums führt Compute Engine folgende Schritte aus:

  • Compute Engine löscht die Reservierung.
  • Basierend auf der Beendigungsaktion die Sie für die VMs angeben, beendet oder löscht Compute Engine alle VMs, die die Reservierung verwenden.

Geeignete Arbeitslasten

  • Vortraining von Foundation Models
  • Inferenz für Foundation Models auf mehreren Hosts

Wichtige Merkmale

  • Bereitstellungsmodell: Reservierungsgebunden.
  • Unterstützung für Premium-Maschinen: Reservieren Sie Maschinentypen vom Typ A4X Max, A4X, A4, A3 Ultra, A3 Mega oder A3 High (8 GPUs).
  • Verpflichtungsanforderungen: Hängen Sie eine ressourcenbasierte Verpflichtung für Reservierungen von einem Jahr oder länger an.
  • Dynamische Änderungen: Aktivieren Sie Benachrichtigungen zur Notfallwartung der Hardware für die Nutzung von Vertex AI-Jobs nach Beginn des Zeitraums.

Vorausschauende Reservierungen im Kalendermodus verwenden

Wenn Sie kurze verteilte Arbeitslasten ausführen möchten, für die dicht zugewiesene Ressourcen erforderlich sind, können Sie Rechenressourcen für bis zu 90 Tage anfordern. Sie haben für diesen Zeitraum exklusiven Zugriff auf Ihre reservierten Ressourcen und können die Ressourcen verwenden, um VMs oder Cluster zu erstellen. Am Ende des Reservierungszeitraums führt Compute Engine folgende Schritte aus:

  • Compute Engine löscht die Reservierung.
  • Basierend auf der Beendigungsaktion die Sie für die VMs angeben, beendet oder löscht Compute Engine alle VMs, die die Reservierung verwenden.

Geeignete Arbeitslasten

  • Vortraining und Feinabstimmung
  • Umfangreiche Simulationen und Inferenz

Wichtige Merkmale

  • Bereitstellungsmodell: Reservierungsgebunden.
  • Unterstützung für Maschinenreihen: Reservieren Sie Maschinentypen vom Typ A4, A3 Ultra, A3 Mega oder A3 High (8 GPUs) Maschinentypen.
  • Skalierbarkeitslimits: Reservieren Sie bis zu 80 VMs für maximal 90 Tage.
  • Optimierte Bereitstellung: Verwenden Sie ein reservierungsgebundenes Modell, um Ihre Chancen auf GPUs zu erhöhen.

Flex-Start verwenden

Verwenden Sie Flex-Start für Anfragen zur Größenanpassung von verwalteten Instanzgruppen (MIGs) mit Cluster-GPUs, wenn Sie dicht zugewiesene Ressourcen für bis zu sieben Tage benötigen.

Geeignete Arbeitslasten

Flex-Start-VMs sind ideal für die Ausführung von Arbeitslasten, die jederzeit gestartet werden können, z. B.:

  • Vortraining kleiner Modelle
  • Modellabstimmung
  • HPC-Simulation (Hochleistungs-Computing)
  • Batchinferenz

Wichtige Merkmale

  • Bereitstellungsmodell: Flex-Start.
  • Ressourcenzuweisung: Dicht zugewiesen für Anfragen zur Größenanpassung von MIGs.
  • Kosteneffizienz: Sie erhalten einen Rabatt von bis zu 53% auf vCPUs, Arbeitsspeicher, GPUs, und alle angehängten lokalen SSDs für die Maschinenreihen A4, A3, A2 und G4. Für andere unterstützte Serien gelten die Standard-On-Demand-Preise.

Spot verwenden

Sie können Spot-VMs für dicht zugewiesene, fehlertolerante Arbeitslasten verwenden, um hohe Rabatte zu erzielen, Dabei müssen Sie jedoch berücksichtigen, dass Compute Engine VMs vorzeitig beenden kann, um Kapazitäten freizugeben.

Geeignete Arbeitslasten

  • Fehlertolerantes verteiltes Training
  • Batchverarbeitung

Wichtige Merkmale

  • Bereitstellungsmodell: Spot.
  • Vorzeitiges Beenden: Compute Engine kann Instanzen jederzeit vorzeitig beenden.
  • Kosteneffizienz: Sie erhalten einen Rabatt von bis zu 91% auf vCPUs, Arbeitsspeicher, GPUs, und alle angehängten lokalen SSDs.

Nächste Schritte