AI Hypercomputer bietet verschiedene Nutzungsoptionen für den Erwerb von Rechenressourcen. Diese Optionen berücksichtigen Anforderungen wie die Dauer der Arbeitslast, Fehlertoleranz und das Infrastrukturmodell. Informieren Sie sich über diese Optionen und wählen Sie die beste für Ihren Anwendungsfall aus.
Übersicht der Nutzungsoptionen
In der folgenden Tabelle können Sie die Nutzungsoptionen anhand wichtiger Merkmale vergleichen:
| Nutzungsoption | Bereitstellungsmodell | Optimal für | Kapazitätsgarantie | Lebensdauer | Auf Abruf | Quota | Rabatte | Zuweisungsmodell |
|---|---|---|---|---|---|---|---|---|
| Flex-Start | Flex-Start | Kurze Arbeitslasten von bis zu sieben Tagen, die auf Kapazität warten können. | Best-Effort-Ansatz | Bis zu sieben Tage | Nein | Kontingent auf Abruf | Rabatt (bis zu 53%) auf unterstützte Serien | Vollbesetzt für Anfragen zur Größenanpassung von MIGs; Best-Effort-Ansatz für eigenständige VMs. |
| Spot-VMs | Spot | Fehlertolerante, kurze Arbeitslasten mit allgemeinen GPUs. | Best-Effort-Ansatz | Auf Abruf | Ja | Kontingent auf Abruf | Hoher Rabatt (bis zu 91%) | Standard |
| Standardreservierungen | Standard | Kritische Arbeitslasten mit allgemeinen GPUs, die eine sehr hohe Kapazitätsgarantie erfordern. | Sehr hoch | Sehr hoch | Benutzerdefiniert | Nein | Kein Kontingentverbrauch | Rabattierte Preise mit Rabatten für zugesicherte Nutzung (CUDs) |
| Vorausschauende Reservierungen für Kapazitätsblöcke | Reservierungsgebunden | Umfangreiches, lang laufendes Training auf Cluster-GPUs. | Sehr hoch | Unbegrenzt innerhalb des Reservierungszeitraums. | Nein | Automatisch erhöht | Rabatt (bis zu 53%) mit CUDs | Vollbesetzt |
| Vorausschauende Reservierungen im Kalendermodus | Reservierungsgebunden | Cluster-GPU-Arbeitslasten von bis zu 90 Tagen, für die reservierte Kapazität erforderlich ist. | Sehr hoch | Bis zu 90 Tage | Nein | Kein Kontingentverbrauch | Rabatt (bis zu 53%) | Vollbesetzt |
| On-Demand-VMs | Standard | Arbeitslasten mit allgemeinen GPUs ohne bestimmte Dauer. | Best-Effort-Ansatz | Unbegrenzt | Nein | On-Demand-Kontingent | Keine (Pay as you go) | Standard |
Die Nutzungsoption, die Sie zum Bereitstellen Ihrer Infrastruktur verwenden, hängt davon ab, ob Sie allgemeine GPUs oder Cluster-GPUs verwenden.
Allgemeine GPUs: für kleinere Inferenz-, Entwicklungs- und kleinere Trainingsarbeitslasten. Diese Art von GPU bietet betriebliche Flexibilität durch asynchrone Wartung. Die verfügbaren Optionen finden Sie unter Nutzungsoptionen für allgemeine GPUs.
Cluster-GPUs: für umfangreiche, eng gekoppelte Trainingsarbeitslasten und umfangreiche Inferenz-, RL- und Reasoning-Modellarbeitslasten, die eine hohe Kapazitätsgarantie und eine dichte Ressourcenzuweisung erfordern, um die Netzwerklatenz zu minimieren. Die verfügbaren Optionen finden Sie unter Nutzungsoptionen für Cluster-GPUs.
Nutzungsoptionen für allgemeine GPUs
Verwenden Sie die folgenden Nutzungsoptionen, um Kapazität für allgemeine GPUs zu erwerben.
Flex-Start verwenden
Wenn Sie kurze Arbeitslasten ausführen möchten, für die dicht zugewiesene Ressourcen erforderlich sind, können Sie mit Flex-Start Rechen ressourcen für bis zu sieben Tage anfordern. Sobald Ressourcen verfügbar sind, erstellt Compute Engine die von Ihnen angeforderte Anzahl von VMs. Sie können eigenständige Flex-Start-VMs beenden, aber keine Flex-Start-VMs, die von einer verwalteten Instanz gruppe (MIG) über Anfragen zur Größenanpassung erstellt wurden. Flex-Start-VMs sind so lange vorhanden, bis Sie sie löschen oder bis Compute Engine die VMs am Ende ihrer Ausführungsdauer löscht.
Geeignete Arbeitslasten
- Vortraining kleiner Modelle
- Modellabstimmung
- HPC-Simulation (Hochleistungs-Computing)
- Batchinferenz
Wichtige Merkmale
- Bereitstellungsmodell: Flex-Start.
- Breite Hardwareunterstützung: Fordern Sie einen beliebigen Cluster-GPU Maschinentyp an, außer A4X Max und A4X.
- Latenzoptimierung: Wenden Sie eine Richtlinie für kompakte Platzierung auf eigenständige VMs an, um die Netzwerklatenz zu minimieren.
- Kosteneffizienz: Sie erhalten einen Rabatt von bis zu 53% auf vCPUs, Arbeitsspeicher, GPUs, und lokale SSDs für die Maschinenreihen A4, A3, A2 und G4. Für andere unterstützte Serien gelten die Standard-On-Demand-Preise. Weitere Informationen finden Sie unter Flex-Start-Preise.
Spot verwenden
Wenn Sie fehlertolerante Arbeitslasten ausführen möchten, können Sie Rechenressourcen sofort basierend auf Verfügbarkeit erhalten. Sie erhalten Ressourcen zum niedrigstmöglichen Preis. Compute Engine kann VMs jedoch jederzeit vorzeitig beenden, um Kapazitäten freizugeben.
Geeignete Arbeitslasten
- Batchverarbeitung und Datenanalyse
- Hochleistungs-Computing (HPC) und Media-Encoding
Wichtige Merkmale
- Bereitstellungsmodell: Spot.
- Breite Hardwareunterstützung: Fordern Sie einen beliebigen Cluster-GPU Maschinentyp an, außer A4X Max und A4X.
- Latenzoptimierung: Wenden Sie eine Richtlinie für kompakte Platzierung auf eigenständige VMs an, um die Netzwerklatenz zu minimieren.
- Kosteneffizienz: Sie erhalten einen Rabatt von bis zu 91% auf vCPUs, Arbeitsspeicher, GPUs, und lokale SSDs.
On demand verwenden
Tipp: Wenn Sie Ihre Chancen auf allgemeine GPU-Kapazität erhöhen möchten, verwenden Sie Flex-Start oder Spot. Diese Nutzungsoptionen bieten GPUs zu einem reduzierten Preis im Vergleich zu On-Demand-Preisen und wurden entwickelt, um Ihre Chancen auf stark nachgefragte Ressourcen wie GPUs zu erhöhen.
Wenn Sie Arbeitslasten ohne bestimmte Dauer ausführen möchten, können Sie Rechenressourcen sofort basierend auf der Verfügbarkeit erhalten. VMs werden ausgeführt, bis Sie sie beenden oder löschen.
Geeignete Arbeitslasten
- Inferenz und Modellbereitstellung
- Prototyping und Tests
Wichtige Merkmale
- Bereitstellungsmodell: Standard.
- Sofortige Verfügbarkeit: Erstellen Sie sofort VM-Instanzen, ohne auf die Kapazitätsplanung oder Genehmigung zu warten.
- Standardpreise: Zahlen Sie für Ressourcen zu Standard-On-Demand-Preisen ohne langfristige Verpflichtungen.
- Breite Hardwareunterstützung: Kann mit jeder unterstützten GPU-Maschinenserie im allgemeinen GPU-Pfad verwendet werden.
Standardreservierungen verwenden
Wenn Sie kritische Arbeitslasten mit allgemeinen GPUs ausführen möchten, die eine sehr hohe Kapazitätsgarantie erfordern, können Sie Standardreservierungen verwenden.
Geeignete Arbeitslasten
- Kritische Produktionsarbeitslasten
- Arbeitslasten, die zugesicherte Kapazität erfordern
Wichtige Merkmale
- Bereitstellungsmodell: Standard.
- Kapazitätsgarantie: Bietet eine sehr hohe Garantie, dass Ressourcen verfügbar sind.
- Preise: Es gelten die Standardpreise, aber Sie können CUDs für Einsparungen anhängen.
Nutzungsoptionen für Cluster-GPUs
Verwenden Sie die folgenden Nutzungsoptionen, um Kapazität für Cluster-GPUs zu erwerben.Vorausschauende Reservierungen für Kapazitätsblöcke verwenden
Wenn Sie lang laufende, umfangreiche verteilte Arbeitslasten ausführen möchten, für die dicht zugewiesene Ressourcen erforderlich sind, können Sie Rechenressourcen für einen bestimmten Zeitpunkt in der Zukunft anfordern. Sie haben für diesen Zeitraum exklusiven Zugriff auf Ihre reservierten Ressourcen und können die Ressourcen verwenden, um VMs oder Cluster zu erstellen. Am Ende des Reservierungszeitraums führt Compute Engine folgende Schritte aus:
- Compute Engine löscht die Reservierung.
- Basierend auf der Beendigungsaktion die Sie für die VMs angeben, beendet oder löscht Compute Engine alle VMs, die die Reservierung verwenden.
Geeignete Arbeitslasten
- Vortraining von Foundation Models
- Inferenz für Foundation Models auf mehreren Hosts
Wichtige Merkmale
- Bereitstellungsmodell: Reservierungsgebunden.
- Unterstützung für Premium-Maschinen: Reservieren Sie Maschinentypen vom Typ A4X Max, A4X, A4, A3 Ultra, A3 Mega oder A3 High (8 GPUs).
- Verpflichtungsanforderungen: Hängen Sie eine ressourcenbasierte Verpflichtung für Reservierungen von einem Jahr oder länger an.
- Dynamische Änderungen: Aktivieren Sie Benachrichtigungen zur Notfallwartung der Hardware für die Nutzung von Vertex AI-Jobs nach Beginn des Zeitraums.
Vorausschauende Reservierungen im Kalendermodus verwenden
Wenn Sie kurze verteilte Arbeitslasten ausführen möchten, für die dicht zugewiesene Ressourcen erforderlich sind, können Sie Rechenressourcen für bis zu 90 Tage anfordern. Sie haben für diesen Zeitraum exklusiven Zugriff auf Ihre reservierten Ressourcen und können die Ressourcen verwenden, um VMs oder Cluster zu erstellen. Am Ende des Reservierungszeitraums führt Compute Engine folgende Schritte aus:
- Compute Engine löscht die Reservierung.
- Basierend auf der Beendigungsaktion die Sie für die VMs angeben, beendet oder löscht Compute Engine alle VMs, die die Reservierung verwenden.
Geeignete Arbeitslasten
- Vortraining und Feinabstimmung
- Umfangreiche Simulationen und Inferenz
Wichtige Merkmale
- Bereitstellungsmodell: Reservierungsgebunden.
- Unterstützung für Maschinenreihen: Reservieren Sie Maschinentypen vom Typ A4, A3 Ultra, A3 Mega oder A3 High (8 GPUs) Maschinentypen.
- Skalierbarkeitslimits: Reservieren Sie bis zu 80 VMs für maximal 90 Tage.
- Optimierte Bereitstellung: Verwenden Sie ein reservierungsgebundenes Modell, um Ihre Chancen auf GPUs zu erhöhen.
Flex-Start verwenden
Verwenden Sie Flex-Start für Anfragen zur Größenanpassung von verwalteten Instanzgruppen (MIGs) mit Cluster-GPUs, wenn Sie dicht zugewiesene Ressourcen für bis zu sieben Tage benötigen.
Geeignete Arbeitslasten
Flex-Start-VMs sind ideal für die Ausführung von Arbeitslasten, die jederzeit gestartet werden können, z. B.:
- Vortraining kleiner Modelle
- Modellabstimmung
- HPC-Simulation (Hochleistungs-Computing)
- Batchinferenz
Wichtige Merkmale
- Bereitstellungsmodell: Flex-Start.
- Ressourcenzuweisung: Dicht zugewiesen für Anfragen zur Größenanpassung von MIGs.
- Kosteneffizienz: Sie erhalten einen Rabatt von bis zu 53% auf vCPUs, Arbeitsspeicher, GPUs, und alle angehängten lokalen SSDs für die Maschinenreihen A4, A3, A2 und G4. Für andere unterstützte Serien gelten die Standard-On-Demand-Preise.
Spot verwenden
Sie können Spot-VMs für dicht zugewiesene, fehlertolerante Arbeitslasten verwenden, um hohe Rabatte zu erzielen, Dabei müssen Sie jedoch berücksichtigen, dass Compute Engine VMs vorzeitig beenden kann, um Kapazitäten freizugeben.
Geeignete Arbeitslasten
- Fehlertolerantes verteiltes Training
- Batchverarbeitung
Wichtige Merkmale
- Bereitstellungsmodell: Spot.
- Vorzeitiges Beenden: Compute Engine kann Instanzen jederzeit vorzeitig beenden.
- Kosteneffizienz: Sie erhalten einen Rabatt von bis zu 91% auf vCPUs, Arbeitsspeicher, GPUs, und alle angehängten lokalen SSDs.
Nächste Schritte
- Informationen zum Ermitteln der Anforderungen Ihrer Arbeitslast finden Sie unter Anforderungen der Arbeitslast ermitteln.
- Informationen zum Erstellen und Verwenden von Reservierungen finden Sie unter Reservierungen erstellen und verwenden.
- Weitere Informationen zu Spot-VMs finden Sie unter Weitere Informationen zu Spot VMs.
- Informationen zum Erstellen einer On-Demand-VM-Instanz finden Sie unter On-Demand-VM Instanz erstellen.