Cloud TPU-Ressourcen planen

Auf dieser Seite wird beschrieben, wie Sie die Nutzung von Tensor Processing Unit (TPUs) planen.

Eine Option für die Aufnahme auswählen

Nutzungsoptionen beziehen sich auf die Möglichkeiten, Rechenressourcen zu beziehen und zu nutzen. Sie können Cloud TPU-VM-Kapazität entsprechend Ihren Anforderungen an Geschwindigkeit, Dauer, Kosten und Toleranz gegenüber Preemption anfordern. Es gibt folgende Optionen:

  • On-Demand:Standardmäßige Pay-as-you-go-Instanzen.
  • Spot-VMs:Preiswertere, vorzeitig beendbare Instanzen. Verwendet Kontingente auf Abruf.
  • Flex-Start-VMs:Sie können Kapazität nach Bedarf für bis zu 7 Tage reservieren, ohne langfristige Reservierungen oder eine komplexe Kontingentverwaltung.
  • Reservierungen:Sie können Kapazität für einen bestimmten Zeitraum (bis zu 90 Tage oder 1 Jahr oder länger) reservieren und so die Verfügbarkeit garantieren. Es wird On-Demand-Kontingent verwendet.

In der folgenden Tabelle werden die TPU-Nutzungsoptionen anhand ihrer Funktionsweise, ihrer idealen Anwendungsfälle und der unterstützten TPU-Versionen verglichen.

Nutzungsoption Funktionsweise Geeignete Anwendungsfälle Unterstützten TPU-Versionen
Vorausschauende Reservierungen für ein Jahr oder länger

Sie fordern TPU-Ressourcen im Voraus für ein Jahr oder länger an. Diese Ressourcen sind während dieses Zeitraums ausschließlich für Sie reserviert.

Reservierungen bieten das höchste Maß an Sicherheit für Kapazität und sind kostengünstiger als On-Demand-Ressourcen.

Für vorausschauende TPU-Reservierungen gilt ein Rabatt für zugesicherte Nutzung (Committed Use Discount, CUD). CUDs sind Preisnachlässe für Nutzer, die einen Vertrag für zugesicherte Nutzung abschließen. Weitere Informationen finden Sie unter Vorausschauende Reservierungen für ein Jahr oder länger.

Vorausschauende Reservierungen für ein Jahr oder länger sind ideal für Trainingsjobs mit langer Laufzeit und für Inferenzarbeitslasten. Alle TPU-Versionen
Vorausschauende Reservierungen für bis zu 90 Tage (Kalendermodus)

Sie fordern TPU-Ressourcen für einen bestimmten Beginn und eine Dauer zwischen 1 und 90 Tagen an. Diese Ressourcen sind während dieses Zeitraums ausschließlich für Sie reserviert. Weitere Informationen finden Sie unter Vorausschauende Reservierungen für bis zu 90 Tage (im Kalendermodus).

Reservierungen bieten das höchste Maß an Sicherheit für Kapazität und sind kostengünstiger als On-Demand-Ressourcen.

Vorausschauende Reservierungen im Kalendermodus eignen sich gut für Trainings- und Testarbeitslasten, die genaue Startzeiten erfordern und eine konkrete Dauer haben. TPU7x, TPU v6e und TPU v5p
On demand

Sie fordern TPU-Ressourcen zur sofortigen Nutzung an und können sie so lange nutzen, wie Sie sie benötigen.

On-Demand bietet erhebliche Flexibilität. Die Bereitstellung von On-Demand-Ressourcen wird nicht vorzeitig beendet, aber es gibt keine Garantie dafür, dass genügend TPU-Ressourcen verfügbar sind, um Ihre Anfrage zu erfüllen. On-Demand ist die Standardoption, wenn Sie TPU-Ressourcen erstellen. Weitere Informationen zum Erstellen und Verwenden von On-Demand-TPUs finden Sie unter TPU-VMs erstellen.

On-Demand-Instanzen eignen sich gut für dringende Jobs und Arbeitslasten, bei denen das Ende flexibel sein soll. Alle TPU-Versionen
Flex-Start (Vorschau)

Sie können TPU-Ressourcen für einen bestimmten Zeitraum von bis zu sieben Tagen anfordern, ohne Kapazität im Voraus reservieren zu müssen.

TPU-Flex-Start-VMs werden aus einem dedizierten Kapazitätspool bereitgestellt. Die Verfügbarkeit dieser Ressourcen ist daher höher als bei On-Demand-VMs. Weitere Informationen finden Sie unter TPU Flex-Start-VMs anfordern.

Weitere Informationen zur Verwendung von TPU-Flex-Start-VMs mit Google Kubernetes Engine (GKE) finden Sie unter GPU-, TPU- und H4D-Nutzung mit dem Bereitstellungsmodus „Flex-Start“.

Flex-Start ist ideal für Experimente, kleinere Tests, die dynamische Bereitstellung von TPUs für Inferenzarbeitslasten, die Feinabstimmung von Modellen und Arbeitslastausführungen, die weniger als sieben Tage dauern. TPU7x, TPU v6e und TPU v5p
Spot

Sie fordern TPU-Ressourcen an, deren Bereitstellung vorzeitig beendet werden kann.

Spot-VMs sind viel kostengünstiger als On-Demand-Ressourcen. Spot-VMs sind oft einfacher zu erhalten als On-Demand-Ressourcen, ihre Bereitstellung kann aber jederzeit vorzeitig beendet werden. Die Laufzeit ist nicht begrenzt. Weitere Informationen zu TPU-Spot-VMs finden Sie unter TPU-Spot-VMs verwalten.

Spot eignet sich gut für die Planung von Arbeitslasten mit niedrigerer Priorität wie Modellvortraining, Modellfeinabstimmung und Simulationsjobs, die Verfügbarkeitsunterbrechungen tolerieren können. Alle TPU-Versionen

TPU-Kapazitätsmodus auswählen

Standardmäßig wird die TPU-Kapazität in der von Google verwalteten Infrastruktur bereitgestellt. Wenn Sie eine Reservierung haben, können Sie den Modus „Alle Kapazitäten“ für TPU v6e (Trillium) und TPU7x (Ironwood) verwenden. Im Modus „Alle Kapazitäten“ haben Sie Zugriff auf 100% Ihrer reservierten Kapazität und erhalten vollständige Informationen zur Topologie. Sie sind jedoch für die Verwaltung der Hardwarewartung und die Wiederherstellung nach Ausfällen verantwortlich.

Einen detaillierten Vergleich zwischen der standardmäßigen von Google verwalteten Infrastruktur und dem Modus „All Capacity“ finden Sie unter TPU-Kapazitätsmodi.

TPU-Version auswählen

Wählen Sie die TPU-Version aus, z. B. v5p, v6e oder TPU7x (Ironwood), je nach den Anforderungen Ihres Modells für Training oder Inferenz. Weitere Informationen finden Sie unter TPU-Versionen.

TPU-Kontingent anfordern

Wenn Sie TPU-VMs verwenden möchten, benötigen Sie unabhängig von der Nutzungsoption entweder On-Demand-Kontingent oder Kontingent auf Abruf für Cloud TPU-Ressourcen. Achten Sie darauf, dass Sie genügend Kontingent für die von Ihnen ausgewählte Option, TPU-Version, Größe und Zone haben. Kontingente sind für jede TPU-Version spezifisch und unterscheiden sich für die On-Demand-Nutzung und die Nutzung auf Abruf. Für einige TPU-Versionen gelten Standardkontingente, für andere müssen Sie ein Kontingent beantragen. Weitere Informationen finden Sie unter Compute Engine-Kontingente.

Nächste Schritte