TPU 容量模式

TPU 提供兩種運算資源模式:代管運算資源模式和所有運算資源模式。每種模式都會定義硬體維護和主機錯誤的處理方式,以及您對 TPU 硬體拓撲的可見度和控制程度。

TPU 容量模式總覽

下表摘要列出「受管理容量」模式和「所有容量」模式的主要差異:

受管理容量模式 所有容量模式
容量存取權 Google 會在可用基礎架構中管理容量分配和主機復原作業。 工作負載可存取 100% 的預留容量。您有責任管理備用容量,以利故障復原。您可以指定特定區塊或子區塊,精確放置工作負載,並瞭解拓撲。
硬體拓撲可視性 Compute Engine 會將實體拓撲結構抽象化。 全面掌握叢集、區塊、子區塊和主機拓撲與使用率。
錯誤復原 Compute Engine 會自動偵測故障的 TPU 節點,並在正常的硬體上重新啟動。 Google 會自動偵測並修復故障的硬體。您有責任監控 TPU 節點健康狀態,並將健康狀態不良的節點重新排程至預訂中預留的健康備用硬體。
維護控制 Compute Engine 會排定及管理維護事件。您也可以選擇在排定的維護時間前開始維護作業。 您可以精細控管,在預留項目、區塊或子區塊層級排定及啟動維護作業。
支援的 TPU 版本 所有 TPU 版本。 TPU v6e (Trillium) 和 TPU7x (Ironwood)
支援的用量方案 所有計費方案。 您必須有未來預留項目,且容量下限至少為一年。系統不支援日曆模式的未來預留項目。如要瞭解詳情及申請預留「所有容量」模式,請與 Google Cloud 帳戶團隊聯絡。

受管理容量模式

根據預設,TPU 容量會以受管理容量模式運作。在這個模式下,Compute Engine 會自動偵測硬體故障,並更換受影響的 TPU 執行個體,確保工作負載可以在正常的硬體上重新啟動。

代管容量模式具有下列功能:

  • 自動復原執行個體:針對隨選、彈性啟動和預訂消耗選項,Compute Engine 會自動偵測硬體故障,並更換受影響的 TPU 執行個體。
  • 簡化管理:主機維護或修復作業不需要手動介入。

所有容量模式

所有容量模式的設計宗旨,都是要讓您直接控管 TPU 資源,並根據預留量進行調整。在「所有容量」模式中,您可以存取 100% 的預留容量。您必須負責使用足夠的健康備用容量管理 TPU 節點恢復作業,並安排維護事件。

所有容量模式都具備下列功能:

  • 完整容量分配:存取所有預留容量,包括為故障復原或工作負載爆量分配的任何備用容量。
  • 拓撲感知存放位置:全面掌握叢集、區塊、子區塊和主機拓撲,以便調整工作負載存放位置。
  • 進階維護控制項:在預訂、區塊或子區塊層級排定及觸發維護事件。
  • 回報及維修:回報成效不佳的硬體以進行維修。

請與 Google Cloud 帳戶團隊聯絡,要求預留「所有容量」模式。詳情請參閱「所有容量模式總覽」。

後續步驟