大多數叢集管理功能僅支援預訂容量,也就是使用預訂佈建模型的基礎架構,且僅支援叢集 GPU 機型。如要使用其他佈建模式的容量,則只能使用下列叢集管理功能:
AI 基礎架構資源共置
使用叢集式 GPU (例如 A4X Max、A4X、A4、A3 Ultra、A3 Mega 和 A3 High (8 個 GPU)) 時,您可以要求 Compute Engine 盡可能緊密佈建的主機。這些機器提供下列功能:
Compute Engine 會將機器佈建為資源區塊。
動態機器學習 (ML) 網路架構可互連機器。
這種資源配置可大幅減少網路躍點,並將網路延遲降至最低。如要部署 Compute Engine 密集分配的加速器最佳化機器區塊,可以使用下列選項:
執行下列一或多項操作時,資源必須密集分配:
部署使用規模調整要求的代管執行個體群組 (MIG),並在同一項要求中建立資源。
指定資源使用相同的密集配置政策或工作負載政策,並指定距離上限值。具體來說,資源只需要盡可能接近政策指定的最大距離值。
當您執行下列一或多項操作時,系統會根據盡量可用的資源,選擇性地密集分配資源:
在相同要求中建立彈性啟動 VM 的資源。
指定資源使用相同的密集配置政策或工作負載政策,且未指定距離上限。
叢集拓撲感知存放位置
建立叢集 GPU 後,您可以在節點和叢集層級取得拓撲資訊。這項資訊有助於您執行下列操作:
調整應用程式或工作負載設計,進一步縮短網路延遲時間。
瞭解並排解執行個體之間的網路延遲和效能問題,這些執行個體會頻繁通訊。如果執行個體意外相距很遠,就可能發生這些問題。
具體來說,支援的拓撲資訊如下:
拓撲資訊最適合用於與預留項目綁定的容量,這是查看預留項目拓撲的必要條件。
如果是 Spot VM,只有在機器使用密集配置政策或工作負載政策時,才會顯示拓撲資訊。
如要瞭解詳情,請參考下列資源:
- 如要瞭解執行個體和 Slurm 叢集,請參閱「查看運算執行個體拓撲」。
- 如為 GKE 叢集,請參閱「查看 GKE 節點拓撲」和「使用拓撲感知調度 (TAS) 安排 GKE 工作負載時程」。
叢集運作模式
預留與預留項目綁定的容量來建立運算執行個體或叢集時,您預留的機型會決定執行個體的叢集運作模式。這個模式會指定執行個體在發生主機錯誤或主機回報錯誤後,應採取的行為。執行個體可用的運作模式包括代管模式,也就是 Compute Engine 會自動更換任何故障的機器,但會保留部分預留容量,確保執行個體有足夠的資源可重新啟動。或是全容量模式,您可存取所有預留容量,但要負責管理故障和排定的維護作業。
詳情請參閱「預訂作業模式」。
叢集維護排程和控制項
您可以在資源區塊中使用拓撲感知排程,控管叢集 GPU 的維護作業。這項功能有助於同步升級,讓工作負載更能因應主機事件,並盡量減少中斷情形。這種做法有助於提升工作負載的有效輸送量。
如要全面掌控維護事件,可以使用下列功能:
維護作業排程類型
預留受保留項目限制的容量,建立運算執行個體或叢集 GPU 叢集時,您可以定義 Compute Engine 維護執行個體基礎架構的方式。您可以根據要用於執行個體的機型,選擇在執行個體間同步進行維護 (分組),或採用不同的維護時間表 (獨立)。
詳情請參閱維護排程類型。
管理主辦人活動
建立叢集 GPU 並啟動工作負載後,您可以設定快訊,並在系統排定、開始或完成執行個體或預留區塊的維護作業時收到通知。您也可以在排定時間前,查看執行個體或預留區塊的維護時間,並視需要手動啟動維護作業。這些選項可協助您主動控管工作負載,盡量減少停機時間。
如要瞭解詳情,請參考下列資源:
叢集監控和診斷工具
如要監控及排解問題,叢集 GPU 機型會提供下列服務,用於預訂容量:
運算執行個體健康狀態下降預測,可協助您找出可能在未來五小時內健康狀態下降的運算執行個體。
回報出錯的主機,可用於標記個別主機的問題。
支援 Cloud Monitoring 指標,可協助您監控網路和 GPU 效能。