關於 GKE AI 一致性

本文說明 Kubernetes AI 一致性計畫的內容、這項計畫對 Google Kubernetes Engine (GKE) 上的 AI/機器學習工作負載有何重要性,以及如何設定符合一致性規範的 GKE 叢集。

為何 GKE 叢集的 AI 一致性很重要

Kubernetes AI 一致性計畫定義了 Kubernetes 叢集的標準,確保叢集能可靠且有效率地執行 AI 和 ML 工作負載。為 AI/機器學習設定 Kubernetes 叢集可能很複雜。這通常需要瞭解特定驅動程式安裝、API 版本,以及意外錯誤的可能解決方法。

GKE 等相容平台設計可為您處理這些基礎複雜性,提供從設定到部署的路徑。使用符合標準的 GKE 版本建構環境,可確保環境符合下列條件:

  • 擴充性:根據需求有效率地擴充或縮減 AI/機器學習工作負載。
  • 效能:充分發揮硬體 (包括 GPU 和 TPU) 的效能。
  • 可攜性:在任何符合規範的 Kubernetes 叢集上執行 AI/機器學習應用程式,且變更幅度極小。
  • 互通性:與 AI/機器學習生態系統中的其他工具和架構整合。

如何建立符合 AI 規範的 GKE 叢集

如要建立符合 AI 規範的 GKE 叢集,請完成下列步驟:

  1. 請查看 ai-conformance GitHub 存放區,瞭解符合規範的版本清單。
  2. 標準模式下建立 GKE 叢集,並執行相容版本,例如 1.34.0-gke.1662000 以上版本。
  3. 在叢集上啟用 Gateway API

您的叢集現在符合 Kubernetes AI 一致性的強制性規定。

GKE 如何成為符合 Kubernetes AI 標準的平台

GKE 會管理 AI 遵循情況的基礎需求,因此您不必自行管理。 下表重點說明 AI/機器學習工作負載的幾項主要功能。其中部分功能預設為啟用,但其他功能 (例如用於群組排程的 Kueue) 則是選用功能,您可以安裝這些功能來強化 AI/機器學習工作負載。

Kubernetes AI 規範計畫的設計宗旨,是隨著 AI/機器學習生態系統演進。 我們會根據生態系統的狀態,在每次發布 Kubernetes 子版本時更新需求。如要查看特定子版本的完整需求,請前往 ai-conformance GitHub 存放區,並參閱 docs/AIConformance-MINOR_VERSION.yaml 檔案,其中 MINOR_VERSION 是您的特定版本,例如 v1.34

條件
動態資源分配 (DRA) 除了數量之外,還能更彈性地提出更精細的資源要求。詳情請參閱「關於動態資源分配」。
Kubernetes Gateway API 為推論服務提供進階流量管理,可啟用加權流量拆分和標頭式轉送等功能。詳情請參閱「關於 GKE 閘道 API」。
幫派排程 確保分散式 AI 工作負載的調度設定為全有全無。GKE 允許安裝並順利運作至少一個群組排程解決方案。如需範例,請參閱「使用 Kueue 部署批次系統」。
加速器叢集自動配置器 根據要求這些加速器的待處理 Pod,向上和向下調整含有特定加速器類型的節點群組。詳情請參閱:
加速器的水平 Pod 自動調度器 (HPA) 可正確處理使用加速器的 Pod,包括根據與 AI/機器學習工作負載相關的自訂指標,調整這些 Pod 的資源配置。詳情請參閱:
加速器成效指標 使用標準化、機器可讀取的格式指標端點,公開精細的成效指標。詳情請參閱:
標準化監控 提供監控系統,可從以標準格式 (例如 Prometheus 曝光格式) 顯示指標的工作負載中,探索及收集指標。詳情請參閱「GKE 可觀測性」。
AI 服務人員支援 必須證明至少有一個複雜的 AI 運算子 (附有自訂資源定義 (CRD)) 可安裝在平台上,且運作穩定可靠。詳情請參閱「在 Google Kubernetes Engine 中使用 Kubeflow 和 Ray 建構機器學習平台」。

後續步驟