本文比較 Google Cloud 中的核心運算選項,協助您根據應用程式的架構、擴充和其他需求,選取最合適的解決方案或工具。
如要在 Google Cloud上部署工作負載,您可以選擇一系列解決方案或工具,在基礎架構控管與 Google 自動管理之間取得平衡。您選取的運算選項可能會大幅影響效能、費用和每日維護工作。如要在選擇前進一步瞭解這些選項,請參閱 Google 運算總覽。
選擇運算選項
適合工作負載的最佳運算解決方案或工具,可能取決於多項因素。舉例來說,如要將 VMware 環境遷移至Google Cloud,請使用 VMware Engine。
如要瞭解基礎架構管理、容器和 Compute Engine 執行個體之間的取捨,請參閱下列流程圖。如要快速比較不同運算選項的功能,請參閱本文中的比較表。
上述流程圖中的問題如下:
您是否希望 Google 管理所有基礎架構?
是:使用 Cloud Run。
否:請前往問題 2。
您是否需要工作負載的叢集自動化調度管理 (例如 Kubernetes 或 Slurm)?
是:請跳到問題 4。
否:請前往問題 3。
您要自行管理 VM 或裸機執行個體嗎?
否:使用 Batch。
您是否要執行標準容器化應用程式 (例如微服務或 API)?
是:使用 GKE。
否:請前往第 5 個問題。
要讓 Google 管理叢集生命週期嗎?
使用 Batch
如果工作負載屬於非同步資料分析、影片轉換工作或科學模擬等類型,請選擇 Batch。Google 會管理基礎架構,讓您可以在 Google Cloud上排定時間、排入佇列及執行批次運算工作。您不必自行部署或管理伺服器,只要將可執行的指令碼或容器化工作負載提交至工作佇列即可。
Batch 提供下列功能:
加速器支援:Batch 支援 NVIDIA GPU (最高 RTX PRO 6000),適用於需要高輸送量的批次和高效能運算 (HPC) 工作負載。Batch 不支援 Google TPU。
作業系統和核心控制項:Google 會管理作業系統和作業的執行環境。
自動化調度管理:工作佇列會排定工作時間,並在發生錯誤時重試。如要調整容量,服務會根據佇列中的工作數量佈建及啟動 VM,並在這些工作完成時停止 VM。
詳情請參閱開始使用 Batch。
使用 Cloud Run
選擇 Cloud Run 部署容器化網頁應用程式或工作,不必管理伺服器。Cloud Run 是無伺服器平台,可讓您執行容器化應用程式,不必管理伺服器或叢集。Google 會為您處理所有基礎架構管理作業,包括作業系統、核心、網路設定和容量管理。
Cloud Run 提供下列功能:
加速器支援:Cloud Run 支援 NVIDIA RTX PRO 6000 Blackwell 和 L4 GPU。Cloud Run 不支援其他 GPU 模型或 Google TPU。
OS 和核心控制項:您可以將工作負載封裝為容器,並以 Web 服務、非同步工作或批次工作形式執行。
自動化調度管理:Google 是無伺服器平台,可啟動、執行及擴充容器執行個體,不必手動介入。如果是網路服務,Cloud Run 會根據傳入的要求或 CPU 消耗量,新增或移除容器執行個體。
詳情請參閱「什麼是 Cloud Run」。
使用 Cluster Director
如要訓練 AI 模型或執行 Slurm 排定的模擬工作,且不想進行網路設定或叢集 OS 設定工作,請選擇 Cluster Director。Cluster Director 是一項代管服務,可自動部署及管理 AI、ML 和 HPC 叢集的生命週期。
Cluster Director 提供下列功能:
加速器支援:Cluster Director 支援 NVIDIA GPU,包括 GB300 Ultra Superchip、GB200 Superchip、B200、H200 和 H100,適用於 AI、機器學習和 HPC 工作負載。Cluster Director 不支援 Google TPU。
作業系統和核心控制項:Google 會管理叢集生命週期,並設定專為機器學習設計的自訂 Ubuntu 作業系統。這項服務提供可立即使用的環境,內含登入節點、運算節點集,以及專為 AI 工作負載建構的部署範本。
自動化調度管理:為擴充容量,Slurm 會在 CPU 消耗量增加時建立節點,並在節點閒置一段時間後刪除節點,避免產生不必要的費用。
詳情請參閱「Cluster Director 總覽」。
使用 Cluster Toolkit
如要使用自動部署範本,同時維持對作業系統和軟體堆疊的管理控制權,請選擇 Cluster Toolkit。Cluster Toolkit 是一項開放原始碼工具,可用於在 Google Cloud上佈建及設定 AI、ML 和 HPC 叢集。
Cluster Toolkit 提供下列功能:
加速器支援:Cluster Toolkit 支援 NVIDIA GPU 和 Google TPU,您可以使用稱為「藍圖」的部署範本佈建及設定這些加速器。有了這些自動化設定檔,您就能根據基礎架構即程式碼 (IaC) 原則,部署標準化且可重複使用的叢集基礎架構。
作業系統和核心控制項:叢集工具包會在您的 Google Cloud專案中部署運算執行個體或 GKE 資源。部署這些資源後,您仍可管理作業系統、軟體設定和叢集生命週期。
自動化調度管理:如要擴充容量,請設定代管執行個體群組 (MIG) 或 GKE 工具,根據範本設定新增或移除節點。
詳情請參閱 Cluster Toolkit 總覽。
使用 Compute Engine
如果應用程式需要自訂架構設定、專用核心設定,或對虛擬伺服器進行管理控制,請選擇 Compute Engine。Compute Engine 是 Google Cloud的核心基礎架構即服務 (IaaS) 平台,可讓您在 Google 的實體硬體上建立及執行 VM 和裸機執行個體。
Compute Engine 提供下列功能:
加速器支援:Compute Engine 支援 NVIDIA GPU 和 Google TPU,您可以將這些加速器附加至運算執行個體。
作業系統和核心控制:您可以完全掌控作業系統、核心設定和開機檔案,並選取 CPU 處理器、記憶體設定、儲存空間類型和客體作業系統。
調度管理:由於調度管理是手動作業,因此您必須自行設定及管理運算執行個體、網路規則、流量路徑和備份系統,確保可靠性。如要調整容量,請視需要新增或移除運算執行個體、使用自訂工具,或設定 MIG 來調整叢集容量。
詳情請參閱 Compute Engine 總覽。
使用 GKE
如果您需要功能強大的容器型自動化調度管理平台,適用於分散式應用程式或一般用途的微服務,請選擇 Google Kubernetes Engine (GKE)。GKE 是業界標準的代管 Kubernetes 平台,可部署、調度及自動調度管理容器化應用程式。Google 會管理 Kubernetes 控制層,確保安全性和系統可用性。
GKE 提供下列功能:
加速器支援:GKE 支援 NVIDIA GPU 和 Google TPU,適用於容器化工作負載。
作業系統和核心控制項:在 Autopilot 和 Standard 模式中,作業系統皆由 Google 管理。在 Autopilot 模式中,Google 會管理叢集節點和容量調整作業,不必手動操作。在 Standard 模式中,您可以管理叢集節點集區。
自動化調度管理:為因應需求變化調整容量,GKE 會使用水平和垂直 Pod 自動調度器 (HPA 和 VPA) 新增或移除容器,並使用叢集自動調度器新增或移除節點。GKE 也會透過 Kueue 編排批次工作。
詳情請參閱 GKE 總覽。
使用 VMware Engine
選擇 VMware Engine,將內部部署 VMware 工作負載遷移至 Google Cloud 基礎架構,並盡量減少作業變更。VMware Engine 是代管服務,可讓您在 Google 硬體上執行 VMware 虛擬機器,不必修改應用程式。
VMware Engine 提供下列功能:
加速器支援:VMware Engine 不支援 GPU 或 TPU。
作業系統和核心控制:您可以在 Google Cloud上執行 VMware 應用程式,就像在現有設定中執行一樣。Google 會管理實體硬體、網路基礎架構和 VMware 軟體平台,例如 vSphere、vCenter、vSAN 和 NSX-T。您仍可保有 VM、客體作業系統和 VMware 管理工具的管理權。
協調:如要調整私有雲的大小,請新增或移除專用 ESXi 節點。
詳情請參閱「Google Cloud VMware Engine 總覽」。
比較運算選項
如要找出適合工作負載的運算解決方案或工具,請比較下表各運算選項的技術功能:
| 運算選項 | GPU | TPU | 作業系統和核心控制 | 自動化調度管理 | 資源調度 |
|---|---|---|---|---|---|
| Batch | 最高可搭載 NVIDIA RTX PRO 6000 | 否 | Google 代管 | 工作佇列 | 根據佇列工作自動調度資源 |
| Cloud Run | NVIDIA RTX PRO 6000 Blackwell 和 L4 | 否 | Google 代管 | 無伺服器 | 根據要求或 CPU 消耗量自動調整 |
| Cluster Director | NVIDIA GB300 Ultra Superchip、GB200 Superchip、B200、H200 和 H100 | 否 | Google 管理 (自訂 Ubuntu) | Slurm | 根據 CPU 消耗量自動調度資源 |
| Cluster Toolkit | 所有可用的 NVIDIA GPU | 所有可用的 Google TPU | 自行管理 | 自動化設定檔 (IaC) | 可使用 MIG 或 GKE 工具自訂 |
| Compute Engine | 所有可用的 NVIDIA GPU | 所有可用的 Google TPU | 自行管理 | 手動 | 手動或使用 MIG 自動執行 |
| Google Kubernetes Engine (GKE) | 所有可用的 NVIDIA GPU | 所有可用的 Google TPU | Google 代管 (Autopilot) 或半代管 (Standard) | Kubernetes | 自動調整 Pod 和節點大小 |
| VMware Engine | 否 | 否 | Google 代管 | VMware 平台 | 使用 ESXi 節點手動預訂 |