選擇運算選項

本文比較 Google Cloud 中的核心運算選項,協助您根據應用程式的架構、擴充和其他需求,選取最合適的解決方案或工具。

如要在 Google Cloud上部署工作負載,您可以選擇一系列解決方案或工具,在基礎架構控管與 Google 自動管理之間取得平衡。您選取的運算選項可能會大幅影響效能、費用和每日維護工作。如要在選擇前進一步瞭解這些選項,請參閱 Google 運算總覽

選擇運算選項

適合工作負載的最佳運算解決方案或工具,可能取決於多項因素。舉例來說,如要將 VMware 環境遷移至Google Cloud,請使用 VMware Engine

如要瞭解基礎架構管理、容器和 Compute Engine 執行個體之間的取捨,請參閱下列流程圖。如要快速比較不同運算選項的功能,請參閱本文中的比較表

這份流程圖可協助您在 Google Cloud中選擇運算選項。

上述流程圖中的問題如下:

  1. 您是否希望 Google 管理所有基礎架構?

  2. 您是否需要工作負載的叢集自動化調度管理 (例如 Kubernetes 或 Slurm)?

    • :請跳到問題 4。

    • :請前往問題 3。

  3. 您要自行管理 VM 或裸機執行個體嗎?

  4. 您是否要執行標準容器化應用程式 (例如微服務或 API)?

    • 使用 GKE

    • :請前往第 5 個問題。

  5. 要讓 Google 管理叢集生命週期嗎?

使用 Batch

如果工作負載屬於非同步資料分析、影片轉換工作或科學模擬等類型,請選擇 Batch。Google 會管理基礎架構,讓您可以在 Google Cloud上排定時間、排入佇列及執行批次運算工作。您不必自行部署或管理伺服器,只要將可執行的指令碼或容器化工作負載提交至工作佇列即可。

Batch 提供下列功能:

  • 加速器支援:Batch 支援 NVIDIA GPU (最高 RTX PRO 6000),適用於需要高輸送量的批次和高效能運算 (HPC) 工作負載。Batch 不支援 Google TPU。

  • 作業系統和核心控制項:Google 會管理作業系統和作業的執行環境。

  • 自動化調度管理:工作佇列會排定工作時間,並在發生錯誤時重試。如要調整容量,服務會根據佇列中的工作數量佈建及啟動 VM,並在這些工作完成時停止 VM。

詳情請參閱開始使用 Batch

使用 Cloud Run

選擇 Cloud Run 部署容器化網頁應用程式或工作,不必管理伺服器。Cloud Run 是無伺服器平台,可讓您執行容器化應用程式,不必管理伺服器或叢集。Google 會為您處理所有基礎架構管理作業,包括作業系統、核心、網路設定和容量管理。

Cloud Run 提供下列功能:

  • 加速器支援:Cloud Run 支援 NVIDIA RTX PRO 6000 Blackwell 和 L4 GPU。Cloud Run 不支援其他 GPU 模型或 Google TPU。

  • OS 和核心控制項:您可以將工作負載封裝為容器,並以 Web 服務、非同步工作或批次工作形式執行。

  • 自動化調度管理:Google 是無伺服器平台,可啟動、執行及擴充容器執行個體,不必手動介入。如果是網路服務,Cloud Run 會根據傳入的要求或 CPU 消耗量,新增或移除容器執行個體。

詳情請參閱「什麼是 Cloud Run」。

使用 Cluster Director

如要訓練 AI 模型或執行 Slurm 排定的模擬工作,且不想進行網路設定或叢集 OS 設定工作,請選擇 Cluster Director。Cluster Director 是一項代管服務,可自動部署及管理 AI、ML 和 HPC 叢集的生命週期。

Cluster Director 提供下列功能:

  • 加速器支援:Cluster Director 支援 NVIDIA GPU,包括 GB300 Ultra Superchip、GB200 Superchip、B200、H200 和 H100,適用於 AI、機器學習和 HPC 工作負載。Cluster Director 不支援 Google TPU。

  • 作業系統和核心控制項:Google 會管理叢集生命週期,並設定專為機器學習設計的自訂 Ubuntu 作業系統。這項服務提供可立即使用的環境,內含登入節點、運算節點集,以及專為 AI 工作負載建構的部署範本。

  • 自動化調度管理:為擴充容量,Slurm 會在 CPU 消耗量增加時建立節點,並在節點閒置一段時間後刪除節點,避免產生不必要的費用。

詳情請參閱「Cluster Director 總覽」。

使用 Cluster Toolkit

如要使用自動部署範本,同時維持對作業系統和軟體堆疊的管理控制權,請選擇 Cluster Toolkit。Cluster Toolkit 是一項開放原始碼工具,可用於在 Google Cloud上佈建及設定 AI、ML 和 HPC 叢集。

Cluster Toolkit 提供下列功能:

  • 加速器支援:Cluster Toolkit 支援 NVIDIA GPU 和 Google TPU,您可以使用稱為「藍圖」的部署範本佈建及設定這些加速器。有了這些自動化設定檔,您就能根據基礎架構即程式碼 (IaC) 原則,部署標準化且可重複使用的叢集基礎架構。

  • 作業系統和核心控制項:叢集工具包會在您的 Google Cloud專案中部署運算執行個體或 GKE 資源。部署這些資源後,您仍可管理作業系統、軟體設定和叢集生命週期。

  • 自動化調度管理:如要擴充容量,請設定代管執行個體群組 (MIG) 或 GKE 工具,根據範本設定新增或移除節點。

詳情請參閱 Cluster Toolkit 總覽

使用 Compute Engine

如果應用程式需要自訂架構設定、專用核心設定,或對虛擬伺服器進行管理控制,請選擇 Compute Engine。Compute Engine 是 Google Cloud的核心基礎架構即服務 (IaaS) 平台,可讓您在 Google 的實體硬體上建立及執行 VM 和裸機執行個體。

Compute Engine 提供下列功能:

  • 加速器支援:Compute Engine 支援 NVIDIA GPU 和 Google TPU,您可以將這些加速器附加至運算執行個體。

  • 作業系統和核心控制:您可以完全掌控作業系統、核心設定和開機檔案,並選取 CPU 處理器、記憶體設定、儲存空間類型和客體作業系統。

  • 調度管理:由於調度管理是手動作業,因此您必須自行設定及管理運算執行個體、網路規則、流量路徑和備份系統,確保可靠性。如要調整容量,請視需要新增或移除運算執行個體、使用自訂工具,或設定 MIG 來調整叢集容量。

詳情請參閱 Compute Engine 總覽

使用 GKE

如果您需要功能強大的容器型自動化調度管理平台,適用於分散式應用程式或一般用途的微服務,請選擇 Google Kubernetes Engine (GKE)。GKE 是業界標準的代管 Kubernetes 平台,可部署、調度及自動調度管理容器化應用程式。Google 會管理 Kubernetes 控制層,確保安全性和系統可用性。

GKE 提供下列功能:

  • 加速器支援:GKE 支援 NVIDIA GPU 和 Google TPU,適用於容器化工作負載。

  • 作業系統和核心控制項:在 Autopilot 和 Standard 模式中,作業系統皆由 Google 管理。在 Autopilot 模式中,Google 會管理叢集節點和容量調整作業,不必手動操作。在 Standard 模式中,您可以管理叢集節點集區。

  • 自動化調度管理:為因應需求變化調整容量,GKE 會使用水平和垂直 Pod 自動調度器 (HPA 和 VPA) 新增或移除容器,並使用叢集自動調度器新增或移除節點。GKE 也會透過 Kueue 編排批次工作。

詳情請參閱 GKE 總覽

使用 VMware Engine

選擇 VMware Engine,將內部部署 VMware 工作負載遷移至 Google Cloud 基礎架構,並盡量減少作業變更。VMware Engine 是代管服務,可讓您在 Google 硬體上執行 VMware 虛擬機器,不必修改應用程式。

VMware Engine 提供下列功能:

  • 加速器支援:VMware Engine 不支援 GPU 或 TPU。

  • 作業系統和核心控制:您可以在 Google Cloud上執行 VMware 應用程式,就像在現有設定中執行一樣。Google 會管理實體硬體、網路基礎架構和 VMware 軟體平台,例如 vSphere、vCenter、vSAN 和 NSX-T。您仍可保有 VM、客體作業系統和 VMware 管理工具的管理權。

  • 協調:如要調整私有雲的大小,請新增或移除專用 ESXi 節點。

詳情請參閱「Google Cloud VMware Engine 總覽」。

比較運算選項

如要找出適合工作負載的運算解決方案或工具,請比較下表各運算選項的技術功能:

運算選項 GPU TPU 作業系統和核心控制 自動化調度管理 資源調度
Batch 最高可搭載 NVIDIA RTX PRO 6000 Google 代管 工作佇列 根據佇列工作自動調度資源
Cloud Run NVIDIA RTX PRO 6000 Blackwell 和 L4 Google 代管 無伺服器 根據要求或 CPU 消耗量自動調整
Cluster Director NVIDIA GB300 Ultra Superchip、GB200 Superchip、B200、H200 和 H100 Google 管理 (自訂 Ubuntu) Slurm 根據 CPU 消耗量自動調度資源
Cluster Toolkit 所有可用的 NVIDIA GPU 所有可用的 Google TPU 自行管理 自動化設定檔 (IaC) 可使用 MIG 或 GKE 工具自訂
Compute Engine 所有可用的 NVIDIA GPU 所有可用的 Google TPU 自行管理 手動 手動或使用 MIG 自動執行
Google Kubernetes Engine (GKE) 所有可用的 NVIDIA GPU 所有可用的 Google TPU Google 代管 (Autopilot) 或半代管 (Standard) Kubernetes 自動調整 Pod 和節點大小
VMware Engine Google 代管 VMware 平台 使用 ESXi 節點手動預訂