选择计算选项

本文档比较了 Google Cloud 中的核心计算选项,可帮助您为应用的架构、伸缩和其他要求选择最佳解决方案或工具。

如需在 Google Cloud上部署工作负载,您可以从一系列解决方案或工具中进行选择,这些解决方案或工具可在您对基础架构的控制与 Google 的自动化管理之间实现平衡。您选择的计算选项会对性能、费用和日常维护工作量产生重大影响。如需在选择之前更好地了解这些选项,请参阅 Google 计算概览

选择计算选项

最适合您的工作负载的计算解决方案或工具可能取决于多种因素。例如,如果您想将 VMware 环境迁移到Google Cloud,则使用 VMware Engine

为了帮助您权衡基础设施管理、容器和 Compute Engine 实例之间的利弊,请使用以下流程图。如果您想快速比较不同计算选项的功能,请参阅本文档中的比较表

一份流程图,可帮助您在 Google Cloud中选择计算选项。

上述流程图中的问题如下所示:

  1. 您是否希望 Google 管理所有基础设施?

  2. 您是否希望为工作负载(例如 Kubernetes 或 Slurm)提供集群编排?

    • :请跳至第 4 题。

    • :请前往第 3 题。

  3. 您是否要自行管理虚拟机或裸金属实例?

  4. 您是否要运行标准容器化应用(例如微服务或 API)?

  5. 您是否希望 Google 管理集群生命周期?

使用 Batch

对于异步数据分析、视频转换任务或科学模拟等工作负载,请选择“批处理”。借助 Batch,Google 会管理基础架构,以便您可以在 Google Cloud上安排、排队和执行批处理计算作业。您无需自行部署或管理服务器,只需将可执行脚本或容器化工作负载提交到作业队列即可。

Batch 提供以下功能:

  • 加速器支持:Batch 支持 NVIDIA GPU(最高可达 RTX PRO 6000),适用于需要高吞吐量的批处理和高性能计算 (HPC) 工作负载。Batch 不支持 Google TPU。

  • 操作系统和内核控制:Google 会管理作业的操作系统和执行环境。

  • 编排:作业队列会调度任务,并在发生错误时重试任务。为了扩缩容,该服务会根据排队作业的数量来预配和启动虚拟机,并在这些作业完成后停止虚拟机。

如需了解详情,请参阅 Batch 使用入门

使用 Cloud Run

选择 Cloud Run 可部署容器化的 Web 应用或作业,无需管理服务器。Cloud Run 是一个无服务器平台,可让您运行容器化应用,而无需管理服务器或集群。Google 会为您处理所有基础设施管理事宜,包括操作系统、内核、网络设置和容量管理。

Cloud Run 提供以下功能:

  • 加速器支持:Cloud Run 支持 NVIDIA RTX PRO 6000 Blackwell 和 L4 GPU。Cloud Run 不支持其他 GPU 型号或 Google TPU。

  • 操作系统和内核控制:您可以将工作负载打包为容器,并将其作为 Web 服务、异步任务或批处理作业运行。

  • 编排:作为一个无服务器平台,Google 会自动启动、运行和扩缩您的容器实例,无需人工干预。对于 Web 服务,Cloud Run 会根据传入请求或 CPU 消耗量添加或移除容器实例。

如需了解详情,请参阅 Cloud Run 是什么

使用 Cluster Director

如果您想训练 AI 模型或执行由 Slurm 调度的模拟作业,但不想进行网络设置或集群操作系统配置任务,请选择 Cluster Director。Cluster Director 是一项代管式服务,可自动执行 AI、ML 和 HPC 集群的部署和生命周期管理。

Cluster Director 提供以下功能:

  • 加速器支持:Cluster Director 支持 NVIDIA GPU,包括 GB300 Ultra 超级芯片、GB200 超级芯片、B200、H200 和 H100,可用于 AI、ML 和 HPC 工作负载。Cluster Director 不支持 Google TPU。

  • 操作系统和内核控制:Google 管理集群生命周期,并设置专为机器学习设计的自定义 Ubuntu 操作系统。该服务提供了一个开箱即用的环境,其中包含登录节点、计算节点集和专为 AI 工作负载构建的部署模板。

  • 编排:为了扩缩容量,Slurm 会在 CPU 消耗量增加时创建节点,并在节点闲置一段时间后删除节点,以避免产生不必要的费用。

如需了解详情,请参阅 Cluster Director 概览

使用 Cluster Toolkit

如果您想使用自动化部署模板,同时保持对操作系统和软件堆栈的管理控制权,请选择 Cluster Toolkit。Cluster Toolkit 是一种开源工具,用于在 Google Cloud上预配和配置 AI、机器学习和 HPC 集群。

Cluster Toolkit 提供以下功能:

  • 加速器支持:Cluster Toolkit 支持 NVIDIA GPU 和 Google TPU,您可以使用称为“蓝图”的部署模板来预配和配置这些加速器。借助这些自动化配置文件,您可以根据基础架构即代码 (IaC) 原则部署标准化、可重复的集群基础架构。

  • 操作系统和内核控制:Cluster Toolkit 会在您的 Google Cloud项目中部署计算实例或 GKE 资源。部署这些资源后,您将继续对操作系统、软件设置和集群生命周期保持管理控制权。

  • 编排:如需扩缩容量,您可以配置托管式实例组 (MIG) 或 GKE 工具,以根据模板设置添加或移除节点。

如需了解详情,请参阅 Cluster Toolkit 概览

使用 Compute Engine

如果您的应用需要自定义架构配置、专用内核设置或对虚拟服务器的管理员控制权限,请选择 Compute Engine。Compute Engine 是 Google Cloud的核心基础架构即服务 (IaaS) 平台,可让您在 Google 的物理硬件上创建和运行虚拟机和裸机实例。

Compute Engine 提供以下功能:

  • 加速器支持:Compute Engine 支持 NVIDIA GPU 和 Google TPU,您可以将它们挂接到计算实例。

  • 操作系统和内核控制:您可以完全控制操作系统、内核设置和启动文件,并选择 CPU 处理器、内存配置、存储类型和客户机操作系统。

  • 编排:由于编排是手动完成的,因此您需要自行设置和管理计算实例、网络规则、流量路由和备份系统,以确保可靠性。如需扩缩容量,您可以根据需要添加或移除计算实例、使用自定义工具,或者配置 MIG 来调整集群容量。

如需了解详情,请参阅 Compute Engine 概览

使用 GKE

如果您需要一个基于容器的强大编排平台来处理分布式应用或通用微服务,请选择 Google Kubernetes Engine (GKE)。GKE 是一种行业标准的托管式 Kubernetes 平台,可用于部署、扩缩和编排容器化应用。Google 会管理 Kubernetes 控制平面,以确保安全性和系统可用性。

GKE 提供以下功能:

  • 加速器支持:GKE 支持 NVIDIA GPU 和 Google TPU,可用于容器化工作负载。

  • 操作系统和内核控制:Google 在 Autopilot 模式和 Standard 模式下都会管理操作系统。在 Autopilot 模式下,Google 会管理集群节点和容量调整,无需手动干预。在 Standard 模式下,您需要管理集群节点池。

  • 编排:为了根据需求变化调整容量,GKE 会使用 Pod 横向自动扩缩器 (HPA) 和 Pod 纵向自动扩缩器 (VPA) 添加或移除容器,并使用集群自动扩缩器添加或移除节点。GKE 还通过 Kueue 编排批处理作业。

如需了解详情,请参阅 GKE 概览

使用 VMware Engine

选择 VMware Engine,将本地 VMware 工作负载迁移到 Google Cloud 基础架构,同时尽可能减少运营方面的变更。 VMware Engine 是一项代管式服务,可让您在 Google 硬件上运行 VMware 虚拟机,而无需修改应用。

VMware Engine 提供以下功能:

  • 加速器支持:VMware Engine 不支持 GPU 或 TPU。

  • 操作系统和内核控制:您可以在 Google Cloud上运行 VMware 应用,就像在现有设置中运行一样。Google 会管理物理硬件、网络基础架构和 VMware 软件平台,例如 vSphere、vCenter、vSAN 和 NSX-T。您可以保留对虚拟机、客户操作系统和 VMware 管理工具的管理控制权。

  • 编排:如需调整私有云的大小,您可以添加或移除专用 ESXi 节点。

如需了解详情,请参阅 Google Cloud VMware Engine 概览

比较计算选项

如需确定适合您工作负载的计算解决方案或工具,请比较下表中各种计算选项的技术能力:

计算选项 GPU TPU 操作系统和内核控制 编排 扩缩
Batch 最高可配置 NVIDIA RTX PRO 6000 由 Google 管理 作业队列 基于排队作业的自动化
Cloud Run NVIDIA RTX PRO 6000 Blackwell 和 L4 由 Google 管理 无服务器 根据请求或 CPU 消耗量自动调整
Cluster Director NVIDIA GB300 Ultra 超级芯片、GB200 超级芯片、B200、H200 和 H100 由 Google 管理(自定义 Ubuntu) Slurm 基于 CPU 消耗的自动化
Cluster Toolkit 所有可用的 NVIDIA GPU 所有可用的 Google TPU 自行管理 自动化配置文件 (IaC) 可使用 MIG 或 GKE 工具进行自定义
Compute Engine 所有可用的 NVIDIA GPU 所有可用的 Google TPU 自行管理 手动 使用 MIG 手动或自动扩缩
Google Kubernetes Engine (GKE) 所有可用的 NVIDIA GPU 所有可用的 Google TPU 由 Google 管理 (Autopilot) 或半管理 (Standard) Kubernetes 自动伸缩 Pod 和节点
VMware Engine 由 Google 管理 VMware 平台 使用 ESXi 节点手动创建