Google 计算概览

本文档介绍了Google Cloud中提供的计算服务。通过了解基础设施控制和管理抽象的范围,您可以获得选择合适计算服务所需的基础知识。

Google Cloud 中的“计算”一词是指运行应用所需的虚拟化计算资源,例如处理能力和内存。这些资源包括原始虚拟机 (VM) 实例和全代管式平台。借助虚拟机实例,您可以完全自定义操作系统 (OS)、网络和软件堆栈。对于托管平台,Google 会处理大部分底层基础架构。

高级服务区域

Google Cloud 上的计算类别涵盖以下关键服务领域:

  • 虚拟机实例和裸机实例:Compute Engine 提供可配置的虚拟机和裸机实例,您可以在其中安装和管理自己的操作系统和应用。此配置还包括向自定义虚拟机或裸金属实例添加图形处理单元 (GPU) 或张量处理单元 (TPU)。

  • 容器:借助 Google Kubernetes Engine (GKE) 等服务,您可以部署和管理容器化应用。

  • 批处理:Batch 等服务可帮助您运行大规模异步作业。

  • AI 基础设施:包括专用服务和工具(如 Cluster Director 和 Cluster Toolkit)、专用硬件(NVIDIA GPU 和 Google TPU)、开放式软件和灵活的消费模式。这些服务旨在大规模运行复杂、精心编排的人工智能 (AI) 或机器学习 (ML) 训练和推理工作负载。

  • HPC 基础设施:包括用于执行高性能计算 (HPC) 工作负载(例如紧密耦合的物理模拟、天气模型或分子动力学)的专用服务和硬件。

基础架构中的控制与抽象

Google Cloud 提供一系列计算服务,涵盖各种控制和抽象程度。主要有以下两大类:

基础设施即服务

基础架构即服务 (IaaS) 是提供最大控制权的模型。 您负责管理操作系统、中间件和应用。而是由 Google 管理底层虚拟化、服务器、存储和网络。 Google Cloud 中提供的 IaaS 解决方案包括:

  • Compute Engine:借助此服务,您可以在 Google 的基础设施上创建并运行虚拟机和裸机实例。Compute Engine 提供了灵活性,让您可以选择各种机器系列、存储服务、加速器和 Guest 操作系统,从而运行各种工作负载。

  • Google Cloud VMware Engine:一项可让您在 Google Cloud上原生迁移和运行 VMware 工作负载的服务。Google 管理底层硬件和 VMware 平台。您可以保留对虚拟机、访客操作系统和应用的完全控制权。此方法可帮助您迁移到云端,而无需重新设计现有 VMware 环境的架构。

IaaS 通常是需要从头开始设计和管理自定义环境的基础设施架构师、机器学习基础设施工程师和平台工程师的首选。

受管理的平台和服务

托管式平台和服务可兼顾控制和易用性。 Google 会管理底层基础架构、操作系统和运行时环境,以便您可以专注于运行工作负载。 Google Cloud 中提供的受管解决方案包括:

  • Batch:一项代管式服务,可让您大规模安排、排队和运行批处理计算作业。Batch 会预配 Compute Engine 资源来运行作业并管理其生命周期,因此您无需直接管理底层虚拟机或裸金属实例。

  • Cloud Run:这是一个全代管式平台,可让您在无服务器基础架构上开发和部署可伸缩性极强的容器化应用。Cloud Run 可让您不必再操心任何基础架构管理。这种抽象化让您无需管理服务器或集群,即可运行可响应 Web 请求或事件的容器。

  • Cluster Director:一项代管式服务,可自动执行 AI、机器学习或 HPC 集群的复杂设置和配置。Google 会管理集群基础架构,让您能够专注于以尽可能低的运维开销运行工作负载。

  • Cluster Toolkit:一种开源工具包,可帮助您使用预定义的蓝图在 Google Cloud 上预配 AI、ML 或 HPC 集群。您可以管理生成的集群基础架构,但该工具包会抽象化部署流程,并允许您自定义部署和软件堆栈。

  • GKE:一个托管式环境,用于在 Kubernetes 上运行容器化应用。Google 管理 Kubernetes 控制平面,而您负责部署和管理容器工作负载。根据部署模式(AutopilotStandard),您可以选择对底层基础架构的控制程度。

数据科学家、AI 研究人员和机器学习工程师通常倾向于使用托管式平台和服务,因为他们希望快速预配资源和部署工作负载,而无需深入了解基础设施管理。

后续步骤