规划和创建 AI 基础架构

本文档总结了如何在 AI Hypercomputer 上为 AI 工作负载创建集群。具体来说,本文档将引导您完成启动集群时的流程并做出选择。除了手动评估之外,您还可以在 Google Cloud 控制台中提示 Gemini 比较工作负载和预算的消费选项。如需了解详情,请参阅使用 Compute Advisor 设计 AI 基础设施

本文档假定您熟悉 AI 和机器学习工作负载的常用术语,例如模型训练和推理。此外,本文还假设您已确定需要为部署确定最佳机器类型和容量需求的特定 AI 工作负载,例如基础模型预训练、微调或推理。

启动集群

启动集群涉及以下步骤:

  1. 确定工作负载并选择机器类型
  2. 选择使用选项并获取容量
  3. 选择部署选项
  4. 选择编排器
  5. 选择操作系统和集群映像
  6. 创建您的集群
  7. 为工作负载预配存储空间

确定工作负载并选择机器类型

为 AI 工作负载选择机器类型。AI Hypercomputer 支持为集群 GPU 和通用 GPU 创建集群。

为帮助您做出选择,请确定工作负载要求,并将其与推荐的机器类型和 GPU 类型相匹配:

  • 集群 GPU:最适合大规模、高性能的工作负载,例如预训练基础模型、微调大型模型,以及跨多个主机进行推理。
  • 通用 GPU:最适合主流推理和服务、检索增强生成 (RAG),以及经济实惠的小型到中型模型训练和微调。

如需将工作负载与建议的机器类型相匹配,请使用下表:

GPU 类型 工作负载或应用场景 建议的机器类型
集群 GPU 跨多个主机预训练基础模型和进行推理 A4X Max (NVIDIA GB300)*A4X (NVIDIA GB200)*
大型模型训练、微调和推理 A4 (NVIDIA B200)、A3 Ultra (NVIDIA H200 141GB)
主流模型推理和微调 A3 Mega (NVIDIA H100 80GB)、A3 High (NVIDIA H100 80GB)
通用 GPU 高吞吐量边缘服务和推理 A3 Edge (NVIDIA H100 80GB)
高性能单节点服务和小规模微调 A2 (NVIDIA A100)
费用优化的入门级推理 G4 (NVIDIA RTX PRO 6000)、N1 (NVIDIA T4 或 V100)
主流推理、RAG 以及中小型模型训练 G2 (NVIDIA L4)

如需详细了解每个机器系列,请参阅关于 GPU 加速器

选择使用选项并获取容量

请根据您所选的机器类型以及您使用的是通用 GPU 还是集群 GPU,为您的 GPU 资源选择合适的使用选项。

常规 GPU 的使用选项

使用选项 支持的设备 适用场景 请求方式
按需 所有通用 GPU 不需要保证容量的工作负载。 创建计算实例或集群,并指定标准预配模型。如需相关说明,请参阅创建虚拟机实例

提示:如需提高获得常规 GPU 容量的几率,请使用灵活启动或 Spot。
标准预订型广告和标准未来预留 所有通用 GPU 需要立即(标准预留)或在未来特定日期(标准未来预留)确保有可用容量的工作负载。 创建按需预留或未来预留请求。如需查看相关说明,请参阅预留容量
灵活启动 所有 GPU 机器类型,但 A4X Max 和 A4X 除外。 需要持续时间不超过 7 天的短期密集型集群的工作负载。提供密集的资源分配,并为支持的机器类型提供最高 53% 的折扣;否则,将按标准按需费率收费。 使用 Compute Engine、Cluster Director、Cluster Toolkit 或 GKE 创建请求。资源会在可用后立即配置(开始时间不是立即)。如需查看相关说明,请参阅获取容量
Spot 所有 GPU 机器类型(A4X Max 和 A4X 除外)。 容错、批处理或短期运行的工作负载。提供最大力度的折扣(介于 61% 和 90% 之间),但计算资源可随时被抢占。 使用 Spot 预配模型立即创建实例或节点池。如需查看相关说明,请参阅获取容量

集群化 GPU 的使用选项

使用选项 支持的设备 适用场景 请求方式
AI Hypercomputer 中的未来预留 所有集群 GPU 和 A3 Edge 机器类型。 需要长时间保持稳定的工作负载,例如基础模型预训练或跨多个主机的基础模型推理。提供密集的资源分配,vCPU 和 GPU 最高可享受 53% 的折扣。 通过您的 Google 客户支持团队请求容量,并指定未来的开始日期和时间。
日历模式下的未来预留 所有集群 GPU,但 A4X Max 和 A4X 除外。 运行时间不超过 90 天且需要稳定性的工作负载,例如预训练或微调模型。提供密集的资源分配,折扣最高可达 53%。 为未来某个日期和时间创建自助式预留请求; Google Cloud 必须批准该请求。如需查看相关说明,请参阅预留容量
灵活启动 所有 GPU 机器类型(A4X Max 和 A4X 除外)。 需要持续时间不超过 7 天的短期密集型集群的工作负载。提供密集的资源分配,并为支持的机器类型提供最高 53% 的折扣;否则,将按标准按需费率收费。 使用 Compute Engine、Cluster Director、Cluster Toolkit 或 GKE 创建请求。资源会在可用后立即完成配置(开始时间不是立即)。如需查看相关说明,请参阅获取容量
Spot 所有 GPU 机器类型(A4X Max 和 A4X 除外)。 容错、批处理或短期运行的工作负载。提供最大力度的折扣(介于 61% 和 90% 之间),但计算资源可随时被抢占。 使用 Spot 预配模型立即创建实例或节点池。如需查看相关说明,请参阅获取容量

选择部署选项

根据您对集群部署所需的控制级别,选择以下选项之一:

高度管理

高度托管的部署选项可自动设置和编排计算、网络和存储资源,从而减少集群管理的运营开销。如需部署和配置基础架构,请使用 Cluster Director、Cluster Toolkit 或 GKE。

  • Cluster Director:Google Cloud 产品,可自动执行复杂的集群设置和配置,帮助您为集群配置计算、网络和存储资源,以最大限度地提高性能并最大限度地减少停机时间。Cluster Director 专为希望避免管理集群的开销,转而专注于运行工作负载的 IT 管理员和 AI 研究人员而设计。

  • Cluster Toolkit:Google 提供的开源工具,可简化 GKE 或 Compute Engine 的集群配置和部署。您可以使用预定义的蓝图来部署常见配置,例如使用 Slurm 的 A4 机器类型。您可以修改蓝图,以自定义部署和软件栈。

  • GKE:一种托管式 Kubernetes 服务和开源容器编排平台。GKE 提供自动扩缩和高可用性等功能。它还能够编排容器化应用、支持专用硬件,并且与 Google Cloud生态系统兼容,因此非常适合部署和管理 AI 或机器学习工作负载。您可以使用 GKE 直接部署 GKE 集群,也可以使用 Cluster Toolkit 部署。

更少管理,更多控制

如需更精细地控制集群和安装在集群上的软件,请使用代管式 Compute Engine 实例组 (MIG) 或通过批量创建实例来创建 Compute Engine 集群。然后,在实例上手动安装所需的任何关键软件。

选择编排器

编排程序可自动管理集群。借助编排程序,您无需管理集群中的每个计算实例。Slurm 或 GKE 等编排程序可处理作业排队、资源分配、自动扩缩(使用 GKE)等任务,以及其他日常集群管理任务。

  • Slurm:Slurm 是一种开源编排器,通常用于 HPC、AI 或 ML 工作负载。如需获得受管理的 Slurm 体验,您可以使用 Cluster Director。如需原生使用 Slurm,您可以使用 Cluster Toolkit(它提供集群蓝图,可自动在集群上安装 Slurm),也可以在 Compute Engine 集群上手动安装 Slurm。

  • GKE:GKE 是一项以 Kubernetes(一种开源容器编排平台)为基础构建而成的代管式服务。GKE 非常适合部署和管理 AI 或机器学习工作负载,因为它能够编排容器化应用、支持专用硬件,并且在 Google Cloud生态系统中占据一席之地。您可以使用 GKE 直接部署 GKE 集群,也可以使用 Cluster Toolkit 部署。

  • 自带编排器:如需使用其他编排器,请使用 Compute Engine 集群。创建 Compute Engine 集群是 Google Cloud上提供的管理程度最低的选项。选择此选项意味着您需要负责设置、维护和更新实例。

选择操作系统映像

您应使用的映像取决于您使用的 GPU 基础架构(集群 GPU 或通用 GPU)以及您计划如何部署集群(GKE、Slurm 或 Compute Engine)。对于 GKE 集群,请使用 Container-Optimized OS。对于 Compute Engine 和 Slurm 集群,请选择针对加速器(例如 GPU)优化的操作系统映像。此外,您还可以为工作负载选择深度学习软件层 (DLSL) 容器映像。

如需了解详情,请参阅 AI Hypercomputer 映像

GKE 集群的映像

如需创建 GKE 集群,请针对 Standard 和 Autopilot 模式使用默认容器操作系统映像。不过,在标准模式下,您还可以选择使用其他可用的映像,例如 Ubuntu。

如果您使用 Cluster Toolkit 部署集群,则只能使用容器操作系统映像,因为这些映像内置于集群蓝图中。如需详细了解每种节点映像,请参阅 GKE 文档中的节点映像

GKE 还提供深度学习软件层 (DLSL) 容器映像,其中安装了 NVIDIA CUDA 和 NCCL 等软件包,以及 PyTorch 等机器学习框架,可为深度学习工作负载提供即用型环境。这些预构建的 DLSL 容器映像经过测试和验证,可在 GKE 集群上无缝运行。

Compute Engine 集群的操作系统映像

AI Hypercomputer 提供了一些映像,这些映像经过优化,可使用 Compute Engine 运行 AI 和 ML 工作负载。选择您最熟悉的操作系统:

  • Rocky Linux 9 加速器
  • Rocky Linux 8 加速器
  • Ubuntu 24.04 LTS 加速器
  • Ubuntu 22.04 LTS 加速器

如果您使用 Cluster Toolkit,这些加速器映像已捆绑到 Cluster Toolkit 蓝图中,因为 Cluster Toolkit 会创建扩展 Ubuntu LTS 加速器操作系统映像的自定义映像。

如需详细了解每个操作系统映像,请参阅 Compute Engine 文档中的操作系统详细信息

创建您的集群

在查看集群创建流程并为工作负载做出初步决定后,请使用以下选项之一创建集群:

为工作负载预配存储空间

根据性能、费用和存储架构要求,选择要预配的存储服务