选择加速器基础设施

您可以根据自己的生命周期阶段(例如小规模原型设计、实时推理和大规模分布式训练),通过本文档确定适合您的人工智能 (AI) 和机器学习 (ML) 工作负载的最佳加速器基础设施。AI Hypercomputer 将加速器产品分为两类:通用 GPU集群 GPU

GPU 基础设施

AI Hypercomputer 提供两种不同的 GPU 类别。每个类别都有不同的管理模式,用于确定系统如何处理生命周期事件、管理维护以及优化工作负载的网络:

常规 GPU 管理模型

通用 GPU 管理模型专为优先考虑资源独立性和高可用性的工作负载而设计。此模型使用标准 Google Cloud 管理平面,可为已在使用 Compute Engine 或 GKE 的团队提供熟悉的体验。

  • 维护:异步。各个实例会独立更新。在多节点服务集群中,一个节点上的维护事件不会影响其他节点的可用性,从而可以将流量重定向到运行状况良好的节点,而不会导致整个作业停滞。

  • 主要使用场景:推荐用于主流任务,例如实时推理、模型部署、小规模原型设计以及不需要超算规模的开发环境。

常规 GPU 机器系列

以下机器系列属于通用 GPU:

  • G2 (L4)
  • G4 (RTX PRO 6000)
  • A2 (A100)
  • N1+T4
  • A3 Edge
  • A3 High(1、2 或 4 个 GPU)

如需了解每种通用 GPU 机器的技术信息,请参阅 GPU 机器类型

集群 GPU 管理模型

集群式 GPU 管理模型是一种超级计算级环境,专为大规模分布式训练而设计。通过使用集群 GPU 堆栈,资源可以作为单个紧密耦合的系统进行管理。

  • 维护:协调。此模型可协调维护事件,以支持紧密耦合的工作负载。对于分布式训练,您可以使用同步维护,即同时在所有节点上应用更新。这种方法可防止节点重启导致作业停滞,并最大限度地提高有效吞吐量。此模型还提供 90 天的维护通知。

  • 主要使用场景:专为训练具有数万亿参数的百亿亿级基础模型或运行复杂的高性能计算 (HPC) 模拟(例如药物发现和蛋白质折叠)而设计。

集群 GPU 机器系列

以下机器系列属于集群 GPU:

  • A4X
  • A4 (Blackwell)
  • A3 Ultra
  • A3 Mega
  • A3 High(8 个 GPU)

如需了解每种集群 GPU 机器的技术信息,请参阅 GPU 机器类型

功能矩阵

比较常规 GPU 和集群 GPU 管理模型的技术和运营特征:

特征 常规 GPU 管理模型 集群 GPU 管理模型
主要应用场景 推理、模型部署、原型设计和开发 大规模分布式训练和 HPC
维护 异步:独立的节点更新允许重定向流量,而不会导致作业停滞 协调:支持集群范围内的协调(同步)更新,以保持节点同步并最大限度提高有效吞吐量
目标硬件 G2 (L4)G4 (RTX PRO 6000)A2 (A100)N1+T4A3 EdgeA3 High(1、2 或 4 个 GPU) A4XA4 (Blackwell)A3 UltraA3 MegaA3 High(8 个 GPU)
网络 通过 gVNIC 接口实现的标准 VPC 网络(A3 Edge 除外,它通过多个 VPC 使用 GPUDirect-TCPX) 专用低延迟光纤网(RDMA、RoCE、TCPX 或 NVIDIA NVLink)
管理堆栈 标准 Google Cloud 平台(Compute Engine 或 GKE) 专用管理堆栈(例如 Cluster Director)
可靠性 标准节点自动修复和 Pod 级正常运行时间 专业资源和恢复套件

决策矩阵

使用此矩阵确定哪些硬件系列符合您的特定工作负载意图:

如果您的工作负载涉及… 推荐的 GPU 基础设施 推荐的机器系列
原型设计和开发 通用 GPU G2G4A2N1+T4A3 Edge
实时推理(参数数量 < 1000 亿) 通用 GPU G2G4A2N1+T4A3 Edge
跨多个 GPU 进行推理 集群 GPU A3A4
大规模训练和推理 集群 GPU A4A3 系列
大规模训练(> 5,000 亿个参数)和分离式推理 集群 GPU A4X MaxA4XA4

如需详细了解如何通过决策树将模型架构直接映射到硬件,请参阅选择加速器

确定这些主要标准后,选择一个编排平台。此选择取决于您的团队是偏好自动化管理,还是对操作系统和驱动程序进行精细控制。

后续步骤