集群 GPU(例如 A4X Max、A4X、A4、A3 Ultra、A3 Mega 和 A3 High(8 个 GPU)机器系列)旨在让您能够运行大规模人工智能 (AI) 和机器学习 (ML) 集群,并提供以下集群管理功能:
支持的机器系列
本页面介绍的集群管理功能适用于集群 GPU 机器系列,该系列经过优化,可处理多节点大规模工作负载。
这些功能不适用于通用 GPU 机器系列,该系列由使用标准 VPC 网络且不支持维护操作模式或密集托管的独立算力资源组成。
下表总结了 AI Hypercomputer 中支持的机器系列:
| 类别 | 机器系列 | 支持集群管理 |
|---|---|---|
| 集群 GPU | A4X Max、A4X、A4、A3 Ultra、A3 Mega、A3 High | 是 |
| 通用 GPU | A3 Edge、A2、G2、G4、N1 | 否 |
如需详细了解每个机器系列,请参阅关于 GPU 加速器。
大多数集群管理功能仅支持与预留绑定的容量,即使用与预留绑定的预配模型的基础设施,该模型仅支持集群 GPU 机器类型。对于使用任何其他配置模型的容量,仅提供以下集群管理功能:
集群式 GPU 基础架构托管
使用集群 GPU(例如 A4X Max、A4X、A4、A3 Ultra、A3 Mega 和 A3 High [8 个 GPU])时,您可以请求 Compute Engine 将宿主机布置得尽可能靠近。这些机器具有以下功能:
Compute Engine 会以资源块的形式预配机器。
动态机器学习 (ML) 网络结构可将机器互连起来。
这种资源安排可最大限度地减少网络跃点,并针对最短网络延迟时间进行优化。如需部署 Compute Engine 密集分配的加速器优化型机器块,您可以使用以下选项:
当您执行以下一项或多项操作时,资源需要彼此紧密分配:
创建使用相同 AI Hypercomputer 未来预留或日历模式未来预留的资源。
部署使用调整大小请求的托管式实例组 (MIG),并在同一请求中创建资源。
指定资源使用相同的紧凑布置政策或工作负载政策,且该政策指定了最大距离值。具体来说,资源只需达到政策指定的最大距离值即可。
当您执行以下一项或多项操作时,系统会根据尽力而为的可用性,选择性地将资源密集分配给彼此:
在同一请求中为灵活启动虚拟机创建资源。
指定资源使用相同的紧凑布置政策或工作负载政策,且该政策未指定最大距离。
集群拓扑感知布置
创建集群 GPU 后,您可以获取节点级和集群级拓扑信息。这些信息可帮助您执行以下操作:
调整应用或工作负载设计,以进一步缩短网络延迟时间。
了解并排查经常相互通信的实例的网络延迟和性能问题。如果实例意外地相距很远,则可能会出现这些问题。
具体来说,对拓扑功能的支持如下:
拓扑信息最适合与绑定到预留的容量搭配使用,这是查看预留的拓扑所必需的。
拓扑功能仅支持支持紧凑布置政策的机器类型。
对于 Spot 虚拟机,只有当机器使用紧凑布置政策时,才会显示拓扑信息。
如需了解详情,请参阅查看计算实例拓扑。
集群运行模式
当您预留容量以使用集群 GPU 创建计算实例或集群时,您预留的机器类型决定了实例的集群运行模式。此模式用于指定实例在发生主机错误或收到主机故障报告后的行为。实例的可用运行模式包括托管模式,在此模式下,Compute Engine 会自动替换任何故障机器,但会保留部分预留容量,以确保您的实例拥有重启所需的资源。或者全容量模式,您可以使用预留的全部容量,但需要负责管理故障和计划内维护。
如需了解详情,请参阅预留运行模式。
集群维护调度和控制
您可以在资源块中使用感知拓扑的调度来控制集群 GPU 的维护。此功能有助于同步升级,从而使工作负载更能应对主机事件,并最大限度地减少中断。此方法有助于提高工作负载的有效吞吐量。
为了便于您完全控制维护事件,您可以使用以下功能:
维护调度类型
在预留容量以创建计算实例或集群 GPU 集群时,您可以定义 Compute Engine 如何维护实例运行的基础设施。您可以根据要用于实例的机器类型,选择在实例之间同步维护(分组),或选择不同的维护时间表(独立)。
如需了解详情,请参阅维护安排类型。
管理主机活动
创建集群 GPU 并启动工作负载后,您可以设置提醒,以便在实例或预留块的维护安排、开始或完成时收到通知。您还可以查看实例或预留块的维护时间,并在预定时间之前手动启动维护(如果需要)。这些选项可帮助您主动控制工作负载的停机时间并将其降至最低。
详情请参阅以下内容:
集群监控和诊断工具
对于监控和问题排查,集群化 GPU 包含以下服务:
虚拟机运行状况降级预测,可帮助您识别可能在未来 5 小时内降级的虚拟机。
故障主机报告,您可以使用该服务标记单个主机的问题。
支持 Cloud Monitoring 指标,可帮助您监控网络和 GPU 性能。