图形处理器 (GPU) 是一种专用硬件加速器,旨在同时处理大规模并行工作负载。在Google Cloud上,您可以将 NVIDIA GPU 关联到 Compute Engine 实例和裸金属实例,以加速要求严苛的工作负载,例如人工智能 (AI) 和机器学习 (ML) 训练、高性能计算 (HPC)、图形渲染和视频转码。
本文档简要介绍了 Google Cloud中的 GPU,包括可用的 GPU 型号、机器系列映射、性能特征、理想的应用场景和价格注意事项。
什么是 GPU?
GPU 是一种大规模并行处理器,最初是为计算机图形而设计的,现已发展成为 AI、机器学习和科学计算必不可少的计算引擎。与包含少量强大核心(针对顺序单线程处理进行了优化)的中央处理器 (CPU) 不同,GPU 包含数千个较小的高效核心,旨在跨大型数据集同时执行数学计算。
GPU 系统的关键架构组件如下:
CUDA 核心:通用矢量处理单元,使用单指令多线程 (SIMT) 架构,同时在多个并行线程中执行指令。CUDA 核心可处理标准向量和浮点计算(例如 FP32 和 FP64),以及常规图形渲染和物理模拟。
Tensor Core:专门的矩阵乘累加 (MMA) 处理单元,旨在加速神经网络计算。Tensor Core 可通过专用数值精度格式(包括 FP4、FP8、INT8、TF32 和 FP16/BF16)为 AI 训练和推理提供指数级加速。
高带宽内存:专用设备端内存,可提供高达每秒数 TB (TBps) 的带宽,例如高带宽内存 (HBM) 或图形双倍数据速率 (GDDR)。这种高吞吐量可在密集矩阵运算期间为数千个 GPU 核心提供数据。
高速互连(NVLink 和 NVSwitch):高带宽、低延迟的互连技术,用于连接同一服务器上或跨节点的多张 GPU 卡。NVLink 可实现直接的 GPU 到 GPU 通信,绕过速度较慢的 PCIe 总线,从而使 GPU 集群能够作为单个连贯的加速器内存池运行。
虚拟工作站软件 (NVIDIA RTX vWS):企业软件,可为远程可视化工作站、计算机辅助设计 (CAD)、数字内容创建和 3D 建模提供虚拟化图形加速。
GPU 型号和机器系列
Google Cloud 提供多代 NVIDIA GPU,以满足不同的工作负载和预算需求。在 Compute Engine 上,GPU 可以作为预配置的加速器优化型机器系列(A 系列和 G 系列)提供,也可以作为可附加的加速器在通用 N1 机器系列上提供。
下表总结了 Compute Engine 上提供的 GPU 型号的硬件规格、机器系列映射、网络带宽和存储功能:
| GPU 模型 | 机器系列 | 架构 | GPU 内存和带宽 | 每个计算实例的 GPU 数量 | 最大网络带宽 | 本地 SSD | 互连 | NVIDIA RTX 虚拟工作站 (vWS) 支持 |
|---|---|---|---|---|---|---|---|---|
| NVIDIA GB300 | A4X Max | Blackwell Ultra | 279 GB HBM3e (8 TBps) | 4 (NVL72) | 3,600 Gbps | 12,000 GiB | NVLink Full Mesh (1,800 GBps) | 否 |
| NVIDIA GB200 | A4X | Blackwell | 186 GB HBM3e (8 TBps) | 4 (NVL72) | 2,000 Gbps | 12,000 GiB | NVLink Full Mesh (1,800 GBps) | 否 |
| NVIDIA B200 | A4 | Blackwell | 180 GB HBM3e (8 TBps) | 8 | 3,600 Gbps | 12,000 GiB | NVLink Full Mesh (1,800 GBps) | 否 |
| NVIDIA H200 | A3 Ultra | 豆仓 | 141 GB HBM3e (4.8 TBps) | 8 | 3,600 Gbps | 12,000 GiB | NVLink Full Mesh (900 GBps) | 否 |
| NVIDIA H100 | A3 Mega、A3 High、A3 Edge | 豆仓 | 80 GB HBM3 (3.35 TBps) | 1、2、4、8 | 最高 1,000 Gbps | 最多 6,000 GiB | NVLink Full Mesh (900 GBps) | 否 |
| NVIDIA A100 (80GB) | A2 Ultra | Ampere | 80 GB HBM2e (1.9 TBps) | 1、2、4、8 | 100 Gbps | 最高 3,000 GiB | NVLink Full Mesh (600 GBps) | 否 |
| NVIDIA A100 (40GB) | A2 标准 | Ampere | 40 GB HBM2 (1.6 TBps) | 1、2、4、8、16 | 100 Gbps | 最高 3,000 GiB | NVLink Full Mesh (600 GBps) | 否 |
| NVIDIA RTX PRO 6000 | G4 | Blackwell | 96 GB GDDR7 (1.597 TBps) | 1/8、1/4、1/2、1、2、4、8 | 200 Gbps | 最高 3,000 GiB | PCIe 第 5 代 | 是 |
| NVIDIA L4 | G2 | Ada Lovelace | 24 GB GDDR6 (300 GBps) | 1、2、4、8 | 100 Gbps | 最高 3,000 GiB | PCIe 第 4 代 | 是 |
| NVIDIA T4 (即将终止支持) |
N1+T4 | Turing | 16 GB GDDR6 (320 GBps) | 1、2、4 | 100 Gbps | 支持 | PCIe 第 3 代 | 是 |
| NVIDIA V100 | N1+V100 | Volta | 16 GB HBM2 (900 GBps) | 1、2、4、8 | 100 Gbps | 支持 | NVLink Ring (300 GBps) | 否 |
| NVIDIA P100 (即将停止支持) |
N1+P100 | Pascal | 16 GB HBM2 (732 GBps) | 1、2、4 | 100 Gbps | 支持 | PCIe 第 3 代 | 是 |
| NVIDIA P4 (支持即将终止) |
N1+P4 | Pascal | 8 GB GDDR5 (192 GBps) | 1、2、4 | 100 Gbps | 支持 | PCIe 第 3 代 | 是 |
GPU 性能特征
选择合适的 GPU 型号取决于工作负载的计算特征、内存要求、精度格式和可伸缩性需求。
理想的使用场景和工作负载要求
GPU 可加速 AI、视觉计算和科学建模等各种计算工作负载。如需了解每个工作负载类别的架构要求,请选择以下标签页之一:
AI/机器学习训练
前沿基础模型和混合专家 (MoE):对大型 Transformer 模型、多模态架构和混合专家 (MoE) 网络进行预训练需要高 Tensor Core 吞吐量、大高带宽内存 (HBM) 容量(每个 GPU 最高 279 GB)和超高速 NVLink 互连带宽(最高 1,800 GBps),以最大限度地减少多节点同步延迟。建议的机器系列:
- A4X Max (NVIDIA GB300)
- A4X (NVIDIA GB200)
- A4 (NVIDIA B200)
- A3 Ultra (NVIDIA H200)
- A3 Mega (NVIDIA H100)
如需了解详情,请参阅 AI Hypercomputer 文档中的有关预训练模型的建议。
微调和中等规模的模型训练:使用参数高效微调 (PEFT) 和低秩适应 (LoRA) 等技术来调整现有基础模型需要足够的 GPU 内存来保存模型权重和梯度,而无需使用千万亿次级多节点集群。推荐的机器系列:
如需了解详情,请参阅 AI Hypercomputer 文档中的有关微调模型的建议。
AI/机器学习推理
大模型推理(超过 700 亿个参数):服务于海量大语言模型 (LLM),得益于高高带宽内存 (HBM3e) 容量(每个 GPU 141-186 GB),可将模型权重分配到更少的 GPU 上,从而减少芯片间通信开销。推荐的机器系列:
高吞吐量和实时服务:低延迟互动式查询、流式响应和图片生成使用硬件加速的量化数值格式(例如 8 位浮点数 [FP8]、8 位整数 [INT8] 和 4 位整数 [INT4]),以最大限度地提高每美元的请求吞吐量。建议的机器系列:
- G2 (NVIDIA L4)
- G4 (NVIDIA RTX PRO 6000)
- A3 Edge 和 High (NVIDIA H100)
如需了解详情,请参阅 AI Hypercomputer 文档中的有关服务推理的建议。
图形和视觉计算
3D CAD、数字孪生体和虚拟工作站:交互式 3D 建模、计算机辅助设计 (CAD)、建筑渲染和数字孪生体(例如 NVIDIA Omniverse)使用专用光线追踪 (RT) 核心和 NVIDIA RTX 虚拟工作站 (vWS),以实现远程可视化工作站和部分虚拟 GPU (vGPU)。建议的机器系列:
视频处理和转码:直播流处理流水线、视频转码和媒体处理使用专用硬件 NVIDIA 编码器 (NVENC) 和 NVIDIA 解码器 (NVDEC) 视频引擎,支持 AV1、高效率视频编码 (HEVC) 和 H.264 编解码器。建议的机器系列:
HPC 和模拟
科学模拟和建模:分子动力学(例如 GROMACS 和 AMBER)、计算流体动力学 (CFD)、量子化学、天体物理学和天气预报方面的应用需要高 64 位双精度 (FP64) 浮点性能和高内存带宽。建议的机器系列:
如需了解详情,请参阅 AI Hypercomputer 文档中的有关 HPC 的建议。
工作负载注意事项
GPU 通常不适合以下工作负载:
- 顺序和单线程逻辑:以顺序决策分支或串行执行流水线为主的任务在单核时钟频率较高的 CPU 上表现更好。
- 标准 Web 应用和微服务:通用 Web 服务器、关系型数据库管理系统 (RDBMS) 和标准 API 后端(没有 AI 或图形处理要求)无法从 GPU 加速中受益。这些工作负载更适合在通用型或计算优化型 CPU 实例上以更具成本效益的方式托管。
- 针对 XLA 和图编译框架优化的工作负载:如果您的深度学习模型是使用 JAX、PyTorch/XLA 或 TensorFlow 等框架构建的,那么它们可以利用编译器驱动的图优化 (XLA)。如果您的模型也能受益于自定义矩阵阵列和光路交换,那么不妨考虑评估专为这些特定执行范式设计的替代加速器架构。
价格注意事项
以下因素决定了 Google Cloud上的 GPU 价格:
具体 GPU 型号。
所连接 GPU 的数量。
预配的资源,例如 vCPU、系统内存和存储空间。
您选择的使用模式。
以下部分概述了 Google Cloud中 GPU 的可用使用模式和折扣选项。
使用和购买模式
您可以根据可用性要求和费用承受能力,使用以下几种消费选项来预配 GPU 实例:
按需:标准随用随付 (PAYG) 价格,按秒计费,无需长期合约。按需实例可为开发、测试和可变生产工作负载提供完整的生命周期灵活性。
Spot 虚拟机:折扣力度很大的计算实例(比按需价格低 60% 到 91%),可从过剩的Google Cloud 容量中提取资源。由于 Google Cloud 可以提前 30 秒通知您停止或删除 Spot 虚拟机来收回容量,因此这些计算实例非常适合容错批量机器学习训练、可设置检查点的批量作业和分布式数据处理。
灵活启动型虚拟机:由动态工作负载调度器 (DWS) 提供支持的动态调度选项,可在指定期限内以折扣价为固定时长的工作负载(最长 7 天)预配 GPU 资源。
预留:
- 预留:您可以预留标准 GPU 的容量,并立即使用预留的容量。
- 未来预留(日历模式和 AI Hypercomputer):您可以请求在未来某个日期和时间预留集群化 GPU 容量。如果 Google Cloud 批准了您的请求,您可以在指定的时间开始使用容量,并在预留结束之前保留独占访问权限。
折扣选项
承诺使用折扣 (CUD):提供大幅折扣(3 年期承诺最高可享 55% 的折扣,1 年期承诺最高可享 37% 的折扣),以换取您承诺在特定区域内保持持续的资源使用量。对于加速器优化机器类型和所挂接的 GPU,CUD 需要购买附加了预留的基于资源的承诺。
持续使用折扣 (SUD):当 N1 计算实例和所挂接的 GPU 的运行时间超过结算月份的 25% 时,系统会自动应用折扣。加速器优化型机器系列(A 系列和 G 系列)不接收 SUD。
如需详细了解所有区域的每小时价格和每月价格,请参阅 GPU 价格页面和虚拟机实例价格页面。
如需查看所有加速器机器类型的使用选项可用性的详细功能矩阵,请参阅使用选项可用性(按机器类型)。
后续步骤
- 探索加速器优化机器系列中的 GPU 机器。
- 了解如何创建挂接 GPU 的虚拟机。
- 如需了解 Google Cloud的超级计算 AI 架构,请参阅 AI Hypercomputer 概览。