在流式流水线中,缓慢的步骤或转换可能会限制吞吐量并导致积压传播,从而增加整体作业延迟时间。Dataflow 瓶颈检测器会自动识别并突出显示 Google Cloud 控制台中导致积压的具体步骤 ,帮助您快速 诊断和解决执行延迟问题,而无需进行试错调试。
如需从概念上大致了解 Dataflow 如何识别瓶颈 和传播积压,请参阅 Dataflow 瓶颈 检测器简介。
准备工作
在使用瓶颈检测器进行问题排查之前,请确保您的作业和项目满足以下要求:
- 您有一个正在运行的流式 Dataflow 作业。
- 您的作业是使用 Streaming Engine 运行的。对于不在 Streaming Engine 上运行的作业,不支持瓶颈检测。
- 您拥有查看 Dataflow 作业所需的 Identity and Access Management (IAM) 权限。如需了解详情,请参阅 Dataflow IAM 角色。
在 Google Cloud 控制台中查看活跃瓶颈
您可以直接在 Dataflow 监控界面中查看活跃瓶颈通知和提醒。
在 Google Cloud 控制台中,前往 Dataflow 页面。
在作业列表中,选择您的流式作业以打开作业详情页面。
在作业图 标签页下,查看执行图:
- 遇到活跃瓶颈的步骤会显示彩色警告或提醒图标。
- 提醒表示此步骤发生了超过 5 分钟的处理延迟。
点击显示警告图标的步骤。

在屏幕右侧的步骤信息 面板中,找到瓶颈 部分。此部分会显示:
- 瓶颈的种类。例如,落后、积压稳定或卡住。
- 可能的原因(如果诊断引擎已识别)。
- 持续时间和相关诊断详情。

解决瓶颈原因
如需解决瓶颈问题,请在步骤信息面板中 找出可能的原因,然后按照 排查瓶颈中的原因分步指南操作。
使用 Monitoring 监控瓶颈
如果您想设置程序化提醒或查看瓶颈活动随时间的变化情况,请使用 Monitoring。瓶颈检测器会导出以下指标:
dataflow.googleapis.com/job/is_bottleneck:一个布尔值,用于指明该阶段是否为活跃瓶颈,以及指定瓶颈种类和可能原因的标签。dataflow.googleapis.com/job/backlogged_keys:瓶颈阶段中备份的键数量。dataflow.googleapis.com/job/recommended_parallelism:建议的并行度值,用于缓解受影响阶段的瓶颈。
如需了解如何使用这些指标创建图表和提醒,请参阅 将 Monitoring 用于 Dataflow。
后续步骤
- 详细了解 Dataflow 瓶颈检测器 概念。
- 按照问题排查和调试 Dataflow 流水线的一般指南操作。