使用 ML 诊断查看机器学习运行作业

机器学习运行是指机器学习脚本或流水线的单次完整执行。借助 ML Diagnostics,您可以使用 CLI 或 SDK 在 Google Cloud 控制台中查看机器学习运行作业。

如需在 Cluster Director 中查看所有机器学习运行作业,请执行以下操作:

  1. 在 Google Cloud 控制台中,前往 Cluster Director 页面。
  2. 点击运行诊断标签页。

前往 Cluster Director 运行诊断

如需查看 Google Kubernetes Engine 中的所有机器学习运行,请执行以下操作:

  1. 在 Google Cloud 控制台中,前往 Kubernetes 页面。
  2. 在导航菜单中,点击 AI/ML
  3. 点击运行诊断标签页。

前往 GKE AI/ML 运行诊断程序

在 Cluster Director 和 GKE 中,您都可以找到以下信息:

  • 运行摘要:一个列表视图表格,其中包含所有机器学习运行的摘要信息。
  • 运行详细信息:每次运行的运行详细信息,包括配置和运行信息。
  • 指标的时序图表:所有指标,包括模型指标、效果指标和系统指标。您还可以使用 Logs Explorer 查看这些指标。使用 metrics.record() 方法记录的指标会写入为日志条目,并且可以进行过滤或用于创建基于日志的指标。
  • 性能分析信息:包含特定运行的所有性能分析会话的“Profiles”标签页,其中包含指向 XProf 查看器的链接。这包括通过程序和按需捕获的性能分析文件。您还可以直接通过界面捕获按需性能分析会话。
  • 通过 Google Cloud 控制台进行按需分析:在配置文件标签页中,您可以直接通过 Google Cloud 控制台捕获按需分析会话。点击捕获新的性能分析会话按钮,指定性能分析会话的捕获时长,然后选择要捕获性能分析的必需主机。运行工作负载的主机将自动填充到表中,无需手动输入。在指定的按需捕获时间过后,相应分析会话会自动显示在会话表中。