数据沿袭注入控制简介

如需管理费用和治理政策,您可以针对 特定 Google Cloud 服务启用或停用数据沿袭注入。例如,您可以针对开发项目或不需要沿袭跟踪的大容量工作负载停用沿袭收集。

支持的服务集成

下表列出了支持数据沿袭注入控制的集成:

集成名称 注入控制支持 默认值 集成详情
Managed Service for Apache Spark:Apache Spark 集群 是 已启用 使用 Spark 数据沿袭
Managed Service for Apache Spark:Apache Hive 集群 是 已启用 启用 Hive 数据沿袭
Managed Service for Apache Spark:无服务器部署 是 已启用 将数据沿袭与 Managed Service for Apache Spark 搭配使用
BigQuery 是 已启用 跟踪 BigQuery 表的沿袭
Managed Service for Apache Airflow 是 已启用 使用 Knowledge Catalog 的数据沿袭
Looker (Google Cloud Core) 是(预览版) 已启用 Looker Core 数据沿袭
Cloud Data Fusion 否 已启用 在 Knowledge Catalog 中查看沿袭
Dataflow 否 从 Dataflow 端停用 在 Dataflow 中使用数据沿袭
Vertex AI Pipelines 否 已启用 跟踪流水线工件的沿袭

数据沿袭注入控制的工作原理

您可以在组织、文件夹和项目级层控制数据注入,并将这些设置与特定于服务的配置相结合,以实现对数据沿袭注入的精细控制。

Knowledge Catalog 会从项目开始评估 资源层次结构,然后是文件夹,最后是组织,以确定有效配置。在此向上遍历过程中,在任何级别显式设置的第一个配置都会生效。

  • 如果您在项目级层设置了配置,Knowledge Catalog 会使用该配置。
  • 如果未在项目级层设置任何配置,Knowledge Catalog 会使用具有显式配置的最近父文件夹中的配置。
  • 如果未在项目或文件夹级层设置任何配置,Knowledge Catalog 会使用组织级层配置。
  • 如果未在任何这些级别设置任何配置,Knowledge Catalog 会使用集成的系统默认值。

如需批量管理注入控制,请按照分层服务启用规则为文件夹或组织内的所有项目启用 Data Lineage API。启用 Data Lineage API 后,如需针对组织、各个项目或文件夹,按服务集成精细控制数据沿袭注入,请参阅此文档。

单服务集成的数据注入配置的工作原理

以下场景说明了 Knowledge Catalog 如何解析资源层次结构中单个服务的沿袭注入配置。

假设有一个组织 test-org,其中包含以下 Managed Service for Apache Spark 沿袭配置:

  • 组织 test-org:已启用
    • 文件夹 folder-a:已停用
      • 项目 project-a:未设置任何配置
    • 文件夹 folder-b:已启用
      • 项目 project-b:已停用

在此场景中,适用以下设置:

  • 对于 project-a,沿袭注入处于已停用 状态。 Knowledge Catalog 会从 project-a 开始评估,找不到任何配置,然后向上移动到 folder-a,并应用 folder-a 中的已停用 配置。
  • 对于 project-b,沿袭注入处于已停用 状态。 Knowledge Catalog 会从 project-b 开始评估,并应用 其 已停用 配置,从而替换 folder-b 和 test-org 中的设置。

多服务集成的数据注入配置的工作原理

以下场景说明了 Knowledge Catalog 如何独立解析资源层次结构中多个服务的配置。

假设有一个组织 test-org,其中包含多个服务集成中的以下沿袭配置:

  • 组织 test-org
    • Managed Service for Apache Spark:已启用
    • 文件夹 folder-a
      • BigQuery:已启用
      • 项目 project-a
        • BigQuery:已停用
        • Managed Service for Apache Airflow:已启用
      • 项目 project-b:未设置任何配置

在此场景中,Knowledge Catalog 会独立评估资源层次结构中的每个服务集成 :

  • 对于 project-a:
    • Managed Service for Apache Spark 沿袭注入处于已启用 状态。 Knowledge Catalog 会从 project-a 开始评估,找不到 Managed Service for Apache Spark 的任何配置,然后向上移动到 folder-a (未设置任何配置),并应用 已启用 配置 从 test-org。
    • BigQuery 沿袭注入处于已停用 状态。 Knowledge Catalog 会应用显式项目级层配置,该配置会 替换 已启用 配置,该配置设置于 folder-a。
    • Managed Service for Apache Airflow 沿袭注入处于已启用 状态。 Knowledge Catalog 会应用显式项目级层配置。
  • 对于 project-b:
    • Managed Service for Apache Spark 沿袭注入处于已启用 状态(继承自 test-org)。
    • BigQuery 沿袭注入处于 已启用 状态(继承自 folder-a)。
    • Managed Service for Apache Airflow 沿袭注入使用系统默认值 (已启用(如果 Data Lineage API 处于活跃状态,则默认处于已启用状态)),因为层次结构中的任何级别都未设置显式配置。

后续步骤