關於資料歷程擷取控制項

如要管理費用和控管政策,您可以針對特定 Google Cloud 服務啟用或停用資料沿襲擷取功能。舉例來說,您可以針對不需要沿襲追蹤的開發專案或大量工作負載,停用沿襲收集功能。

支援的服務整合

下表列出支援資料沿襲擷取控制項的整合服務:

整合作業名稱 支援擷取控制 預設值 整合作業詳細資料
Managed Service for Apache Spark:Apache Spark 叢集 已啟用 使用 Spark 資料歷程
Managed Service for Apache Spark:Apache Hive 叢集 已啟用 啟用 Hive 資料歷程
Managed Service for Apache Spark:無伺服器部署作業 已啟用 搭配使用資料沿襲與 Managed Service for Apache Spark
BigQuery 已啟用 追蹤 BigQuery 資料表的歷程
Managed Service for Apache Airflow 已啟用 使用 Knowledge Catalog 追蹤資料歷程
Looker (Google Cloud Core) 是 (預覽) 已啟用 Looker Core 資料歷程
Cloud Data Fusion 已啟用 在 Knowledge Catalog 中查看歷程
Dataflow 從 Dataflow 端停用 在 Dataflow 中使用資料歷程
Vertex AI Pipelines 已啟用 追蹤管道構件的歷程

資料歷程擷取控制項的運作方式

您可以在機構、資料夾和專案層級控管資料擷取作業,並將這些設定與服務專屬設定合併,精細控管資料歷程擷取作業。

Knowledge Catalog 會從專案開始評估資源階層,然後是資料夾,最後是機構,以判斷有效設定。系統會採用向上遍歷時在任何層級明確設定的第一個設定。

  • 如果您在專案層級設定設定,Knowledge Catalog 就會使用該設定。
  • 如果專案層級未設定任何項目,Knowledge Catalog 會使用最接近的父項資料夾設定。
  • 如果專案或資料夾層級未設定任何項目,Knowledge Catalog 會使用機構層級的設定。
  • 如果未在任何層級設定,Knowledge Catalog 會使用整合的系統預設值。

如要大量管理擷取控制項,請按照階層式服務啟用規則,為資料夾或機構內的所有專案啟用 Data Lineage API。啟用 Data Lineage API 後,即可針對機構、個別專案或資料夾,精細控管每個服務整合的資料沿襲擷取作業。

單一服務整合的資料擷取設定運作方式

以下情境說明 Knowledge Catalog 如何在資源階層中,為單一服務解析沿襲資料擷取設定。

假設某個機構 test-org 具有下列 Managed Service for Apache Spark 沿襲設定:

  • 機構 test-org已啟用
    • 資料夾 folder-a已停用
      • 專案 project-a:未設定任何設定
    • 資料夾 folder-b已啟用
      • 專案 project-b已停用

在這個情境中,適用下列設定:

  • 對於 project-a,歷程資料擷取功能為「已停用」。Knowledge Catalog 會從 project-a 開始評估,但找不到任何設定,因此會移至 folder-a,並套用 folder-a 中的「已停用」設定。
  • 對於 project-b,歷程資料擷取功能為「已停用」。Knowledge Catalog 會從 project-b 開始評估,並套用 已停用設定,覆寫 folder-btest-org 的設定。

多項服務整合的資料擷取設定運作方式

以下情境說明 Knowledge Catalog 如何在資源階層中,獨立解析多項服務的設定。

假設某個機構 test-org 在多項服務整合中,有下列沿襲設定:

  • 機構「test-org
    • Managed Service for Apache Spark:已啟用
    • 資料夾 folder-a
      • BigQuery:已啟用
      • 專案 project-a
        • BigQuery:已停用
        • Managed Service for Apache Airflow:已啟用
      • 專案 project-b:未設定任何設定

在這種情況下,Knowledge Catalog 會在資源階層中,分別評估每個服務整合:

  • 針對 project-a
    • Managed Service for Apache Spark 歷程資料擷取功能已啟用。Knowledge Catalog 會從 project-a 開始評估,找不到 Managed Service for Apache Spark 的設定,因此會移至 folder-a (未設定任何項目),並套用 test-org 的「已啟用」設定。
    • BigQuery 沿襲擷取功能已停用。 Knowledge Catalog 會套用明確的專案層級設定,並覆寫在 folder-a 設定的「已啟用」設定。
    • Managed Service for Apache Airflow 歷程擷取功能已啟用。Knowledge Catalog 會套用明確的專案層級設定。
  • 針對 project-b
    • Managed Service for Apache Spark 歷程資料擷取功能已啟用 (繼承自 test-org)。
    • BigQuery 歷程擷取功能已啟用 (繼承自 folder-a)。
    • Managed Service for Apache Airflow 歷程擷取作業會使用系統預設值 (如果 Data Lineage API 處於啟用狀態,預設為「已啟用」),因為階層中的任何層級都沒有設定明確的設定。

後續步驟