如要管理費用和控管政策,您可以針對特定 Google Cloud 服務啟用或停用資料沿襲擷取功能。舉例來說,您可以針對不需要沿襲追蹤的開發專案或大量工作負載,停用沿襲收集功能。
支援的服務整合
下表列出支援資料沿襲擷取控制項的整合服務:
| 整合作業名稱 | 支援擷取控制 | 預設值 | 整合作業詳細資料 |
|---|---|---|---|
| Managed Service for Apache Spark:Apache Spark 叢集 | 是 | 已啟用 | 使用 Spark 資料歷程 |
| Managed Service for Apache Spark:Apache Hive 叢集 | 是 | 已啟用 | 啟用 Hive 資料歷程 |
| Managed Service for Apache Spark:無伺服器部署作業 | 是 | 已啟用 | 搭配使用資料沿襲與 Managed Service for Apache Spark |
| BigQuery | 是 | 已啟用 | 追蹤 BigQuery 資料表的歷程 |
| Managed Service for Apache Airflow | 是 | 已啟用 | 使用 Knowledge Catalog 追蹤資料歷程 |
| Looker (Google Cloud Core) | 是 (預覽) | 已啟用 | Looker Core 資料歷程 |
| Cloud Data Fusion | 否 | 已啟用 | 在 Knowledge Catalog 中查看歷程 |
| Dataflow | 否 | 從 Dataflow 端停用 | 在 Dataflow 中使用資料歷程 |
| Vertex AI Pipelines | 否 | 已啟用 | 追蹤管道構件的歷程 |
資料歷程擷取控制項的運作方式
您可以在機構、資料夾和專案層級控管資料擷取作業,並將這些設定與服務專屬設定合併,精細控管資料歷程擷取作業。
Knowledge Catalog 會從專案開始評估資源階層,然後是資料夾,最後是機構,以判斷有效設定。系統會採用向上遍歷時在任何層級明確設定的第一個設定。
- 如果您在專案層級設定設定,Knowledge Catalog 就會使用該設定。
- 如果專案層級未設定任何項目,Knowledge Catalog 會使用最接近的父項資料夾設定。
- 如果專案或資料夾層級未設定任何項目,Knowledge Catalog 會使用機構層級的設定。
- 如果未在任何層級設定,Knowledge Catalog 會使用整合的系統預設值。
如要大量管理擷取控制項,請按照階層式服務啟用規則,為資料夾或機構內的所有專案啟用 Data Lineage API。啟用 Data Lineage API 後,即可針對機構、個別專案或資料夾,精細控管每個服務整合的資料沿襲擷取作業。
單一服務整合的資料擷取設定運作方式
以下情境說明 Knowledge Catalog 如何在資源階層中,為單一服務解析沿襲資料擷取設定。
假設某個機構 test-org 具有下列 Managed Service for Apache Spark 沿襲設定:
- 機構
test-org:已啟用- 資料夾
folder-a:已停用- 專案
project-a:未設定任何設定
- 專案
- 資料夾
folder-b:已啟用- 專案
project-b:已停用
- 專案
- 資料夾
在這個情境中,適用下列設定:
- 對於
project-a,歷程資料擷取功能為「已停用」。Knowledge Catalog 會從project-a開始評估,但找不到任何設定,因此會移至folder-a,並套用folder-a中的「已停用」設定。 - 對於
project-b,歷程資料擷取功能為「已停用」。Knowledge Catalog 會從project-b開始評估,並套用 已停用設定,覆寫folder-b和test-org的設定。
多項服務整合的資料擷取設定運作方式
以下情境說明 Knowledge Catalog 如何在資源階層中,獨立解析多項服務的設定。
假設某個機構 test-org 在多項服務整合中,有下列沿襲設定:
- 機構「
test-org」- Managed Service for Apache Spark:已啟用
- 資料夾
folder-a- BigQuery:已啟用
- 專案
project-a- BigQuery:已停用
- Managed Service for Apache Airflow:已啟用
- 專案
project-b:未設定任何設定
在這種情況下,Knowledge Catalog 會在資源階層中,分別評估每個服務整合:
- 針對
project-a:- Managed Service for Apache Spark 歷程資料擷取功能已啟用。Knowledge Catalog 會從
project-a開始評估,找不到 Managed Service for Apache Spark 的設定,因此會移至folder-a(未設定任何項目),並套用test-org的「已啟用」設定。 - BigQuery 沿襲擷取功能已停用。
Knowledge Catalog 會套用明確的專案層級設定,並覆寫在
folder-a設定的「已啟用」設定。 - Managed Service for Apache Airflow 歷程擷取功能已啟用。Knowledge Catalog 會套用明確的專案層級設定。
- Managed Service for Apache Spark 歷程資料擷取功能已啟用。Knowledge Catalog 會從
- 針對
project-b:- Managed Service for Apache Spark 歷程資料擷取功能已啟用 (繼承自
test-org)。 - BigQuery 歷程擷取功能已啟用 (繼承自
folder-a)。 - Managed Service for Apache Airflow 歷程擷取作業會使用系統預設值 (如果 Data Lineage API 處於啟用狀態,預設為「已啟用」),因為階層中的任何層級都沒有設定明確的設定。
- Managed Service for Apache Spark 歷程資料擷取功能已啟用 (繼承自
後續步驟
- 瞭解如何為服務設定資料歷程擷取作業。