Zur Verwaltung von Kosten und Governance-Richtlinien können Sie die Aufnahme von Datenherkunft für bestimmte Google Cloud Dienste aktivieren oder deaktivieren. Sie können beispielsweise die Erfassung von Lineage-Informationen für Entwicklungsprojekte oder Arbeitslasten mit hohem Volumen deaktivieren, für die kein Lineage-Tracking erforderlich ist.
Unterstützte Dienstintegrationen
In der folgenden Tabelle sind die Integrationen aufgeführt, die die Steuerung der Aufnahme von Datenherkunft unterstützen:
| Name der Integration | Unterstützung für die Steuerung der Aufnahme | Standardwert | Integrationsdetails |
|---|---|---|---|
| Managed Service for Apache Spark: Apache Spark-Cluster | Ja | Aktiviert | Spark Data Lineage verwenden |
| Managed Service for Apache Spark: Apache Hive-Cluster | Ja | Aktiviert | Hive-Daten-Lineage aktivieren |
| Managed Service for Apache Spark: Serverlose Bereitstellung | Ja | Aktiviert | Datenherkunft mit Managed Service for Apache Spark verwenden |
| BigQuery | Ja | Aktiviert | Datenherkunft für eine BigQuery-Tabelle nachverfolgen |
| Managed Service for Apache Airflow | Ja | Aktiviert | Datenherkunft mit Knowledge Catalog |
| Looker (Google Cloud Core) | Ja (Vorschau) | Aktiviert | Data Lineage für Looker Core |
| Cloud Data Fusion | Nein | Aktiviert | Herkunft in Knowledge Catalog ansehen |
| Dataflow | Nein | Von Dataflow deaktiviert | Data Lineage in Dataflow verwenden |
| Vertex AI Pipelines | Nein | Aktiviert | Herkunft von Pipeline-Artefakten verfolgen |
Funktionsweise der Steuerung der Datenherkunft
Sie können die Datenaufnahme auf Organisations-, Ordner- und Projektebene steuern und diese Einstellungen mit dienstspezifischen Konfigurationen kombinieren, um eine detaillierte Steuerung der Data Lineage-Aufnahme zu erreichen.
Im Knowledge Catalog wird die Ressourcenhierarchie ausgewertet, beginnend mit einem Projekt, dann Ordnern und schließlich der Organisation, um die effektive Konfiguration zu ermitteln. Die erste Konfiguration, die auf einer beliebigen Ebene in diesem Aufwärtslauf explizit festgelegt wird, wird wirksam.
- Wenn Sie eine Konfiguration auf Projektebene festlegen, wird sie vom Knowledge Catalog verwendet.
- Wenn auf Projektebene keine Konfiguration festgelegt ist, verwendet Knowledge Catalog die Konfiguration des nächstgelegenen übergeordneten Ordners mit einer expliziten Konfiguration.
- Wenn keine Konfiguration auf Projekt- oder Ordnerebene festgelegt ist, verwendet Knowledge Catalog die Konfiguration auf Organisationsebene.
- Wenn auf keiner dieser Ebenen eine Konfiguration festgelegt ist, verwendet Knowledge Catalog den Systemstandard für die Integration.
Wenn Sie die Aufnahme von Daten im Bulk-Verfahren verwalten möchten, aktivieren Sie die Data Lineage API für alle Projekte in einem Ordner oder einer Organisation gemäß den Regeln für die hierarchische Dienstaktivierung. Nachdem die Data Lineage API aktiviert wurde, können Sie die Aufnahme von Datenherkunftsinformationen pro Dienstintegration für eine Organisation, einzelne Projekte oder Ordner detailliert steuern.
Funktionsweise der Konfiguration der Datenaufnahme für Integrationen mit einem einzelnen Dienst
Im folgenden Szenario wird veranschaulicht, wie der Knowledge Catalog die Konfiguration für die Aufnahme von Lineage-Informationen für einen einzelnen Dienst in der Ressourcenhierarchie auflöst.
Angenommen, eine Organisation test-org hat die folgenden Lineage-Konfigurationen für Managed Service for Apache Spark:
- Organisation
test-org: Aktiviert- Ordner
folder-a: Deaktiviert- Projekt
project-a: Keine Konfiguration festgelegt
- Projekt
- Ordner
folder-b: Aktiviert- Projekt
project-b: Deaktiviert
- Projekt
- Ordner
In diesem Szenario gelten die folgenden Einstellungen:
- Für
project-aist die Aufnahme von Lineage-Informationen deaktiviert. Knowledge Catalog beginnt mit der Auswertung vonproject-a, findet keine Konfiguration, wechselt zufolder-aund wendet die Konfiguration Deaktiviert ausfolder-aan. - Für
project-bist die Aufnahme von Lineage-Informationen deaktiviert. Knowledge Catalog beginnt mit der Auswertung abproject-bund wendet die Deaktiviert-Konfiguration an. Dadurch werden die Einstellungen unterfolder-bundtest-orgüberschrieben.
Funktionsweise der Konfiguration der Datenaufnahme für Integrationen mit mehreren Diensten
Im folgenden Szenario wird veranschaulicht, wie Knowledge Catalog Konfigurationen für mehrere Dienste in der Ressourcenhierarchie unabhängig auflöst.
Betrachten Sie eine Organisation test-org mit den folgenden Herkunftskonfigurationen für mehrere Dienstintegrationen:
- Organisation
test-org- Managed Service for Apache Spark: Aktiviert
- Ordner
folder-a- BigQuery: Aktiviert
- Projekt
project-a- BigQuery: Deaktiviert
- Managed Service for Apache Airflow: Aktiviert
- Projekt
project-b: Keine Konfiguration festgelegt
In diesem Szenario wird jede Dienstintegration im Knowledge Catalog unabhängig in der Ressourcenhierarchie ausgewertet:
- Für
project-a:- Die Lineage-Erfassung für Managed Service for Apache Spark ist aktiviert.
Knowledge Catalog beginnt mit der Auswertung von
project-a, findet keine Konfiguration für Managed Service for Apache Spark, wechselt zufolder-a(keine Konfiguration festgelegt) und wendet die Konfiguration Aktiviert austest-organ. - Die Aufnahme von BigQuery-Abstammungsdaten ist deaktiviert.
Knowledge Catalog wendet die explizite Konfiguration auf Projektebene an, die die auf
folder-afestgelegte Konfiguration Aktiviert überschreibt. - Die Lineage-Erfassung für Managed Service for Apache Airflow ist aktiviert. Knowledge Catalog wendet die explizite Konfiguration auf Projektebene an.
- Die Lineage-Erfassung für Managed Service for Apache Spark ist aktiviert.
Knowledge Catalog beginnt mit der Auswertung von
- Für
project-b:- Die Lineage-Erfassung für Managed Service for Apache Spark ist aktiviert (geerbt von
test-org). - Die Aufnahme von BigQuery-Lineage ist Aktiviert (geerbt von
folder-a). - Für die Erfassung von Lineage-Daten für Managed Service for Apache Airflow wird die Systemstandardeinstellung verwendet (standardmäßig Aktiviert, wenn die Data Lineage API aktiv ist), da auf keiner Ebene in der Hierarchie eine explizite Konfiguration festgelegt ist.
- Die Lineage-Erfassung für Managed Service for Apache Spark ist aktiviert (geerbt von