Steuerung der Aufnahme von Datenreihen

Zur Verwaltung von Kosten und Governance-Richtlinien können Sie die Aufnahme von Datenherkunft für bestimmte Google Cloud Dienste aktivieren oder deaktivieren. Sie können beispielsweise die Erfassung von Lineage-Informationen für Entwicklungsprojekte oder Arbeitslasten mit hohem Volumen deaktivieren, für die kein Lineage-Tracking erforderlich ist.

Unterstützte Dienstintegrationen

In der folgenden Tabelle sind die Integrationen aufgeführt, die die Steuerung der Aufnahme von Datenherkunft unterstützen:

Name der Integration Unterstützung für die Steuerung der Aufnahme Standardwert Integrationsdetails
Managed Service for Apache Spark: Apache Spark-Cluster Ja Aktiviert Spark Data Lineage verwenden
Managed Service for Apache Spark: Apache Hive-Cluster Ja Aktiviert Hive-Daten-Lineage aktivieren
Managed Service for Apache Spark: Serverlose Bereitstellung Ja Aktiviert Datenherkunft mit Managed Service for Apache Spark verwenden
BigQuery Ja Aktiviert Datenherkunft für eine BigQuery-Tabelle nachverfolgen
Managed Service for Apache Airflow Ja Aktiviert Datenherkunft mit Knowledge Catalog
Looker (Google Cloud Core) Ja (Vorschau) Aktiviert Data Lineage für Looker Core
Cloud Data Fusion Nein Aktiviert Herkunft in Knowledge Catalog ansehen
Dataflow Nein Von Dataflow deaktiviert Data Lineage in Dataflow verwenden
Vertex AI Pipelines Nein Aktiviert Herkunft von Pipeline-Artefakten verfolgen

Funktionsweise der Steuerung der Datenherkunft

Sie können die Datenaufnahme auf Organisations-, Ordner- und Projektebene steuern und diese Einstellungen mit dienstspezifischen Konfigurationen kombinieren, um eine detaillierte Steuerung der Data Lineage-Aufnahme zu erreichen.

Im Knowledge Catalog wird die Ressourcenhierarchie ausgewertet, beginnend mit einem Projekt, dann Ordnern und schließlich der Organisation, um die effektive Konfiguration zu ermitteln. Die erste Konfiguration, die auf einer beliebigen Ebene in diesem Aufwärtslauf explizit festgelegt wird, wird wirksam.

  • Wenn Sie eine Konfiguration auf Projektebene festlegen, wird sie vom Knowledge Catalog verwendet.
  • Wenn auf Projektebene keine Konfiguration festgelegt ist, verwendet Knowledge Catalog die Konfiguration des nächstgelegenen übergeordneten Ordners mit einer expliziten Konfiguration.
  • Wenn keine Konfiguration auf Projekt- oder Ordnerebene festgelegt ist, verwendet Knowledge Catalog die Konfiguration auf Organisationsebene.
  • Wenn auf keiner dieser Ebenen eine Konfiguration festgelegt ist, verwendet Knowledge Catalog den Systemstandard für die Integration.

Wenn Sie die Aufnahme von Daten im Bulk-Verfahren verwalten möchten, aktivieren Sie die Data Lineage API für alle Projekte in einem Ordner oder einer Organisation gemäß den Regeln für die hierarchische Dienstaktivierung. Nachdem die Data Lineage API aktiviert wurde, können Sie die Aufnahme von Datenherkunftsinformationen pro Dienstintegration für eine Organisation, einzelne Projekte oder Ordner detailliert steuern.

Funktionsweise der Konfiguration der Datenaufnahme für Integrationen mit einem einzelnen Dienst

Im folgenden Szenario wird veranschaulicht, wie der Knowledge Catalog die Konfiguration für die Aufnahme von Lineage-Informationen für einen einzelnen Dienst in der Ressourcenhierarchie auflöst.

Angenommen, eine Organisation test-org hat die folgenden Lineage-Konfigurationen für Managed Service for Apache Spark:

  • Organisation test-org: Aktiviert
    • Ordner folder-a: Deaktiviert
      • Projekt project-a: Keine Konfiguration festgelegt
    • Ordner folder-b: Aktiviert
      • Projekt project-b: Deaktiviert

In diesem Szenario gelten die folgenden Einstellungen:

  • Für project-a ist die Aufnahme von Lineage-Informationen deaktiviert. Knowledge Catalog beginnt mit der Auswertung von project-a, findet keine Konfiguration, wechselt zu folder-a und wendet die Konfiguration Deaktiviert aus folder-a an.
  • Für project-b ist die Aufnahme von Lineage-Informationen deaktiviert. Knowledge Catalog beginnt mit der Auswertung ab project-b und wendet die Deaktiviert-Konfiguration an. Dadurch werden die Einstellungen unter folder-b und test-org überschrieben.

Funktionsweise der Konfiguration der Datenaufnahme für Integrationen mit mehreren Diensten

Im folgenden Szenario wird veranschaulicht, wie Knowledge Catalog Konfigurationen für mehrere Dienste in der Ressourcenhierarchie unabhängig auflöst.

Betrachten Sie eine Organisation test-org mit den folgenden Herkunftskonfigurationen für mehrere Dienstintegrationen:

  • Organisation test-org
    • Managed Service for Apache Spark: Aktiviert
    • Ordner folder-a
      • BigQuery: Aktiviert
      • Projekt project-a
        • BigQuery: Deaktiviert
        • Managed Service for Apache Airflow: Aktiviert
      • Projekt project-b: Keine Konfiguration festgelegt

In diesem Szenario wird jede Dienstintegration im Knowledge Catalog unabhängig in der Ressourcenhierarchie ausgewertet:

  • Für project-a:
    • Die Lineage-Erfassung für Managed Service for Apache Spark ist aktiviert. Knowledge Catalog beginnt mit der Auswertung von project-a, findet keine Konfiguration für Managed Service for Apache Spark, wechselt zu folder-a (keine Konfiguration festgelegt) und wendet die Konfiguration Aktiviert aus test-org an.
    • Die Aufnahme von BigQuery-Abstammungsdaten ist deaktiviert. Knowledge Catalog wendet die explizite Konfiguration auf Projektebene an, die die auf folder-a festgelegte Konfiguration Aktiviert überschreibt.
    • Die Lineage-Erfassung für Managed Service for Apache Airflow ist aktiviert. Knowledge Catalog wendet die explizite Konfiguration auf Projektebene an.
  • Für project-b:
    • Die Lineage-Erfassung für Managed Service for Apache Spark ist aktiviert (geerbt von test-org).
    • Die Aufnahme von BigQuery-Lineage ist Aktiviert (geerbt von folder-a).
    • Für die Erfassung von Lineage-Daten für Managed Service for Apache Airflow wird die Systemstandardeinstellung verwendet (standardmäßig Aktiviert, wenn die Data Lineage API aktiv ist), da auf keiner Ebene in der Hierarchie eine explizite Konfiguration festgelegt ist.

Nächste Schritte