Informazioni sul controllo dell'importazione della derivazione dei dati

Per gestire i costi e le norme di governance, puoi attivare o disattivare l'importazione della lineage dei dati per servizi specifici. Google Cloud Ad esempio, puoi disabilitare la raccolta della tracciabilità per i progetti di sviluppo o per i carichi di lavoro ad alto volume che non richiedono il monitoraggio della tracciabilità.

Integrazioni dei servizi supportate

La tabella seguente elenca le integrazioni che supportano il controllo dell'importazione della derivazione dei dati:

Nome integrazione Supporto per il controllo dell'importazione Valore predefinito Dettagli dell'integrazione
Managed Service for Apache Spark: cluster Apache Spark Abilitata Utilizzo della data lineage di Spark
Managed Service for Apache Spark: cluster Apache Hive Abilitata Attivare la tracciabilità dei dati Hive
Managed Service for Apache Spark: deployment serverless Abilitata Utilizzare la derivazione dei dati con Managed Service for Apache Spark
BigQuery Abilitata Monitorare la tracciabilità per una tabella BigQuery
Managed Service for Apache Airflow Abilitata Tracciabilità dei dati con Knowledge Catalog
Looker (Google Cloud core) Sì (anteprima) Abilitata Tracciabilità dei dati di Looker Core
Cloud Data Fusion No Abilitata Visualizzare la tracciabilità in Knowledge Catalog
Dataflow No Disabilitato dal lato Dataflow Utilizzare la lineage dei dati in Dataflow
Vertex AI Pipelines No Abilitata Monitorare la tracciabilità degli artefatti della pipeline

Come funziona il controllo di importazione della derivazione dei dati

Puoi controllare l'importazione dati a livello di organizzazione, cartella e progetto e combinare queste impostazioni con configurazioni specifiche del servizio per ottenere un controllo granulare sull'acquisizione della tracciabilità dei dati.

Knowledge Catalog valuta la gerarchia delle risorse a partire da un progetto, poi dalle cartelle e infine dall'organizzazione per determinare la configurazione effettiva. Viene applicata la prima configurazione impostata esplicitamente a qualsiasi livello di questo attraversamento verso l'alto.

  • Se imposti una configurazione a livello di progetto, Knowledge Catalog la utilizza.
  • Se non è impostata alcuna configurazione a livello di progetto, Knowledge Catalog utilizza la configurazione della cartella principale più vicina con una configurazione esplicita.
  • Se non è impostata alcuna configurazione a livello di progetto o cartella, Knowledge Catalog utilizza la configurazione a livello di organizzazione.
  • Se non viene impostata alcuna configurazione a nessuno di questi livelli, Knowledge Catalog utilizza il valore predefinito del sistema per l'integrazione.

Per gestire il controllo dell'importazione collettivamente, attiva l'API Data Lineage per tutti i progetti all'interno di una cartella o di un'organizzazione seguendo le regole di attivazione gerarchica del servizio. Dopo aver abilitato l'API Data Lineage, per controllare in modo granulare l'importazione della derivazione dei dati per integrazione del servizio per un'organizzazione, singoli progetti o cartelle.

Come funziona la configurazione dell'importazione dati per le integrazioni di un singolo servizio

Lo scenario seguente illustra come Knowledge Catalog risolve la configurazione di importazione della derivazione per un singolo servizio nella gerarchia delle risorse.

Prendi in considerazione un'organizzazione test-org con le seguenti configurazioni di tracciabilità di Managed Service for Apache Spark:

  • Organizzazione test-org: abilitata
    • Cartella folder-a: Disabilitata
      • Progetto project-a: nessuna configurazione impostata
    • Cartella folder-b: Abilitato
      • Progetto project-b: disabilitato

In questo scenario, si applicano le seguenti impostazioni:

  • Per project-a, l'importazione della derivazione è disattivata. Knowledge Catalog inizia la valutazione da project-a, non trova configurazione, passa a folder-a e applica la configurazione Disattivato da folder-a.
  • Per project-b, l'importazione della derivazione è disattivata. Knowledge Catalog inizia la valutazione da project-b e applica la configurazione Disattivato, ignorando le impostazioni in folder-b e test-org.

Come funziona la configurazione dell'importazione dati per le integrazioni multiservizio

Lo scenario seguente illustra come Knowledge Catalog risolve in modo indipendente le configurazioni per più servizi nell'intera gerarchia delle risorse.

Considera un'organizzazione test-org con le seguenti configurazioni di tracciabilità in più integrazioni di servizi:

  • Organizzazione test-org
    • Managed Service for Apache Spark: attivato
    • Cartella folder-a
      • BigQuery: abilitato
      • Progetto project-a
        • BigQuery: Disabilitato
        • Managed Service for Apache Airflow: attivato
      • Progetto project-b: nessuna configurazione impostata

In questo scenario, Knowledge Catalog valuta ogni integrazione del servizio in modo indipendente nella gerarchia delle risorse:

  • Per project-a:
    • L'acquisizione della tracciabilità di Managed Service for Apache Spark è attivata. Knowledge Catalog inizia la valutazione da project-a, non trova configurazione per Managed Service for Apache Spark, passa a folder-a (nessuna configurazione impostata) e applica la configurazione Attivato da test-org.
    • L'importazione della derivazione di BigQuery è disabilitata. Knowledge Catalog applica la configurazione esplicita a livello di progetto, che override della configurazione Abilitato impostata su folder-a.
    • L'acquisizione della tracciabilità di Managed Service for Apache Airflow è attivata. Knowledge Catalog applica la configurazione esplicita a livello di progetto.
  • Per project-b:
    • L'acquisizione della tracciabilità di Managed Service for Apache Spark è attivata (ereditata da test-org).
    • L'importazione della derivazione di BigQuery è attivata (ereditata da folder-a).
    • L'importazione della derivazione di Managed Service for Apache Airflow utilizza l'impostazione predefinita del sistema (Attivata per impostazione predefinita se l'API Data Lineage è attiva), perché non è impostata alcuna configurazione esplicita a nessun livello della gerarchia.

Passaggi successivi