Per gestire i costi e le norme di governance, puoi attivare o disattivare l'importazione della lineage dei dati per servizi specifici. Google Cloud Ad esempio, puoi disabilitare la raccolta della tracciabilità per i progetti di sviluppo o per i carichi di lavoro ad alto volume che non richiedono il monitoraggio della tracciabilità.
Integrazioni dei servizi supportate
La tabella seguente elenca le integrazioni che supportano il controllo dell'importazione della derivazione dei dati:
| Nome integrazione | Supporto per il controllo dell'importazione | Valore predefinito | Dettagli dell'integrazione |
|---|---|---|---|
| Managed Service for Apache Spark: cluster Apache Spark | Sì | Abilitata | Utilizzo della data lineage di Spark |
| Managed Service for Apache Spark: cluster Apache Hive | Sì | Abilitata | Attivare la tracciabilità dei dati Hive |
| Managed Service for Apache Spark: deployment serverless | Sì | Abilitata | Utilizzare la derivazione dei dati con Managed Service for Apache Spark |
| BigQuery | Sì | Abilitata | Monitorare la tracciabilità per una tabella BigQuery |
| Managed Service for Apache Airflow | Sì | Abilitata | Tracciabilità dei dati con Knowledge Catalog |
| Looker (Google Cloud core) | Sì (anteprima) | Abilitata | Tracciabilità dei dati di Looker Core |
| Cloud Data Fusion | No | Abilitata | Visualizzare la tracciabilità in Knowledge Catalog |
| Dataflow | No | Disabilitato dal lato Dataflow | Utilizzare la lineage dei dati in Dataflow |
| Vertex AI Pipelines | No | Abilitata | Monitorare la tracciabilità degli artefatti della pipeline |
Come funziona il controllo di importazione della derivazione dei dati
Puoi controllare l'importazione dati a livello di organizzazione, cartella e progetto e combinare queste impostazioni con configurazioni specifiche del servizio per ottenere un controllo granulare sull'acquisizione della tracciabilità dei dati.
Knowledge Catalog valuta la gerarchia delle risorse a partire da un progetto, poi dalle cartelle e infine dall'organizzazione per determinare la configurazione effettiva. Viene applicata la prima configurazione impostata esplicitamente a qualsiasi livello di questo attraversamento verso l'alto.
- Se imposti una configurazione a livello di progetto, Knowledge Catalog la utilizza.
- Se non è impostata alcuna configurazione a livello di progetto, Knowledge Catalog utilizza la configurazione della cartella principale più vicina con una configurazione esplicita.
- Se non è impostata alcuna configurazione a livello di progetto o cartella, Knowledge Catalog utilizza la configurazione a livello di organizzazione.
- Se non viene impostata alcuna configurazione a nessuno di questi livelli, Knowledge Catalog utilizza il valore predefinito del sistema per l'integrazione.
Per gestire il controllo dell'importazione collettivamente, attiva l'API Data Lineage per tutti i progetti all'interno di una cartella o di un'organizzazione seguendo le regole di attivazione gerarchica del servizio. Dopo aver abilitato l'API Data Lineage, per controllare in modo granulare l'importazione della derivazione dei dati per integrazione del servizio per un'organizzazione, singoli progetti o cartelle.
Come funziona la configurazione dell'importazione dati per le integrazioni di un singolo servizio
Lo scenario seguente illustra come Knowledge Catalog risolve la configurazione di importazione della derivazione per un singolo servizio nella gerarchia delle risorse.
Prendi in considerazione un'organizzazione test-org con le seguenti configurazioni di tracciabilità di Managed Service for Apache Spark:
- Organizzazione
test-org: abilitata- Cartella
folder-a: Disabilitata- Progetto
project-a: nessuna configurazione impostata
- Progetto
- Cartella
folder-b: Abilitato- Progetto
project-b: disabilitato
- Progetto
- Cartella
In questo scenario, si applicano le seguenti impostazioni:
- Per
project-a, l'importazione della derivazione è disattivata. Knowledge Catalog inizia la valutazione daproject-a, non trova configurazione, passa afolder-ae applica la configurazione Disattivato dafolder-a. - Per
project-b, l'importazione della derivazione è disattivata. Knowledge Catalog inizia la valutazione daproject-be applica la configurazione Disattivato, ignorando le impostazioni infolder-betest-org.
Come funziona la configurazione dell'importazione dati per le integrazioni multiservizio
Lo scenario seguente illustra come Knowledge Catalog risolve in modo indipendente le configurazioni per più servizi nell'intera gerarchia delle risorse.
Considera un'organizzazione test-org con le seguenti configurazioni di tracciabilità in più integrazioni di servizi:
- Organizzazione
test-org- Managed Service for Apache Spark: attivato
- Cartella
folder-a- BigQuery: abilitato
- Progetto
project-a- BigQuery: Disabilitato
- Managed Service for Apache Airflow: attivato
- Progetto
project-b: nessuna configurazione impostata
In questo scenario, Knowledge Catalog valuta ogni integrazione del servizio in modo indipendente nella gerarchia delle risorse:
- Per
project-a:- L'acquisizione della tracciabilità di Managed Service for Apache Spark è attivata.
Knowledge Catalog inizia la valutazione da
project-a, non trova configurazione per Managed Service for Apache Spark, passa afolder-a(nessuna configurazione impostata) e applica la configurazione Attivato datest-org. - L'importazione della derivazione di BigQuery è disabilitata.
Knowledge Catalog applica la configurazione esplicita a livello di progetto, che
override della configurazione Abilitato impostata su
folder-a. - L'acquisizione della tracciabilità di Managed Service for Apache Airflow è attivata. Knowledge Catalog applica la configurazione esplicita a livello di progetto.
- L'acquisizione della tracciabilità di Managed Service for Apache Spark è attivata.
Knowledge Catalog inizia la valutazione da
- Per
project-b:- L'acquisizione della tracciabilità di Managed Service for Apache Spark è attivata (ereditata
da
test-org). - L'importazione della derivazione di BigQuery è attivata (ereditata
da
folder-a). - L'importazione della derivazione di Managed Service for Apache Airflow utilizza l'impostazione predefinita del sistema (Attivata per impostazione predefinita se l'API Data Lineage è attiva), perché non è impostata alcuna configurazione esplicita a nessun livello della gerarchia.
- L'acquisizione della tracciabilità di Managed Service for Apache Spark è attivata (ereditata
da