Gestire le configurazioni delle pipeline

Questa pagina descrive i modi in cui puoi gestire le configurazioni per le pipeline di cui è stato eseguito il deployment.

Prima di iniziare

Questa pagina richiede alcune conoscenze di base sui profili di calcolo e sulla performance delle pipeline.

Configurazione del profilo di calcolo

Puoi modificare il profilo di calcolo o personalizzare i parametri del profilo di calcolo predefinito che esegue la pipeline. Per ulteriori informazioni, consulta Gestire i profili di calcolo e le proprietà del provisioner di Managed Service for Apache Spark.

Configurazione della pipeline

Per ogni pipeline, puoi attivare o disattivare la strumentazione, ad esempio le metriche di temporizzazione. Per impostazione predefinita, la strumentazione è attiva. Se la strumentazione è abilitata, quando esegui la pipeline, Cloud Data Fusion genera metriche per ogni nodo della pipeline. Le seguenti metriche vengono visualizzate nella scheda Metriche di ogni nodo. Le metriche di origine, trasformazione e sink variano leggermente.

  • Record in uscita
  • Record in entrata
  • Numero totale di errori
  • Record in uscita al secondo
  • Tempo di elaborazione minimo (un record)
  • Tempo di elaborazione massimo (un record)
  • Deviazione standard
  • Tempo medio di elaborazione

Ti consigliamo di attivare sempre la strumentazione, a meno che l'ambiente non abbia risorse sufficienti.

Per le pipeline di streaming, puoi anche impostare l'intervallo batch (secondi/minuti) per i dati di streaming.

Configurazione del motore

Apache Spark è il motore di esecuzione predefinito. Puoi passare parametri personalizzati per Spark. Per ulteriori informazioni, consulta Elaborazione parallela.

Risorse

Puoi specificare la memoria e il numero di CPU per il driver e l'executor di Spark. Il driver orchestra il job Spark. L'executor gestisce l'elaborazione dei dati in Spark. Per ulteriori informazioni, consulta Gestione delle risorse.

Avviso della pipeline

Puoi configurare la pipeline in modo che invii avvisi e avvii le attività di post-elaborazione al termine dell'esecuzione della pipeline. Crea avvisi della pipeline quando la progetti. Dopo aver eseguito il deployment della pipeline, puoi visualizzare gli avvisi. Puoi modificare la pipeline per cambiare le impostazioni degli avvisi. Per ulteriori informazioni, consulta Creare avvisi.

Pushdown della trasformazione

Puoi abilitare il pushdown della trasformazione se vuoi che una pipeline esegua determinate trasformazioni in BigQuery. Per ulteriori informazioni, consulta la panoramica del pushdown della trasformazione.

Passaggi successivi