Implementa y ejecuta canalizaciones

En esta página, se describen los conceptos básicos sobre la implementación y ejecución de canalizaciones en Cloud Data Fusion.

Implementa canalizaciones

Una vez que termines de diseñar y depurar una canalización de datos, y estés conforme con los datos que ves en la vista previa, podrás implementarla.

Cuando implementas la canalización, Cloud Data Fusion Studio crea el flujo de trabajo y los trabajos de Apache Spark correspondientes en segundo plano.

Ejecutar canalizaciones

Después de implementar una canalización, puedes ejecutarla de las siguientes maneras:

  • Para ejecutar una canalización a pedido, abre una canalización implementada y haz clic en Ejecutar.
  • Para programar la canalización para que se ejecute a una hora determinada, abre una canalización implementada y haz clic en Programar.
  • Para activar la canalización cuando se complete otra, abre una canalización implementada y haz clic en Activadores entrantes.

Pipeline Studio guarda el historial de una canalización cada vez que se ejecuta. Puedes alternar entre diferentes versiones de tiempo de ejecución de la canalización.

Si la canalización tiene macros, establece los argumentos del entorno de ejecución para cada macro. También puedes revisar y cambiar la configuración de la canalización antes de ejecutar la canalización implementada. Puedes ver el cambio de estado durante las fases de la ejecución de la canalización, como Aprovisionando, Iniciando, En ejecución y Completada. También puedes detener la canalización en cualquier momento.

Si habilitas la instrumentación, puedes explorar las métricas que genera la canalización haciendo clic en Propiedades en cualquier nodo de la canalización, como una fuente, una transformación o un receptor.

Para obtener más información sobre las ejecuciones de la canalización, haz clic en Resumen.

Cómo ver los registros de ejecución

Una vez que se completa la ejecución de una canalización, puedes ver el registro de ejecución. De forma predeterminada, puedes ver los registros de ejecución de los últimos 30 días. Cloud Data Fusion los borra después de ese período. Puedes extender ese período con la API de REST.

API de REST

Para conservar los registros de ejecución durante más de 30 días, actualiza las opciones de app.run.records.ttl con el siguiente comando:

curl -X PATCH -H 'Content-Type: application/json' -H "Authorization: Bearer $(gcloud auth print-access-token)" '
https://datafusion.googleapis.com/v1beta1/projects/PROJECT_NAME/locations/REGION_NAME/instances/INSTANCE_NAME?updateMask=options'
-d '{ "options": { "app.run.records.ttl.days": "DAYS", "app.run.records.ttl.frequency.hours": "HOURS" } }'

Reemplaza lo siguiente:

  • PROJECT_NAME: El nombre del proyecto de Google Cloud
  • REGION_NAME: La región de la instancia de Cloud Data Fusion, por ejemplo, us-east4
  • INSTANCE_NAME: Es el ID de la instancia de Cloud Data Fusion.
  • DAYS: Cantidad de tiempo, en días, para conservar los registros de ejecución de ejecuciones de canalizaciones anteriores, por ejemplo, 30.
  • HOURS: Es la frecuencia, en horas, con la que se verifican y borran los registros de ejecución antiguos, por ejemplo, 24.

Ejemplo:

curl -X PATCH -H 'Content-Type: application/json' -H "Authorization: Bearer $(gcloud auth print-access-token)" '
https://datafusion.googleapis.com/v1beta1/projects/project-1/locations/us-east4/instances/data-fusion-instance-1?updateMask=options'
-d '{ "options": { "app.run.records.ttl.days": "30", "app.run.records.ttl.frequency.hours": "24" } }'

¿Qué sigue?