Para administrar los costos y las políticas de gobernanza, puedes activar o desactivar la ingesta de linaje de datos para servicios Google Cloud específicos. Por ejemplo, puedes inhabilitar la recopilación de linaje para proyectos de desarrollo o cargas de trabajo de gran volumen que no requieren seguimiento de linaje.
Integraciones de servicios admitidas
En la siguiente tabla, se enumeran las integraciones que admiten el control de ingesta de linaje de datos:
| Nombre de la integración | Compatibilidad con el control de ingesta | Valor predeterminado | Detalles de la integración |
|---|---|---|---|
| Managed Service para Apache Spark: Clústeres de Apache Spark | Sí | Habilitado | Usa el linaje de datos de Spark |
| Managed Service para Apache Spark: Clústeres de Apache Hive | Sí | Habilitado | Habilita el linaje de datos de Hive |
| Managed Service para Apache Spark: Implementación sin servidores | Sí | Habilitado | Usa el linaje de datos con Managed Service para Apache Spark |
| BigQuery | Sí | Habilitado | Realiza un seguimiento del linaje de una tabla de BigQuery |
| Managed Service para Apache Airflow | Sí | Habilitado | Linaje de datos con Knowledge Catalog |
| Looker (Google Cloud Core) | Sí (vista previa) | Habilitado | Linaje de datos de Looker Core |
| Cloud Data Fusion | No | Habilitado | Consulta el linaje en Knowledge Catalog |
| Dataflow | No | Inhabilitado desde el lado de Dataflow | Usa el linaje de datos en Dataflow |
| Vertex AI Pipelines | No | Habilitado | Realiza un seguimiento del linaje de los artefactos de canalización |
Cómo funciona el control de ingesta de linaje de datos
Puedes controlar la ingesta de datos a nivel de la organización, la carpeta y el proyecto, y combinar estos parámetros de configuración con configuraciones específicas del servicio para lograr un control detallado sobre la ingesta de linaje de datos.
Knowledge Catalog evalúa la jerarquía de recursos comenzando con un proyecto, luego las carpetas y, por último, la organización para determinar la configuración efectiva. La primera configuración establecida de forma explícita en cualquier nivel de este recorrido ascendente entra en vigencia.
- Si estableces una configuración a nivel del proyecto, Knowledge Catalog la usa.
- Si no se establece ninguna configuración a nivel del proyecto, Knowledge Catalog usa la configuración de la carpeta superior más cercana con una configuración explícita.
- Si no se establece ninguna configuración a nivel del proyecto o la carpeta, Knowledge Catalog usa la configuración a nivel de la organización.
- Si no se establece ninguna configuración en ninguno de estos niveles, Knowledge Catalog usa el valor predeterminado del sistema para la integración.
Para administrar el control de ingesta de forma masiva, habilita la API de Data Lineage para todos los proyectos dentro de una carpeta o una organización siguiendo las reglas de activación jerárquica del servicio. Después de habilitar la API de Data Lineage, para controlar de forma detallada la ingesta de linaje de datos por integración de servicio para una organización, proyectos o carpetas individuales.
Cómo funciona la configuración de ingesta de datos para integraciones de un solo servicio
En la siguiente situación, se muestra cómo Knowledge Catalog resuelve la configuración de ingesta de linaje para un solo servicio en la jerarquía de recursos.
Considera una organización test-org con las siguientes configuraciones de linaje de Managed Service para Apache Spark:
- Organización
test-org: Habilitado- Carpeta
folder-a: Inhabilitado- Proyecto
project-a: No se estableció ninguna configuración
- Proyecto
- Carpeta
folder-b: Habilitado- Proyecto
project-b: Inhabilitado
- Proyecto
- Carpeta
En esta situación, se aplican los siguientes parámetros de configuración:
- Para
project-a, la ingesta de linaje está inhabilitada. Knowledge Catalog comienza a evaluar desdeproject-a, no encuentra ninguna configuración, sube afolder-ay aplica la configuración Inhabilitado defolder-a. - Para
project-b, la ingesta de linaje está inhabilitada. Knowledge Catalog comienza a evaluar desdeproject-by aplica su Inhabilitado configuración, lo que anula la configuración enfolder-bytest-org.
Cómo funciona la configuración de ingesta de datos para integraciones de varios servicios
En la siguiente situación, se muestra cómo Knowledge Catalog resuelve de forma independiente las configuraciones para varios servicios en la jerarquía de recursos.
Considera una organización test-org con las siguientes configuraciones de linaje en varias integraciones de servicios:
- Organización
test-org- Managed Service para Apache Spark: Habilitado
- Carpeta
folder-a- BigQuery: Habilitado
- Proyecto
project-a- BigQuery: Inhabilitado
- Managed Service para Apache Airflow: Habilitado
- Proyecto
project-b: No se estableció ninguna configuración
En esta situación, Knowledge Catalog evalúa cada integración de servicio de forma independiente en la jerarquía de recursos:
- Para
project-a:- La ingesta de linaje de Managed Service para Apache Spark está habilitada.
Knowledge Catalog comienza a evaluar desde
project-a, no encuentra ninguna configuración para Managed Service para Apache Spark, sube afolder-a(no se estableció ninguna configuración) y aplica la configuración Habilitado detest-org. - La ingesta de linaje de BigQuery está inhabilitada.
Knowledge Catalog aplica la configuración explícita a nivel del proyecto, que
anula la configuración Habilitado establecida en
folder-a. - La ingesta de linaje de Managed Service para Apache Airflow está habilitada. Knowledge Catalog aplica la configuración explícita a nivel del proyecto.
- La ingesta de linaje de Managed Service para Apache Spark está habilitada.
Knowledge Catalog comienza a evaluar desde
- Para
project-b:- La ingesta de linaje de Managed Service para Apache Spark está habilitada (heredada
de
test-org). - La ingesta de linaje de BigQuery está habilitada (heredada
de
folder-a). - La ingesta de linaje de Managed Service para Apache Airflow usa el valor predeterminado del sistema (habilitado de forma predeterminada cuando la API de Data Lineage está activa), ya que no se establece ninguna configuración explícita en ningún nivel de la jerarquía.
- La ingesta de linaje de Managed Service para Apache Spark está habilitada (heredada
de
¿Qué sigue?
- Obtén información para configurar la ingesta de linaje de datos para un servicio.