데이터 계보 수집 관리 정보

비용 및 거버넌스 정책을 관리하기 위해 특정 Google Cloud 서비스에 대해 데이터 계보 수집을 사용 설정하거나 중지할 수 있습니다. 예를 들어 계보 추적이 필요하지 않은 개발 프로젝트나 대량 워크로드의 계보 수집을 사용 중지할 수 있습니다.

지원되는 서비스 통합

다음 표에는 데이터 계보 수집 제어를 지원하는 통합이 나와 있습니다.

통합 이름 인그레스 제어 지원 기본값 통합 세부정보
Managed Service for Apache Spark: Apache Spark 클러스터 사용 설정됨 Spark 데이터 계보 사용
Managed Service for Apache Spark: Apache Hive 클러스터 사용 설정됨 Hive 데이터 계보 사용 설정
Managed Service for Apache Spark: 서버리스 배포 사용 설정됨 Managed Service for Apache Spark에서 데이터 계보 사용
BigQuery 사용 설정됨 BigQuery 테이블의 계보 추적
Apache Airflow용 관리형 서비스 사용 설정됨 Knowledge Catalog를 사용한 데이터 계보
Looker(Google Cloud 핵심 서비스) 예(미리보기) 사용 설정됨 Looker Core 데이터 계보
Cloud Data Fusion 아니요 사용 설정됨 Knowledge Catalog에서 계보 보기
Dataflow 아니요 Dataflow 측에서 사용 중지됨 Dataflow에서 데이터 계보 사용
Vertex AI Pipelines 아니요 사용 설정됨 파이프라인 아티팩트 계보 추적

데이터 계보 수집 관리 작동 방식

조직, 폴더, 프로젝트 수준에서 데이터 수집을 제어하고 이러한 설정을 서비스별 구성과 결합하여 데이터 계보 수집을 세부적으로 제어할 수 있습니다.

Knowledge Catalog는 프로젝트, 폴더, 조직 순으로 리소스 계층 구조를 평가하여 유효한 구성을 결정합니다. 이 상향 순회에서 어떤 수준에서든 명시적으로 설정된 첫 번째 구성이 적용됩니다.

  • 프로젝트 수준에서 구성을 설정하면 Knowledge Catalog에서 이를 사용합니다.
  • 프로젝트 수준에서 구성이 설정되지 않은 경우 Knowledge Catalog는 명시적 구성이 있는 가장 가까운 상위 폴더의 구성을 사용합니다.
  • 프로젝트 또는 폴더 수준에서 구성이 설정되지 않은 경우 Knowledge Catalog는 조직 수준 구성을 사용합니다.
  • 이러한 수준에서 구성이 설정되지 않은 경우 Knowledge Catalog는 통합에 시스템 기본값을 사용합니다.

일괄적으로 수집 제어를 관리하려면 계층적 서비스 활성화 규칙에 따라 폴더 또는 조직 내의 모든 프로젝트에 대해 Data Lineage API를 사용 설정하세요. Data Lineage API가 사용 설정된 후 조직, 개별 프로젝트 또는 폴더의 서비스 통합별로 데이터 계보 처리를 세부적으로 제어합니다.

단일 서비스 통합에서 데이터 수집 구성이 작동하는 방식

다음 시나리오에서는 리소스 계층 구조에서 단일 서비스의 계보 수집 구성을 Knowledge Catalog에서 해결하는 방법을 보여줍니다.

다음과 같은 Managed Service for Apache Spark 계보 구성이 있는 조직 test-org을 고려해 보세요.

  • 조직 test-org: 사용 설정됨
    • 폴더 folder-a: 사용 중지됨
      • 프로젝트 project-a: 구성이 설정되지 않음
    • 폴더 folder-b: 사용 설정됨
      • 프로젝트 project-b: 사용 중지됨

이 시나리오에서는 다음 설정이 적용됩니다.

  • project-a의 경우 계보 수집이 사용 중지됨입니다. Knowledge Catalog는 project-a부터 평가를 시작하고 구성을 찾지 못하면 folder-a으로 이동하여 folder-a사용 중지됨 구성을 적용합니다.
  • project-b의 경우 계보 수집이 사용 중지됨입니다. Knowledge Catalog는 project-b부터 평가를 시작하고 사용 중지됨 구성을 적용하여 folder-btest-org의 설정을 재정의합니다.

다중 서비스 통합에서 데이터 수집 구성이 작동하는 방식

다음 시나리오에서는 리소스 계층 구조 전반에서 여러 서비스의 구성을 Knowledge Catalog가 독립적으로 해결하는 방법을 보여줍니다.

여러 서비스 통합에 걸쳐 다음과 같은 계보 구성이 있는 조직 test-org을 고려해 보세요.

  • 조직 test-org
    • Managed Service for Apache Spark: 사용 설정됨
    • 폴더 folder-a
      • BigQuery: 사용 설정됨
      • 프로젝트 project-a
        • BigQuery: 사용 중지됨
        • Managed Service for Apache Airflow: 사용 설정됨
      • 프로젝트 project-b: 구성이 설정되지 않음

이 시나리오에서 Knowledge Catalog는 리소스 계층 구조에서 각 서비스 통합을 독립적으로 평가합니다.

  • project-a의 경우:
    • Managed Service for Apache Spark 계보 수집이 사용 설정되어 있습니다. Knowledge Catalog는 project-a부터 평가를 시작하고, Managed Service for Apache Spark 구성이 없음을 확인하고, folder-a로 이동하고(구성 설정 없음), test-org사용 설정됨 구성을 적용합니다.
    • BigQuery 계보 수집이 사용 중지됨 Knowledge Catalog는 명시적인 프로젝트 수준 구성을 적용하며, 이 구성은 folder-a에서 설정된 사용 설정됨 구성을 재정의합니다.
    • Managed Service for Apache Airflow 계보 수집이 사용 설정되어 있습니다. Knowledge Catalog는 명시적 프로젝트 수준 구성을 적용합니다.
  • project-b의 경우:
    • Managed Service for Apache Spark 계보 수집이 사용 설정되어 있습니다 (test-org에서 상속됨).
    • BigQuery 계보 수집이 사용 설정되어 있습니다 (folder-a에서 상속됨).
    • Managed Service for Apache Airflow 계보 수집은 계층 구조의 어떤 수준에서도 명시적 구성이 설정되지 않았기 때문에 시스템 기본값(Data Lineage API가 활성 상태인 경우 기본적으로 사용 설정됨)을 사용합니다.

다음 단계