관리형 연결 개요

관리형 연결 파이프라인은 서드 파티 소스에서 Knowledge Catalog (이전 명칭: Dataplex Universal Catalog)로 메타데이터를 가져옵니다. 이러한 파이프라인을 사용하여 소스에서 데이터를 추출하기 위해 대규모로 메타데이터를 Knowledge Catalog로 가져올 수 있습니다. 파이프라인은 필요한 경우Google Cloud 프로젝트에 Knowledge Catalog 항목 그룹도 만듭니다. 이 접근 방식을 사용하면 요구사항에 따라 워크플로를 조정하고 가져오기 작업을 예약할 수 있습니다.

MySQL, SQL Server, Oracle, Snowflake, Databricks 등 다양한 서드 파티 소스에서 메타데이터를 추출하는 커스텀 커넥터를 빌드합니다. 또는 더 광범위한 소스에 대해 커뮤니티 제공 커스텀 커넥터를 사용할 수 있습니다.

관리형 연결 작동 방식

다음 다이어그램에서는 관리형 연결 파이프라인을 보여줍니다.

관리형 연결 파이프라인

여기서는 관리형 연결 작동 방식을 간략하게 설명합니다.

  1. 데이터 소스의 커넥터를 빌드합니다.

    커넥터는 Managed Service for Apache Spark에서 실행할 수 있는 Artifact Registry 이미지여야 합니다.

  2. 조정 플랫폼인 Workflows에서 관리형 연결 파이프라인을 실행합니다.

  3. 관리형 연결 파이프라인은 다음 작업을 수행합니다.

    1. 항목 그룹이 없으면 구성에 따라 대상 항목 그룹을 만듭니다.
    2. 커넥터를 실행합니다. 커넥터는 데이터 소스에서 메타데이터를 추출하고 Knowledge Catalog로 가져올 수 있는 메타데이터 가져오기 파일을 생성합니다.
    3. 메타데이터 추출 진행 상황을 모니터링합니다.
    4. 메타데이터 가져오기 작업을 실행하여 메타데이터를 Knowledge Catalog로 가져옵니다.
    5. 메타데이터 가져오기 작업의 진행률을 모니터링합니다.

관리형 연결 파이프라인은 Managed Service for Apache Spark를 사용하여 커넥터를 실행하고 Knowledge Catalog 메타데이터 가져오기 API 메서드를 사용하여 메타데이터 가져오기 작업을 실행합니다.

가져오는 메타데이터는 Knowledge Catalog 항목과 해당 관점으로 구성됩니다. Knowledge Catalog 메타데이터에 대한 자세한 내용은 Knowledge Catalog의 메타데이터 관리 정보를 참고하세요.

커뮤니티 제공 커스텀 커넥터

서드 파티 소스에서 메타데이터를 가져오려면 커뮤니티에서 제공하는 커스텀 커넥터를 사용하면 됩니다. 설정 안내와 커넥터에 대한 자세한 내용은 각 커넥터의 리드미 파일을 참조하세요.

데이터 소스 저장소
MySQL mysql-connector
Oracle oracle-connector
PostgreSQL postgresql-connector
Snowflake snowflake-connector
SQL Server sql-server-connector

다음 단계