Knowledge Catalog (이전 명칭: Dataplex Universal Catalog)는 분산된 데이터 자산 전반에서 통합된 구조화된 메타데이터 관리 플랫폼을 제공합니다. 기술 구조, 비즈니스 컨텍스트, 데이터 품질 측정항목, 운영 관계를 자동으로 검색, 색인화, 정리합니다.
메타데이터를 유연하고 확장 가능한 메타모델로 구성함으로써 Knowledge Catalog는 Google의 에이전트형 데이터 클라우드 내에서 활성 컨텍스트 그래프의 구조적 기반을 설정합니다. 이 컨텍스트 그래프를 통해 데이터팀은 애셋을 검색하고 관리할 수 있으며, 생성형 AI 에이전트는 그라운딩되고 신뢰할 수 있는 비즈니스 컨텍스트를 검색할 수 있습니다.
Knowledge Catalog 메타 모델
Knowledge Catalog는 컨테이너, 애셋, 스키마, 관계의 모듈식 계층 구조를 통해 메타데이터를 정리합니다.
- 컨테이너 및 애셋: 항목 그룹은 개별 데이터 애셋과 스키마 열을 나타내는 항목을 정리합니다.
- 구조화된 보강: 관점 유형은 항목, 열 또는 관계에 구조화된 메타데이터를 연결하는 관점의 스키마를 정의합니다.
- 표준 및 거버넌스: 항목 유형은 항목에 필수 관점을 적용하는 템플릿을 정의합니다.
- 관계: 항목 링크 유형은 관련 항목과 비즈니스 용어를 연결하는 관계 (항목 링크)를 정의합니다.
다음 표에는 시스템 관리 리소스( Google Cloud에서 자동으로 제공)와 사용자 정의 커스텀 리소스의 차이점이 요약되어 있습니다.
| 메타모델 요소 | 시스템 관리형 (기본 제공) | 사용자 정의 (커스텀) |
|---|---|---|
| 항목 그룹 | Google Cloud 서비스 (예: @bigquery, @spanner, @pubsub)에 대해 프로젝트별로 사전 정의됩니다. |
사용자가 맞춤 데이터 애셋과 권한을 그룹화하고 관리하기 위해 만듭니다. |
| 항목 | Google Cloud 소스 (예: BigQuery 테이블, 뷰, 데이터 세트, 모델)에서 자동으로 채워집니다. | 맞춤 데이터 소스, 파일 또는 서드 파티 데이터베이스를 나타내기 위해 사용자가 만듭니다. |
| 관점 유형 | 사전 정의된 시스템 템플릿 (예: Schema, Overview, Contacts, DataQuality, Lineage) |
도메인별 메타데이터 스키마 (예: PII 분류 또는 SLA 등급)를 정의하기 위해 사용자가 만듭니다. |
| 측면 | 소스 시스템, 쿼리 로그 또는 자동 스캔에서 자동으로 채워집니다. | 사용자, 파이프라인 또는 에이전트가 만들고 항목, 열 또는 항목 링크에 연결됩니다. |
| 항목 유형 | Google Cloud 리소스 유형을 나타내는 사전 정의된 템플릿입니다. | 사용자가 맞춤 데이터 애셋의 필수 및 선택적 측면을 지정하기 위해 정의합니다. |
| 진입 링크 | 기본 제공 관계 유형 (예: synonym, definition, schema-join, related) |
시스템 간 연결을 모델링하기 위해 특정 항목 또는 열 사이에 생성된 인스턴스입니다. |
다음 섹션에서는 Knowledge Catalog 메타 모델을 구성하는 기본 구성요소를 설명합니다.
항목 그룹
항목 그룹 (EntryGroup)은 항목 및 항목 링크의 리전별 컨테이너로, 이러한 리소스를 관리하기 위한 관리 및 보안 경계 역할을 합니다.
항목 그룹을 사용하여 다음을 구성합니다.
- ID 및 액세스 관리 액세스 제어: 개별 항목 권한을 수정하지 않고 항목 그룹의 특정 팀에 보기 또는 수정 권한을 부여합니다.
- 위치 및 프로젝트 기여도: 지리적 지역 및 프로젝트 소유권별로 애셋을 그룹화합니다.
Google Cloud 소스의 경우 Knowledge Catalog는 프로젝트별로 시스템 항목 그룹 (예: @bigquery 또는 @spanner)을 자동으로 만듭니다. 맞춤 데이터 소스의 경우 맞춤 항목 그룹을 만듭니다.
예를 들어 재무팀은 production_finance_data라는 맞춤 항목 그룹을 만들어 한 위치에서 모든 재무 관련 맞춤 항목의 액세스 권한을 관리할 수 있습니다.
자세한 내용은 항목 그룹을 참고하세요.
항목 및 스키마 경로
항목 (Entry)은 단일 데이터 애셋을 나타냅니다. 항목은 구조화된 데이터베이스 테이블, 분석 모델, 구조화되지 않은 객체 테이블 또는 맞춤 외부 데이터 세트를 나타낼 수 있습니다.
항목의 주요 구성요소는 다음과 같습니다.
- 항목 식별자: 상위 항목 그룹 내의 고유한 리소스 이름입니다.
- 항목 유형: 항목의 구조와 필수 관점을 정의하는 템플릿입니다.
- 관점: 항목에 연결된 구조화된 메타데이터 속성입니다.
- 스키마 경로(열): 데이터 애셋 내의 특정 하위 섹션 또는 필드(예: BigQuery 테이블의 열 또는 JSON 스키마의 필드)입니다.
열을 사용하면 애셋 내의 개별 필드에 메타데이터를 연결할 수 있습니다. 열은 사용자가 수동으로 정의하지 않으며, schema 유형의 관점을 항목에 연결할 때 채워집니다. 점 표기법 경로(예: customer.address.postal_code)를 사용하여 중첩된 필드를 참조할 수 있습니다.
예를 들어 orders_project.sales.customer_orders라는 BigQuery 테이블이 항목으로 표시됩니다. 해당 테이블 내의 email_address 필드에 민감한 정보가 포함되어 있다고 설명하려면 분류 관점을 email_address 열 경로에 직접 연결합니다.
자세한 내용은 항목을 참고하세요.
관점 유형
관점 유형 (AspectType)은 관점의 필드, 데이터 유형, 유효성 검사 규칙을 정의하는 재사용 가능한 스키마 템플릿입니다. 모든 관점은 관점 유형의 인스턴스입니다.
관점 유형은 시스템 정의 ( Google Cloud에서 제공) 또는 맞춤 (조직에서 생성)일 수 있습니다.
맞춤 관점 유형의 metadata_template를 정의할 때는 다음 지원되는 데이터 유형을 사용할 수 있습니다.
| 필드 데이터 유형 | 설명 | 사용 사례 |
|---|---|---|
string |
텍스트 값 (UTF-8)입니다. | 소유자 이메일, 데이터 분류 라벨, 부서 이름 |
integer/number |
숫자 값 (정수 또는 부동 소수점 수) | 데이터 보관 기간(일), SLA 타겟 비율, 우선순위 순위 |
boolean |
참 또는 거짓 플래그입니다. | contains_pii: true, is_certified: false. |
enum |
허용된 문자열 값의 사전 정의된 목록입니다. | 환경: ["DEV", "STAGING", "PROD"] |
datetime/timestamp |
ISO 8601 형식의 날짜 및 시간입니다. | 마지막 인증 날짜, 규정 준수 검토 기한입니다. |
record |
하위 필드가 포함된 중첩된 구조화된 객체입니다. | ContactInfo { name: string, email: string, phone: string }개 |
array |
기본 또는 레코드 유형의 반복 값 목록입니다. | 보조 데이터 소유자 목록: ["user1@example.com", "user2@example.com"] |
map |
확장 가능한 속성의 키-값 문자열 쌍입니다. | 맞춤 배포 태그: {"cost_center": "1042", "tier": "gold"} |
예를 들어 연락처 정보에 재사용 가능한 템플릿을 정의하려면 owner_name(string), email (string), support_channel (string) 필드가 있는 ContactInfo라는 관점 유형을 만들면 됩니다.
자세한 내용은 관점 유형을 참고하세요.
관점
관점 (Aspect)은 관점 유형을 준수하는 관련 메타데이터 필드의 집합입니다. 관점은 항목, 항목 경로 (열) 또는 항목 링크에 연결되어 해당 리소스를 설명합니다.
기존 태그 시스템과 달리 Knowledge Catalog의 측면은 상위 항목 또는 항목 링크 내에 직접 캡슐화되므로 원자적 읽기 및 쓰기 작업을 실행할 수 있습니다.
관점은 여러 함수에서 사용됩니다.
- 기술 구조:
Schema측면은 테이블 열, 데이터 유형, 설명을 설명합니다. - 비즈니스 컨텍스트: 맞춤 측면은 소유권, 규정 준수, 수명 주기 상태를 설명합니다.
- 운영 신뢰: 데이터 품질 측면에서 자동 규칙 검사 결과와 검증 점수를 기록합니다.
- 비정형 항목 그래프:
GraphProfile측면은 원시 파일에서 AI로 추출한 항목과 관계 에지를 캡처합니다.
예를 들어 {"owner_name": "Alex", "email": "alex@example.com"} 값이 있는 ContactInfo 관점 유형의 인스턴스를 만들고 이를 customer_orders 항목에 연결할 수 있습니다.
자세한 내용은 관점을 참고하세요.
항목 유형
항목 유형 (EntryType)은 커스텀 항목을 만들기 위한 거버넌스 템플릿입니다. 이 유형의 항목에 연결해야 하는 필수 관점 유형을 설정하여 메타데이터 품질 표준을 적용합니다.
특정 항목 유형의 항목을 만들 때 Knowledge Catalog는 항목 유형에서 required로 표시된 모든 관점 유형이 있고 유효한지 확인합니다.
예를 들어 OwnerInfo 및 DataRetentionPolicy 관점 유형을 필수 항목으로 지정하는 CertifiedDataProduct이라는 항목 유형을 만들 수 있습니다. 이 항목 유형으로 생성된 새 항목을 저장하려면 이러한 관점을 포함해야 합니다.
자세한 내용은 항목 유형을 참고하세요.
항목 링크 및 항목 링크 유형
항목 링크 (EntryLink)는 두 데이터 항목 간 또는 항목 내의 특정 열 간에 시맨틱 관계를 설정합니다. 모든 항목 링크는 항목 링크 유형 (EntryLinkType)의 인스턴스입니다.
진입 링크는 방향성이 있거나 방향성이 없을 수 있습니다.
- 대칭 (비방향성): 양쪽이 모두 동등한 관계(예:
synonym,related,schema-join) - 비대칭 (방향성): 명시적 소스와 타겟이 있는 관계입니다 (예:
definition, 비즈니스 용어집 용어를 테이블 열에 연결).
schema-join 링크를 제외한 항목 링크에 관점을 직접 연결할 수도 있습니다. 이를 통해 결합 신뢰도 점수, 변환 규칙, 매핑 메모 등 관계 자체를 설명할 수 있습니다.
Knowledge Catalog는 다음과 같은 내장 항목 링크 유형을 지원합니다.
synonym: 동등한 비즈니스 개념 또는 대체 용어를 연결합니다.related: 시스템 전반에서 느슨하게 결합된 애셋을 연결합니다.definition: 비즈니스 용어집 정의를 실제 열 또는 항목에 연결합니다.schema-join: 일치하는 외래 키 또는 스키마 경로를 따라 조인할 수 있는 테이블을 연결합니다.
자세한 내용은 EntryLinks REST 참조를 확인하세요.
비즈니스 용어집 및 용어
비즈니스 용어집을 사용하면 용어집, 카테고리, 비즈니스 용어를 정의하여 공식 비즈니스 분류를 설정할 수 있습니다.
definition 또는 synonym 유형의 항목 링크를 사용하여 비즈니스 용어를 실제 항목 및 열 경로에 직접 매핑할 수 있습니다. 사용자 또는 AI 에이전트가 자연어를 사용하여 카탈로그를 검색하면 검색 엔진이 이러한 비즈니스 용어를 해결하여 올바른 실제 데이터 애셋을 찾습니다.
자세한 내용은 비즈니스 용어집 관리를 참고하세요.
지원되는 Google Cloud 소스
Knowledge Catalog는 다음Google Cloud 소스의 메타데이터를 자동으로 수집합니다. PostgreSQL용 AlloyDB 및 Cloud SQL과 같은 일부 서비스의 경우 메타데이터를 수집하기 전에 먼저 Knowledge Catalog 통합을 사용 설정해야 합니다.
분석 및 레이크하우스
- BigQuery 데이터 세트, 테이블, 뷰, 모델, 루틴, 연결, 연결된 데이터 세트, 그래프(미리보기)
- BigQuery Sharing(이전의 Analytics Hub) 교환 및 목록
- Dataform 저장소 및 코드 애셋
- Dataproc Metastore 서비스, 데이터베이스, 테이블
Iceberg REST 카탈로그 테이블 ( Google Cloud Lakehouse 런타임 카탈로그 IRC, Databricks Unity IRC, AWS Glue Data Catalog IRC, Snowflake Horizon IRC 포함)
Apache Hive 테이블
SAP Business 데이터 클라우드 (BDC) Delta Lake 테이블
Lakehouse 런타임 카탈로그에서 관리하는 Apache Iceberg 테이블
AI 및 머신러닝
- Vertex AI 모델, 데이터 세트, 특성 그룹, 특성 뷰, 온라인 상점 인스턴스
비즈니스 인텔리전스
- Looker (Google Cloud 핵심 서비스) 인스턴스, 대시보드, 대시보드 요소, Look, LookML 프로젝트, 모델, Explore, 뷰 (미리보기)
데이터베이스
- Bigtable 인스턴스, 클러스터, 테이블(column family 세부정보 포함)
- Spanner 인스턴스, 데이터베이스, 테이블, 뷰
스트리밍 및 메시지
- Pub/Sub 주제
비정형 데이터
운영 데이터베이스
- PostgreSQL용 AlloyDB 클러스터, 인스턴스, 데이터베이스, 스키마, 테이블, 뷰 (미리보기) Knowledge Catalog는 읽기 복제본이 아닌 AlloyDB 기본 인스턴스에서만 메타데이터를 검색합니다. 자세한 내용은 Knowledge Catalog를 사용하여 PostgreSQL용 AlloyDB 리소스 관리를 참고하세요.
- Cloud SQL 인스턴스, 데이터베이스, 스키마, 테이블, 뷰 Knowledge Catalog는 읽기 복제본이 아닌 Cloud SQL 기본 인스턴스에서만 메타데이터를 검색합니다. 자세한 내용은 Knowledge Catalog를 사용하여 Cloud SQL 리소스 관리를 참고하세요.
서드 파티 소스에서 Knowledge Catalog로 메타데이터를 가져오려면 Knowledge Catalog 커넥터 또는 관리형 연결 파이프라인을 사용하면 됩니다. 자세한 내용은 Knowledge Catalog 커넥터 정보 및 관리형 연결 개요를 참고하세요.
프로젝트 및 위치 제약조건
Knowledge Catalog의 카탈로그 리소스는 특정 Google Cloud 프로젝트와 지리적 위치에 있습니다. 다음 범위 지정 제약 조건이 적용됩니다.
| 리소스 | 위치 규칙 | 프로젝트 규칙 |
|---|---|---|
| 항목 | 항목의 위치가 EntryType의 위치와 일치하거나 EntryType이 global이어야 합니다. |
전역 또는 동일한 프로젝트 항목 유형을 참조할 수 있습니다. |
| 항목의 측면 | 관점의 AspectType은 항목과 동일한 위치에 저장되어야 하며, AspectType은 global이어야 합니다. |
전역 또는 동일한 프로젝트 관점 유형을 참조할 수 있습니다. |
| 진입 링크 | 항목 링크의 위치가 EntryLinkType와 일치하거나 EntryLinkType이 global이어야 합니다. |
동일한 조직 내의 여러 프로젝트에 있는 항목을 연결할 수 있습니다. |
| 항목 유형 | 항목 유형과 동일한 위치에 저장된 관점 유형 또는 global인 관점 유형으로 구성됩니다. |
항목 유형이 맞춤 관점 유형을 참조하는 경우 관점 유형은 동일한 프로젝트 및 위치에 있어야 합니다. |
메타데이터 변경 피드
Knowledge Catalog는 메타데이터 변경 피드를 사용하여 거의 실시간으로 메타데이터 변경 이벤트를 스트리밍할 수 있습니다.
메타데이터 변경 피드는 항목 생성, 업데이트 또는 삭제에 관한 알림을 구성한 Pub/Sub 주제에 게시합니다. 구독자 클라이언트는 이러한 이벤트를 사용하여 스키마가 변경될 때 데이터 품질 평가를 트리거하거나 다운스트림 거버넌스 대시보드를 업데이트하는 등의 운영 워크플로를 자동화할 수 있습니다.
자세한 내용은 메타데이터 변경 피드 정보를 참고하세요.
가격 책정
Knowledge Catalog는 메타데이터 스토리지 SKU를 사용하여 저장된 메타데이터 볼륨에 대한 요금을 청구합니다. 자세한 내용은 Knowledge Catalog 가격 책정을 참고하세요.
다음 항목에는 요금이 청구되지 않습니다.
- 카탈로그 메타 모델 리소스 (항목 유형, 관점 유형, 항목 그룹, 항목, 항목 링크)를 만들고 관리합니다.
- Google Cloud 콘솔에서 실행된 검색 API 호출 및 검색어