BigQuery에서 항목 확인 구성 및 사용
BigQuery의 엔티티 해결을 사용하면 기본 데이터를 이동하지 않고도 데이터 세트 간에 레코드를 일치시키고, 중복 삭제하고, 보강할 수 있습니다. 최종 사용자는 BigQuery 데이터 세트를 LiveRamp 또는 TransUnion과 같은 ID 제공업체에 연결하고 원격 함수를 호출하여 ID를 제자리에서 확인할 수 있습니다. ID 공급자는 원격 함수 엔드포인트를 구성하고 Google Cloud Marketplace에 항목 확인 서비스를 게시할 수 있습니다.
최종 사용자를 위한 엔티티 확인 구성
최종 사용자가 항목을 확인하려면 BigQuery에서 입력 및 출력 데이터 세트를 준비하고, ID 공급업체에 데이터 세트 액세스 권한을 부여하고, 일치 서비스를 호출합니다. 아키텍처에 대한 자세한 내용은 항목 확인 아키텍처를 참고하세요.
시작하기 전에
- ID 공급업체에 문의합니다. BigQuery는 LiveRamp 및 TransUnion을 사용한 항목 확인을 지원합니다.
- ID 공급업체에서 다음 항목을 가져옵니다.
- 서비스 계정 사용자 인증 정보
- 원격 함수 서명
- Google Cloud 프로젝트에서 다음 데이터 세트를 만듭니다.
- 입력 데이터 세트
- 출력 데이터 세트
필요한 역할
ID 공급자의 서비스 계정에 입력 데이터 세트를 읽고 출력 데이터 세트에 쓰는 데 필요한 권한이 있는지 확인하려면 관리자에게 ID 공급자의 서비스 계정에 다음 IAM 역할을 부여해 달라고 요청하세요.
- 입력 데이터 세트의 BigQuery 데이터 뷰어 (
roles/bigquery.dataViewer) - 출력 데이터 세트의 BigQuery 데이터 편집자 (
roles/bigquery.dataEditor)
역할 부여에 대한 자세한 내용은 프로젝트, 폴더, 조직에 대한 액세스 관리를 참조하세요.
관리자는 커스텀 역할이나 다른 사전 정의된 역할을 통해 ID 제공업체의 서비스 계정에 필요한 권한을 부여할 수도 있습니다.
ID 공급업체로 엔티티 확인
데이터 세트를 만들고 필요한 역할을 부여한 후 테이블을 구성하고 선택한 ID 공급업체로 매칭 작업을 실행할 수 있습니다. 다음 표에는 지원되는 각 ID 공급업체의 통합 방법과 필수 테이블이 요약되어 있습니다.
| ID 공급업체 | 통합 방법 | 데이터 세트의 필수 테이블 | 작업 호출 |
|---|---|---|---|
| LiveRamp | LiveRamp 임베디드 ID | RampID가 포함된 입력 테이블, 메타데이터 테이블 | LiveRamp 지원팀에 이메일 요청 |
| TransUnion | BigQuery 외부 연결을 통한 TruAudience 원격 함수 | 엔티티 속성이 있는 입력 테이블, 메타데이터 테이블, 작업 상태 테이블, 일치하는 출력 테이블 | CALL를 사용한 SQL 저장 프로시저 호출 |
ID 공급자를 선택하여 구체적인 설정 및 작업 실행 안내를 확인하세요.
LiveRamp
LiveRamp 사전 요구사항
BigQuery에서 LiveRamp 항목 확인을 구성하기 전에 다음 기본 요건을 완료하세요.
- BigQuery에서 LiveRamp 임베디드 ID 구성 자세한 내용은 BigQuery에서 LiveRamp 임베디드 ID 사용 설정을 참조하세요.
- LiveRamp와 함께 임베디드 ID와 호환되는 API 사용자 인증 정보를 사용 설정합니다. 자세한 내용은 인증을 참조하세요.
LiveRamp 항목 확인 설정
LiveRamp 임베디드 ID를 처음 사용하는 경우 다음 설정 단계를 완료하세요. 후속 실행의 경우 입력 테이블과 메타데이터 테이블만 업데이트하면 됩니다.
LiveRamp 입력 테이블 만들기
입력 데이터 세트에 테이블을 만들고 다음 열로 채웁니다.
- RampIDs
- 타겟 도메인
- 타겟 유형
입력 테이블 스키마에 대한 자세한 내용은 입력 테이블 열 및 설명을 참고하세요.
LiveRamp 메타데이터 테이블 만들기
BigQuery에서 LiveRamp 임베디드 ID 실행을 제어하려면 입력 데이터 세트에 메타데이터 테이블을 만드세요. 다음 구성 열로 메타데이터 테이블을 채웁니다.
- 클라이언트 ID
- 실행 모드
- 타겟 도메인
- 타겟 유형
메타데이터 테이블 스키마에 대한 자세한 내용은 메타데이터 테이블 열 및 설명을 참고하세요.
LiveRamp에 데이터 세트 액세스 권한 부여
필요한 테이블을 만든 후 LiveRamp에 입력 데이터 세트의 데이터를 보고 처리할 수 있는 액세스 권한을 부여합니다. LiveRampGoogle Cloud 서비스 계정에 데이터 세트 액세스 권한을 부여합니다. 데이터 세트 공유에 대한 자세한 내용은 LiveRamp와 테이블 및 데이터 세트 공유를 참고하세요.
LiveRamp 항목 확인 작업 실행
테이블을 구성하고 데이터 세트 액세스 권한을 부여한 후 BigQuery에서 LiveRamp로 엔티티 해결 작업을 실행합니다.
- 입력 테이블에서 도메인의 모든 RampID가 있는지 확인합니다.
- 작업을 실행하기 전에 메타데이터 테이블 구성이 정확한지 확인합니다.
- 작업 처리 요청을 제출하려면 LiveRampIdentitySupport@liveramp.com으로 이메일을 보내세요. 요청에 입력 테이블, 메타데이터 테이블, 출력 데이터 세트의 프로젝트 ID, 데이터 세트 ID, 해당 테이블 ID를 포함하세요.
LiveRamp는 일반적으로 영업일 기준 3일 이내에 매칭 결과를 출력 데이터 세트에 제공합니다.
LiveRamp 지원 및 결제 정보 받기
LiveRamp는 BigQuery의 임베디드 ID에 대한 기술 지원 및 결제를 관리합니다.
- 기술 지원: 설정 또는 작업 실행에 대한 지원은 LiveRamp ID 지원에 문의하세요.
- 결제: LiveRamp에서 항목 확인 사용량에 대해 직접 청구합니다.
TransUnion
TransUnion 기본 요건
BigQuery에서 TransUnion 항목 확인을 구성하기 전에 TransUnion Cloud 지원팀에 이메일을 보내 서비스 액세스 계약에 서명하세요. 요청에 다음 정보를 제공하세요.
- Google Cloud 프로젝트 ID
- 입력 데이터 유형
- 의도된 사용 사례
- 예상 데이터 볼륨
TransUnion Cloud 지원팀에서 요청을 승인하면 Google Cloud 프로젝트에 서비스를 사용 설정하고 사용 가능한 출력 스키마가 포함된 구현 가이드를 공유합니다.
TransUnion 항목 확인 설정
BigQuery에서 TransUnion TruAudience 신원 확인 및 보강 서비스를 처음 사용하는 경우 다음 설정 단계를 완료하세요.
외부 연결 만들기
Google Cloud 계정을 TransUnion Google Cloud 계정에 호스팅된 ID 확인 서비스에 연결하려면 Cloud 리소스 연결을 만드세요. 연결을 구성할 때 연결 유형으로 Vertex AI 원격 모델, 원격 함수, BigLake (Cloud 리소스)를 선택합니다.
연결을 만든 후 연결 ID와 서비스 계정 ID를 복사한 다음 TransUnion 고객 제공팀과 이러한 식별자를 공유합니다.
원격 함수 만들기
스키마 매핑 및 구성 메타데이터를 TransUnion 서비스 오케스트레이터 엔드포인트에 전달하려면 원격 함수를 만드세요. 원격 함수를 만들 때 외부 연결의 연결 ID와 TransUnion 고객 제공팀에서 공유한 Cloud Run 함수 엔드포인트 URL을 지정합니다.
TransUnion 입력 테이블 만들기
입력 데이터 세트에 입력 테이블을 만듭니다. TransUnion은 다음 항목 속성을 입력 열로 지원합니다.
- 이름
- 우편 주소
- 이메일 주소
- 전화번호
- 생년월일
- IPv4 주소
- 기기 ID
TransUnion에서 공유한 구현 가이드의 스키마 및 서식 가이드라인을 따르세요. 메타데이터 테이블에서 각 입력 테이블을 별도의 config_id 매개변수에 매핑하면 여러 입력 테이블을 사용할 수 있습니다.
TransUnion 메타데이터 테이블 만들기
ID 확인 서비스에 필요한 스키마 매핑과 구성을 저장하려면 입력 데이터 세트에 메타데이터 테이블을 만드세요. 메타데이터 스키마에 관한 자세한 내용은 TransUnion에서 공유한 구현 가이드를 참고하세요.
작업 상태 테이블 만들기
일괄 처리 업데이트를 받으려면 데이터 세트에 작업 상태 테이블을 만드세요. 작업을 모니터링하고 파이프라인에서 다운스트림 프로세스를 트리거하려면 이 작업 상태 테이블을 쿼리하세요. 표에는 다음 상태가 기록됩니다.
RUNNING: ID 확인 서비스가 일괄 처리를 처리하고 있습니다.COMPLETED: 서비스가 일괄 처리를 완료하고 결과를 출력 테이블에 썼습니다.ERROR: 서비스를 통해 일괄 처리를 처리하는 중에 오류가 발생했습니다.
서비스 호출 절차 만들기
TransUnion_get_identities 저장 프로시저는 구성 메타데이터를 패키징하고 TransUnion Cloud Run 함수 엔드포인트를 호출합니다. 이 저장 프로시저를 만들려면 다음 SQL 문을 실행합니다.
-- create service invocation procedure
CREATE OR REPLACE
PROCEDURE
`PROJECT_ID.DATASET_ID.TransUnion_get_identities`(metadata_table STRING, config_id STRING)
begin
declare sql_query STRING;
declare json_result STRING;
declare base64_result STRING;
SET sql_query =
'''select to_json_string(array_agg(struct(config_id,key,value))) from `''' || metadata_table
|| '''` where config_id="''' || config_id || '''" ''';
EXECUTE immediate sql_query INTO json_result;
SET base64_result = (SELECT to_base64(CAST(json_result AS bytes)));
SELECT
`PROJECT_ID.DATASET_ID.remote_call_TransUnion_er`(
base64_result);
END;
다음을 바꿉니다.
PROJECT_ID: Google Cloud 프로젝트 ID입니다.DATASET_ID: 프로시져와 원격 함수를 만드는 데이터 세트의 ID입니다.
일치하는 출력 테이블 만들기
일치 출력 테이블에는 일치 플래그, 연결 점수, 영구 개인 ID, 가구 ID를 비롯한 TransUnion의 엔티티 확인 결과가 저장됩니다. 일치하는 출력 테이블을 만들려면 다음 SQL 문을 실행하세요.
-- create output table
CREATE TABLE `PROJECT_ID.DATASET_ID.TransUnion_identity_output`(
batchid STRING,
uniqueid STRING,
ekey STRING,
hhid STRING,
collaborationid STRING,
firstnamematch STRING,
lastnamematch STRING,
addressmatches STRING,
addresslinkagescores STRING,
phonematches STRING,
phonelinkagescores STRING,
emailmatches STRING,
emaillinkagescores STRING,
dobmatches STRING,
doblinkagescore STRING,
ipmatches STRING,
iplinkagescore STRING,
devicematches STRING,
devicelinkagescore STRING,
lastprocessed STRING);
다음을 바꿉니다.
PROJECT_ID: Google Cloud 프로젝트 ID입니다.DATASET_ID: 일치하는 출력 테이블을 만들 데이터 세트의 ID입니다.
스키마 매핑 메타데이터 구성
입력 스키마를 TransUnion 애플리케이션 스키마에 매핑하려면 TransUnion에서 공유한 구현 가이드의 안내를 따르세요. 이 메타데이터는 서비스가 데이터 클린룸에서 사용할 수 있는 공유 가능하고 영구적이지 않은 식별자인 공동작업 ID를 생성하는 방식도 구성합니다.
TransUnion에 데이터 세트 액세스 권한 부여
필요한 테이블과 저장 프로시저를 만든 후 TransUnion에 입력 데이터를 읽고 일치 결과를 쓸 수 있는 액세스 권한을 부여합니다. TransUnion 고객 제공팀에서 Apache Spark 연결 서비스 계정 ID를 가져옵니다. 그런 다음 입력 및 출력 테이블이 포함된 데이터 세트에 해당 서비스 계정에 BigQuery 데이터 편집자 역할 (roles/bigquery.dataEditor)을 부여합니다.
TransUnion 항목 확인 작업 실행
표를 구성하고 데이터 세트 액세스 권한을 부여한 후 엔티티 해결 일괄 실행을 시작할 수 있습니다. 엔티티 해결 서비스를 호출하려면 TransUnion_get_identities 저장 프로시저를 호출합니다.
CALL `PROJECT_ID.DATASET_ID.TransUnion_get_identities`(
"PROJECT_ID.DATASET_ID.TransUnion_er_metadata",
"CONFIG_ID");
다음을 바꿉니다.
PROJECT_ID: Google Cloud 프로젝트 ID입니다.DATASET_ID: 메타데이터 테이블과 저장 프로시져가 포함된 데이터 세트의 ID입니다.CONFIG_ID: 일괄 실행의 구성 ID입니다(예:"1").
TransUnion 지원 및 결제 정보 받기
BigQuery의 TruAudience 신원 확인 및 보강과 관련된 기술 문제 또는 결제 문의는 TransUnion에 직접 문의하세요.
- 기술 지원: 설정, 스키마 매핑 또는 문제 해결에 관한 지원을 받으려면 TransUnion Cloud 지원팀에 문의하세요.
- 결제: TransUnion은 결제 목적으로 서비스 사용량을 추적합니다. 계정 및 가격에 대한 자세한 내용은 TransUnion 담당자에게 문의하세요.
ID 공급업체의 엔티티 확인 구성
ID 공급업체는 BigQuery 최종 사용자에게 항목 확인 서비스를 제공할 수 있습니다. 이 아키텍처는 독점 ID 그래프나 일치 로직을 노출하지 않으므로 지식 재산을 보호하는 데 도움이 됩니다.
서비스를 구성하려면 오케스트레이터 엔드포인트를 배포하고, BigQuery 원격 함수를 만들고, 필요한 역할을 부여하고, 원격 함수 서명을 최종 사용자와 공유합니다. 아키텍처에 대한 자세한 내용은 항목 확인 아키텍처를 참고하세요.
시작하기 전에
BigQuery에서 항목 확인 서비스를 구성하기 전에 다음이 있는지 확인하세요.
- Google Cloud 프로젝트 또는 외부 데이터베이스에 배포된 ID 그래프 데이터 세트 및 일치 로직
- 최종 사용자로부터 획득한 최종 사용자 주 구성원 식별자(예: 사용자, 서비스 계정 또는 Google 그룹 이메일 주소)
필요한 역할
ID 공급자의 서비스 계정에 항목 확인 작업을 실행하는 데 필요한 권한이 있는지 확인하려면 관리자에게 ID 공급자의 서비스 계정에 다음 IAM 역할을 부여해 달라고 요청하세요.
-
함수와 연결된 서비스 계정에서 연결된 데이터 세트를 읽고 쓰고 작업을 실행하기 위한 역할:
- 프로젝트에 대한 BigQuery 데이터 편집자 (
roles/bigquery.dataEditor) - 프로젝트에 대한 BigQuery 작업 사용자(
roles/bigquery.jobUser)
- 프로젝트에 대한 BigQuery 데이터 편집자 (
-
최종 사용자 주 구성원이 원격 함수를 보고 연결하기 위한 역할:
- 연결에 대한 BigQuery 연결 사용자 (
roles/bigquery.connectionUser) - 원격 함수가 있는 컨트롤 플레인 데이터 세트에 대한 BigQuery 데이터 뷰어 (
roles/bigquery.dataViewer)
- 연결에 대한 BigQuery 연결 사용자 (
역할 부여에 대한 자세한 내용은 프로젝트, 폴더, 조직에 대한 액세스 관리를 참조하세요.
관리자는 커스텀 역할이나 다른 사전 정의된 역할을 통해 ID 제공업체의 서비스 계정에 필요한 권한을 부여할 수도 있습니다.
원격 함수 엔드포인트 설정
최종 사용자의 엔티티 해결 요청을 처리하려면 오케스트레이터 엔드포인트를 배포하고 BigQuery 원격 함수에 연결하세요.
- 원격 함수의 일치하는 요청을 처리하려면 Cloud Run 작업 또는 Cloud Run 함수를 만듭니다. 엔드포인트에 두 옵션 중 하나를 사용할 수 있습니다.
Cloud Run 작업 또는 Cloud Run 함수와 연결된 서비스 계정 이메일 주소를 찾으려면 다음 단계를 완료하세요.
Google Cloud 콘솔에서 Cloud Functions 페이지로 이동합니다.
함수 세부정보를 열려면 함수 이름을 클릭한 후 세부정보 탭을 클릭합니다.
일반 정보 창에서 원격 함수의 서비스 계정 이메일 주소를 찾아 기록합니다.
컨트롤 플레인 데이터 세트에서 Cloud Run 작업 또는 Cloud Run 함수 엔드포인트에 연결되는 원격 함수를 만듭니다.
항목 확인 원격 함수 공유
원격 함수를 만들고 최종 사용자에게 필요한 역할을 부여한 후 다음 원격 함수 서명을 공유합니다. 최종 사용자는 이 원격 함수를 호출하여 항목 확인 작업을 시작합니다.
`PARTNER_PROJECT_ID.DATASET_ID.match`(LIST_OF_PARAMETERS)
다음을 바꿉니다.
PARTNER_PROJECT_ID: ID 제공업체의 Google Cloud 프로젝트 ID입니다.DATASET_ID: 원격 함수가 포함된 데이터 세트의 ID입니다.LIST_OF_PARAMETERS: 원격 함수에 전달할 파라미터 목록입니다.
선택사항: 항목 확인 작업 메타데이터 제공
최종 사용자에게 작업 메타데이터를 제공하려면 별도의 원격 함수를 노출하거나 최종 사용자의 출력 데이터 세트에 작업 상태 테이블을 작성하면 됩니다. 예를 들어 처리 측정항목과 함께 RUNNING, COMPLETED, ERROR와 같은 실행 상태를 보고할 수 있습니다.
결제를 위해 Cloud Marketplace와 통합
Google을 통해 고객 결제 및 온보딩을 관리하려면 항목 확인 서비스를 Cloud Marketplace와 통합하세요. 이 통합을 사용하면 항목 확인 작업 사용량을 기준으로 가격 책정 모델을 구성할 수 있으며 Google에서 서비스의 결제를 처리합니다. 자세한 내용은 Software as a Service(SaaS) 제품 제공을 참조하세요.
다음 단계
- BigQuery Sharing의 항목 확인에 대해 알아봅니다.
- 원격 함수를 만드는 방법을 알아봅니다.
- Cloud 리소스 연결을 만드는 방법을 알아보세요.
- ID 제공업체의 경우 Google Cloud Marketplace에서 항목 확인 서비스를 제공하는 방법을 알아보세요.