Entitätsauflösung in BigQuery konfigurieren und verwenden

Mit der Entitätsabgleichung in BigQuery können Sie Datensätze in verschiedenen Datasets abgleichen, deduplizieren und erweitern, ohne die zugrunde liegenden Daten zu verschieben. Als Endnutzer können Sie Ihre BigQuery-Datasets mit einem Identitätsanbieter wie LiveRamp oder TransUnion verbinden und eine Remote-Funktion aufrufen, um Identitäten direkt aufzulösen. Als Identitätsanbieter können Sie Remotefunktionsendpunkte konfigurieren und Ihre Dienste zur Identitätsabgleichung im Google Cloud Marketplace veröffentlichen.

Entitätsauflösung für Endnutzer konfigurieren

Wenn Sie als Endnutzer Entitäten auflösen möchten, bereiten Sie Eingabe- und Ausgabedatasets in BigQuery vor, gewähren Sie Ihrem Identitätsanbieter Dataset-Zugriff und rufen Sie den entsprechenden Dienst auf. Weitere Informationen zur Architektur finden Sie unter Architektur für die Entitätsauflösung.

Hinweis

  1. Wenden Sie sich an einen Identitätsanbieter. BigQuery unterstützt die Entitätsauflösung mit LiveRamp und TransUnion.
  2. Rufen Sie die folgenden Elemente vom Identitätsanbieter ab:
    • Dienstkonto-Anmeldedaten
    • Signatur der Remote-Funktion
  3. Erstellen Sie die folgenden Datasets in Ihrem Google Cloud -Projekt:
    • Eingabe-Dataset
    • Ausgabe-Dataset

Erforderliche Rollen

Damit das Dienstkonto des Identitätsanbieters die erforderlichen Berechtigungen zum Lesen des Eingabe-Datasets und zum Schreiben in das Ausgabe-Dataset hat, bitten Sie Ihren Administrator, dem Dienstkonto des Identitätsanbieters die folgenden IAM-Rollen zu erteilen:

Weitere Informationen zum Zuweisen von Rollen finden Sie unter Zugriff auf Projekte, Ordner und Organisationen verwalten.

Ihr Administrator kann dem Dienstkonto des Identitätsanbieters möglicherweise auch die erforderlichen Berechtigungen über benutzerdefinierte Rollen oder andere vordefinierte Rollen erteilen.

Entitäten mit einem Identitätsanbieter auflösen

Nachdem Sie Ihre Datasets erstellt und die erforderlichen Rollen zugewiesen haben, können Sie Ihre Tabellen konfigurieren und Abgleichsjobs mit dem ausgewählten Identitätsanbieter ausführen. In der folgenden Tabelle sind die Integrationsmethode und die erforderlichen Tabellen für jeden unterstützten Identitätsanbieter zusammengefasst:

Identitätsanbieter Integrationsmethode Erforderliche Tabellen in Ihrem Dataset Jobaufruf
LiveRamp LiveRamp Embedded Identity Eingabetabelle mit RampIDs, Metadatentabelle E‑Mail-Anfrage an den LiveRamp-Support
TransUnion TruAudience-Remote-Funktion über eine externe BigQuery-Verbindung Eingabetabelle mit Attributen für Entitäten, Metadatentabelle, Tabelle mit dem Jobstatus, Abgleichsausgabetabelle SQL-Aufruf für gespeicherte Prozedur mit CALL

Wählen Sie einen Identitätsanbieter aus, um spezifische Einrichtungs- und Jobausführungsanleitungen aufzurufen:

LiveRamp

LiveRamp-Voraussetzungen

Bevor Sie die LiveRamp-Entitätsauflösung in BigQuery konfigurieren, müssen die folgenden Voraussetzungen erfüllt sein:

LiveRamp-Entitätsauflösung einrichten

Wenn Sie LiveRamp Embedded Identity zum ersten Mal verwenden, führen Sie die folgenden Einrichtungsschritte aus. Bei nachfolgenden Ausführungen müssen Sie nur die Eingabetabelle und die Metadatentabelle aktualisieren.

LiveRamp-Eingabetabelle erstellen

Erstellen Sie eine Tabelle in Ihrem Eingabe-Dataset und füllen Sie sie mit den folgenden Spalten:

  • RampIDs
  • Zieldomains
  • Zieltypen

Weitere Informationen zum Schema der Eingabetabelle finden Sie unter Spalten und Beschreibungen in Eingabetabellen.

LiveRamp-Metadatentabelle erstellen

Wenn Sie die Ausführung von LiveRamp Embedded Identity in BigQuery steuern möchten, erstellen Sie eine Metadatentabelle in Ihrem Eingabedataset. Füllen Sie die Metadatentabelle mit den folgenden Konfigurationsspalten:

  • Kunden-IDs
  • Ausführungsmodi
  • Zieldomains
  • Zieltypen

Weitere Informationen zum Schema der Metadatentabelle finden Sie unter Spalten und Beschreibungen in Metadatentabellen.

LiveRamp Zugriff auf Datasets gewähren

Nachdem Sie die erforderlichen Tabellen erstellt haben, gewähren Sie LiveRamp die Berechtigung, Daten in Ihrem Eingabe-Dataset aufzurufen und zu verarbeiten. Gewähren Sie dem LiveRamp-DienstkontoGoogle Cloud Zugriff auf das Dataset. Weitere Informationen zum Freigeben von Datasets finden Sie unter Tabellen und Datasets für LiveRamp freigeben.

LiveRamp-Entitätsauflösungsjob ausführen

Nachdem Sie Ihre Tabellen konfiguriert und den Dataset-Zugriff gewährt haben, führen Sie einen Job zur Identitätsabgleichung mit LiveRamp in BigQuery aus:

  1. Prüfen Sie, ob alle RampIDs für Ihre Domain in Ihrer Eingabetabelle enthalten sind.
  2. Prüfen Sie vor dem Ausführen des Jobs, ob die Konfiguration der Metadatentabelle korrekt ist.
  3. Wenn Sie eine Jobverarbeitungsanfrage senden möchten, senden Sie eine E-Mail an LiveRampIdentitySupport@liveramp.com. Geben Sie in Ihrer Anfrage die Projekt-ID, die Dataset-ID und alle zutreffenden Tabellen-IDs für die Eingabetabelle, die Metadatentabelle und das Ausgabe-Dataset an.

LiveRamp liefert die Abgleichsergebnisse in der Regel innerhalb von drei Arbeitstagen an Ihr Ausgabe-Dataset.

LiveRamp-Support und Abrechnungsinformationen erhalten

LiveRamp übernimmt den technischen Support und die Abrechnung für Embedded Identity in BigQuery:

  • Technischer Support: Wenn Sie Hilfe bei der Einrichtung oder der Jobausführung benötigen, wenden Sie sich an den LiveRamp Identity Support.
  • Abrechnung: LiveRamp stellt Ihnen die Nutzung der Entitätsauflösung direkt in Rechnung.

TransUnion

Voraussetzungen für TransUnion

Bevor Sie die TransUnion-Identitätsabgleichung in BigQuery konfigurieren, müssen Sie eine E-Mail an den TransUnion Cloud-Support senden, um eine Vereinbarung zum Dienstzugriff zu unterzeichnen. Geben Sie in Ihrer Anfrage die folgenden Informationen an:

  • Ihre Projekt-ID in Google Cloud
  • Eingabedatentypen
  • Vorgesehener Anwendungsfall
  • Geschätztes Datenvolumen

Nachdem der Cloud-Support von TransUnion Ihre Anfrage genehmigt hat, wird der Dienst für Ihr Google Cloud Projekt aktiviert und Sie erhalten einen Implementierungsleitfaden mit den verfügbaren Ausgabeschemas.

TransUnion-Entitätsabgleich einrichten

Wenn Sie den Dienst „TransUnion TruAudience Identity Resolution and Enrichment“ in BigQuery zum ersten Mal verwenden, führen Sie die folgenden Einrichtungsschritte aus.

Externe Verbindung erstellen

Wenn Sie Ihr Google Cloud -Konto mit dem Identitätsabgleichsdienst verbinden möchten, der im Google Cloud -Konto von TransUnion gehostet wird, erstellen Sie eine Cloud-Ressourcenverbindung. Wählen Sie beim Konfigurieren der Verbindung Remote-Modelle in Vertex AI, Remote-Funktionen und BigLake (Cloud-Ressource) als Verbindungstyp aus.

Nachdem Sie die Verbindung erstellt haben, kopieren Sie die Verbindungs-ID und die Dienstkonto-ID und geben Sie diese IDs an das TransUnion-Team für die Kundenbereitstellung weiter.

Remote-Funktion erstellen

Wenn Sie Schemazuordnungen und Konfigurationsmetadaten an den Orchestrator-Endpunkt des TransUnion-Dienstes übergeben möchten, erstellen Sie eine Remote-Funktion. Geben Sie beim Erstellen der Remote-Funktion die Verbindungs-ID aus Ihrer externen Verbindung und die Cloud Run-Funktion-Endpunkt-URL an, die das TransUnion-Kundenserviceteam mit Ihnen geteilt hat.

TransUnion-Eingabetabelle erstellen

Erstellen Sie eine Eingabetabelle in Ihrem Eingabe-Dataset. TransUnion unterstützt die folgenden Attributen als Eingabespalten:

  • Name
  • Postanschrift
  • E-Mail-Adresse
  • Telefonnummer
  • Geburtsdatum
  • IPv4-Adresse
  • Geräte-ID

Halten Sie sich an die Schema- und Formatierungsrichtlinien im Implementierungsleitfaden, den TransUnion mit Ihnen geteilt hat. Wenn Sie jede Eingabetabelle einem separaten config_id-Parameter in Ihrer Metadatentabelle zuordnen, können Sie mehrere Eingabetabellen verwenden.

TransUnion-Metadatentabelle erstellen

Erstellen Sie eine Metadatentabelle in Ihrem Eingabedataset, um die Schemazuordnungen und die Konfiguration zu speichern, die für den Dienst zur Identitätsabgleichung erforderlich sind. Weitere Informationen zum Metadatenschema finden Sie im Implementierungsleitfaden, den TransUnion Ihnen zur Verfügung gestellt hat.

Tabelle mit Jobstatus erstellen

Wenn Sie Updates zur Batchverarbeitung erhalten möchten, erstellen Sie eine Jobstatustabelle in Ihrem Dataset. Wenn Sie Jobs überwachen und Downstream-Prozesse in Ihrer Pipeline auslösen möchten, fragen Sie diese Jobstatustabelle ab. In der Tabelle werden die folgenden Status erfasst:

  • RUNNING: Der Dienst zur Identitätsabgleichung verarbeitet den Batch.
  • COMPLETED: Der Dienst hat die Verarbeitung des Batches abgeschlossen und die Ergebnisse in die Ausgabetabelle geschrieben.
  • ERROR: Beim Verarbeiten des Batches ist ein Fehler aufgetreten.
Prozedur für den Dienstaufruf erstellen

Die gespeicherte Prozedur TransUnion_get_identities packt Ihre Konfigurationsmetadaten und ruft den TransUnion Cloud Run-Funktionsendpunkt auf. Führen Sie die folgende SQL-Anweisung aus, um diese gespeicherte Prozedur zu erstellen:

-- create service invocation procedure
CREATE OR REPLACE
  PROCEDURE
    `PROJECT_ID.DATASET_ID.TransUnion_get_identities`(metadata_table STRING, config_id STRING)
      begin
        declare sql_query STRING;

declare json_result STRING;
declare base64_result STRING;

SET sql_query =
  '''select to_json_string(array_agg(struct(config_id,key,value))) from `''' || metadata_table
  || '''` where  config_id="''' || config_id || '''" ''';

EXECUTE immediate sql_query INTO json_result;

SET base64_result = (SELECT to_base64(CAST(json_result AS bytes)));

SELECT
  `PROJECT_ID.DATASET_ID.remote_call_TransUnion_er`(
    base64_result);
END;

Ersetzen Sie Folgendes:

  • PROJECT_ID: Projekt-ID in Google Cloud .
  • DATASET_ID: die ID des Datasets, in dem Sie die Prozedur und die Remote-Funktion erstellen.
Passende Ausgabetabelle erstellen

In der entsprechenden Ausgabetabelle werden die Ergebnisse der Identitätsabgleichung von TransUnion gespeichert, einschließlich Abgleichs-Flags, Verknüpfungsergebnissen, dauerhaften individuellen IDs und Haushalts-IDs. Führen Sie die folgende SQL-Anweisung aus, um die entsprechende Ausgabetabelle zu erstellen:

-- create output table
CREATE TABLE `PROJECT_ID.DATASET_ID.TransUnion_identity_output`(
  batchid STRING,
  uniqueid STRING,
  ekey STRING,
  hhid STRING,
  collaborationid STRING,
  firstnamematch STRING,
  lastnamematch STRING,
  addressmatches STRING,
  addresslinkagescores STRING,
  phonematches STRING,
  phonelinkagescores STRING,
  emailmatches STRING,
  emaillinkagescores STRING,
  dobmatches STRING,
  doblinkagescore STRING,
  ipmatches STRING,
  iplinkagescore STRING,
  devicematches STRING,
  devicelinkagescore STRING,
  lastprocessed STRING);

Ersetzen Sie Folgendes:

  • PROJECT_ID: Projekt-ID in Google Cloud .
  • DATASET_ID: die ID des Datasets, in dem Sie die entsprechende Ausgabetabelle erstellen.
Metadaten für die Schemazuordnung konfigurieren

Folgen Sie der Anleitung im Implementierungsleitfaden, den TransUnion mit Ihnen geteilt hat, um Ihr Eingabeschema dem TransUnion-Anwendungsschema zuzuordnen. Mit diesen Metadaten wird auch konfiguriert, wie der Dienst Collaboration-IDs generiert. Das sind nicht persistente IDs, die Sie in Data-Clean-Rooms verwenden können.

TransUnion Zugriff auf Datasets gewähren

Nachdem Sie die erforderlichen Tabellen und die gespeicherte Prozedur erstellt haben, gewähren Sie TransUnion Zugriff, um Ihre Eingabedaten zu lesen und Abgleichsergebnisse zu schreiben. Rufen Sie die Dienstkonto-ID für die Apache Spark-Verbindung vom TransUnion-Kundenserviceteam ab. Weisen Sie diesem Dienstkonto dann die Rolle „BigQuery-Datenbearbeiter“ (roles/bigquery.dataEditor) für das Dataset zu, das Ihre Eingabe- und Ausgabetabellen enthält.

TransUnion-Job zur Entitätsauflösung ausführen

Nachdem Sie Ihre Tabellen konfiguriert und den Dataset-Zugriff gewährt haben, können Sie einen Batchlauf zur Identitätsabgleich starten. Rufen Sie die gespeicherte Prozedur TransUnion_get_identities auf, um den Dienst zur Auflösung von Identitäten aufzurufen:

CALL `PROJECT_ID.DATASET_ID.TransUnion_get_identities`(
  "PROJECT_ID.DATASET_ID.TransUnion_er_metadata",
  "CONFIG_ID");

Ersetzen Sie Folgendes:

  • PROJECT_ID: Projekt-ID in Google Cloud .
  • DATASET_ID: die ID des Datasets, das Ihre Metadatentabelle und gespeicherte Prozedur enthält.
  • CONFIG_ID: Die Konfigurations-ID für den Batchlauf, z. B. "1".

TransUnion-Support und Abrechnungsinformationen erhalten

Wenn Sie Hilfe bei technischen Problemen oder Abrechnungsanfragen im Zusammenhang mit TruAudience Identity Resolution und Enrichment in BigQuery benötigen, wenden Sie sich direkt an TransUnion:

  • Technischer Support: Wenn Sie Hilfe bei der Einrichtung, der Schemazuordnung oder der Fehlerbehebung benötigen, wenden Sie sich an den TransUnion Cloud-Support.
  • Abrechnung: TransUnion erfasst die Dienstnutzung zu Abrechnungszwecken. Wenden Sie sich an Ihren TransUnion-Ansprechpartner, um Konto- und Preisinformationen zu erhalten.

Entitätsabgleich für Identitätsanbieter konfigurieren

Als Identitätsanbieter können Sie Ihren Entitätsauflösungsdienst BigQuery-Endnutzern anbieten. Diese Architektur trägt zum Schutz Ihres geistigen Eigentums bei, da Sie Ihren proprietären Identitätsgraphen oder Ihre Abgleichslogik nicht offenlegen.

Um Ihren Dienst zu konfigurieren, stellen Sie einen Orchestrator-Endpunkt bereit, erstellen eine BigQuery-Remote-Funktion, weisen die erforderlichen Rollen zu und geben die Signatur der Remote-Funktion für Ihre Endnutzer frei. Weitere Informationen zur Architektur finden Sie unter Architektur für die Entitätsauflösung.

Hinweis

Bevor Sie den Dienst zur Entitätsauflösung in BigQuery konfigurieren, müssen Sie Folgendes haben:

  • Ein Identity-Graph-Dataset und eine Abgleichslogik, die in IhremGoogle Cloud -Projekt oder in einer externen Datenbank bereitgestellt werden.
  • Hauptkonto-IDs von Endnutzern, z. B. E‑Mail-Adressen von Nutzern, Dienstkonten oder Google-Gruppen, die Sie von Ihren Endnutzern erhalten haben.

Erforderliche Rollen

Damit das Dienstkonto des Identitätsanbieters die erforderlichen Berechtigungen zum Ausführen von Entitätsauflösungsjobs hat, bitten Sie Ihren Administrator, dem Dienstkonto des Identitätsanbieters die folgenden IAM-Rollen zu gewähren:

  • Damit das Dienstkonto, das mit Ihrer Funktion verknüpft ist, auf verknüpften Datasets lesen und schreiben und Aufträge starten kann:
  • Damit das Hauptkonto des Endnutzers die Remote-Funktion sehen und eine Verbindung zu ihr herstellen kann, muss Folgendes erfüllt sein:

Weitere Informationen zum Zuweisen von Rollen finden Sie unter Zugriff auf Projekte, Ordner und Organisationen verwalten.

Ihr Administrator kann dem Dienstkonto des Identitätsanbieters möglicherweise auch die erforderlichen Berechtigungen über benutzerdefinierte Rollen oder andere vordefinierte Rollen erteilen.

Endpunkt der Remote-Funktion einrichten

Um Anfragen zur Identitätsabgleichung von Endnutzern zu verarbeiten, stellen Sie einen Orchestrator-Endpunkt bereit und verbinden Sie ihn mit einer BigQuery-Remote-Funktion:

  1. Wenn Sie Matching-Anfragen von Ihrer Remote-Funktion verarbeiten möchten, erstellen Sie einen Cloud Run-Job oder eine Cloud Run-Funktion. Sie können für Ihren Endpunkt eine der beiden Optionen verwenden.
  2. So finden Sie die E-Mail-Adresse des Dienstkontos, das mit Ihrem Cloud Run-Job oder Ihrer Cloud Run-Funktion verknüpft ist:

    1. Wechseln Sie in der Google Cloud Console zur Seite Cloud Functions.

      Zu Cloud Functions

    2. Klicken Sie auf den Namen Ihrer Funktion und dann auf den Tab Details, um die Funktionsdetails zu öffnen.

    3. Suchen Sie im Bereich Allgemeine Informationen nach der E‑Mail-Adresse des Dienstkontos für die Remotefunktion und notieren Sie sie.

  3. Erstellen Sie in Ihrem Dataset für die Steuerungsebene eine Remote-Funktion, die eine Verbindung zu Ihrem Cloud Run-Job oder Cloud Run-Funktionsendpunkt herstellt.

Remote-Funktion für die Entitätsauflösung freigeben

Nachdem Sie die Remote-Funktion erstellt und Ihren Endnutzern die erforderlichen Rollen zugewiesen haben, geben Sie die folgende Signatur der Remote-Funktion an sie weiter. Endnutzer rufen diese Remote-Funktion auf, um einen Entitätsauflösungsjob zu starten.

`PARTNER_PROJECT_ID.DATASET_ID.match`(LIST_OF_PARAMETERS)

Ersetzen Sie Folgendes:

  • PARTNER_PROJECT_ID: die Google Cloud Projekt-ID des Identitätsanbieters.
  • DATASET_ID: die ID des Datasets, das die Remote-Funktion enthält.
  • LIST_OF_PARAMETERS: Die Liste der Parameter, die an die Remote-Funktion übergeben werden sollen.

Optional: Metadaten für den Job zur Entitätsauflösung angeben

Wenn Sie Endnutzern Jobmetadaten zur Verfügung stellen möchten, können Sie eine separate Remote-Funktion bereitstellen oder eine Jobstatustabelle in das Ausgabedataset des Endnutzers schreiben. Sie können beispielsweise Ausführungsstatus wie RUNNING, COMPLETED oder ERROR zusammen mit Verarbeitungsmesswerten melden.

In Cloud Marketplace für die Abrechnung einbinden

Wenn Sie die Abrechnung und das Onboarding von Kunden über Google verwalten möchten, integrieren Sie Ihren Dienst zur Entitätsauflösung in den Cloud Marketplace. Mit dieser Integration können Sie ein Preismodell basierend auf der Nutzung von Entity Resolution-Jobs konfigurieren, während Google die Abrechnung für Ihren Dienst übernimmt. Weitere Informationen finden Sie unter Software-as-a-Service-Produkte (SaaS) anbieten.

Nächste Schritte