Présentation du framework de résolution des entités BigQuery
La résolution d'entités BigQuery vous permet de faire correspondre des enregistrements dans des ensembles de données partagés qui ne disposent pas d'identifiant commun. Vous pouvez également utiliser un fournisseur d'identité partenaire Google Cloud pour enrichir vos données partagées avec des attributs supplémentaires. Par exemple, vous pouvez associer des fiches client dans différents ensembles de données pour créer des profils client unifiés, détecter les fraudes financières ou analyser les chaînes d'approvisionnement.
Avant de contribuer des données à une salle blanche de données, vous pouvez utiliser la résolution d'entités pour préparer et faire correspondre vos enregistrements. La résolution des entités est disponible dans les modèles de tarification à la demande et des capacités, ainsi que dans toutes les éditions BigQuery. Pour en savoir plus sur l'implémentation, consultez Configurer et utiliser la résolution d'entités dans BigQuery.
Avantages de la résolution d'entités
La résolution des entités offre des avantages opérationnels et de partage de données aux utilisateurs finaux et aux fournisseurs d'identité.
Avantages pour les utilisateurs finaux
Lorsque vous résolvez des entités dans BigQuery, vous bénéficiez des avantages suivants en tant qu'utilisateur final :
- Résolution sur place : vous résolvez les entités sur place sans frais de transfert de données. Un fournisseur d'identité fait correspondre vos données à son graphique d'identité et écrit les résultats de la résolution d'entité dans un ensemble de données de votre projet Google Cloud .
- Opérations simplifiées : vous n'avez pas à gérer les pipelines d'extraction, de transformation et de chargement (ETL) ni les workflows de réplication de données personnalisés.
Avantages des fournisseurs d'identité
Lorsque vous proposez des services d'identité dans BigQuery, vous bénéficiez des avantages suivants en tant que fournisseur d'identité :
- Intégration Marketplace : vous pouvez proposer la résolution d'entités sous forme de produit Software as a Service (SaaS) géré sur Google Cloud Marketplace.
- Protection de la propriété intellectuelle : vous utilisez vos graphiques d'identité propriétaires et votre logique de correspondance sans les révéler aux utilisateurs finaux. Cette architecture permet de protéger votre propriété intellectuelle.
Architecture de la résolution d'entités
BigQuery implémente la résolution d'entités en appelant des fonctions distantes qui exécutent des processus de mise en correspondance dans l'environnement d'un fournisseur d'identité. BigQuery ne copie ni ne déplace vos données au cours de ce processus.
Le schéma suivant illustre le workflow de résolution d'entités entre un projet Google Cloud d'utilisateur final et un projet Google Cloud de fournisseur d'identité :
Le workflow de résolution d'entités comprend les étapes suivantes :
- Vous accordez au compte de service du fournisseur d'identité un accès en lecture à votre ensemble de données d'entrée et un accès en écriture à votre ensemble de données de sortie.
- Vous appelez la fonction à distance pour faire correspondre vos données d'entrée avec les données du graphique d'identité du fournisseur d'identité. La fonction à distance transmet vos paramètres de correspondance au fournisseur d'identité.
- Le compte de service du fournisseur d'identité lit et traite votre ensemble de données d'entrée.
- Le compte de service du fournisseur d'identité écrit les résultats de la résolution d'entité dans votre ensemble de données de sortie.
Pour exécuter ce workflow, la résolution d'entités s'appuie sur des composants de votre environnement et de celui du fournisseur d'identité.
Composants de l'utilisateur final
Votre projet Google Cloud contient les composants utilisateur final suivants :
- Appel de fonction distante : appel qui exécute une procédure définie et mise en œuvre par le fournisseur d'identité. Cet appel lance le processus de résolution d'entités.
- Ensemble de données d'entrée : ensemble de données source contenant les données que vous souhaitez mettre en correspondance. L'ensemble de données d'entrée peut éventuellement contenir une table de métadonnées avec des paramètres supplémentaires. Les fournisseurs d'identité spécifient les exigences de schéma pour les ensembles de données d'entrée.
- Ensemble de données de sortie : ensemble de données de destination dans lequel le fournisseur d'identité écrit les résultats correspondants sous forme de table de sortie. Le fournisseur d'identité peut éventuellement écrire une table d'état du job avec des informations sur le job dans cet ensemble de données. L'ensemble de données de sortie peut être le même que l'ensemble de données d'entrée.
Composants du fournisseur d'identité
L'environnement du fournisseur d'identité contient les composants suivants :
- Plan de contrôle : contient une fonction distante BigQuery qui orchestre le processus de mise en correspondance. Le fournisseur d'identité peut implémenter cette fonction en tant que job Cloud Run ou fonction Cloud Run. Le plan de contrôle peut également contenir des services d'authentification et d'autorisation.
- Plan de données : contient l'ensemble de données du graphe d'identité et la procédure stockée qui exécute la logique de mise en correspondance. Un graphique d'identité est une base de données de référence des identifiants et attributs d'entités connues. Le fournisseur d'identité peut implémenter la procédure stockée en tant que procédure stockée SQL ou procédure stockée Apache Spark. L'ensemble de données du graphe d'identité contient les tables que le fournisseur d'identité met en correspondance avec vos données.
Remarques
Lorsque vous planifiez le déploiement de la résolution d'entités, tenez compte des facteurs suivants :
- Coordination avec le fournisseur d'identité : avant d'exécuter des jobs de mise en correspondance, vous devez vous coordonner avec un fournisseur d'identité compatible pour obtenir les identifiants de son compte de service et la signature de la fonction à distance.
- Bases de données externes : les fournisseurs d'identité hébergent généralement les graphiques d'identité dans BigQuery, mais ils peuvent également les stocker dans des bases de données externes.
Étapes suivantes
- Découvrez comment configurer et utiliser la résolution d'entités.
- Découvrez comment utiliser des fonctions distantes.
- Découvrez comment utiliser des procédures stockées SQL.
- Découvrez comment partager des données sensibles avec des data clean rooms.