Une analyse du profil de données pour les données non structurées dans Knowledge Catalog transforme les données obscures ou les fichiers non structurés tels que les PDF dans Cloud Storage en éléments structurés et interrogeables dans BigQuery. Alors que les outils de découverte standards sont limités aux métadonnées au niveau des fichiers, telles que la taille et le type, une analyse de profilage des données non structurées optimisée par les modèles Gemini de Vertex AI analyse le contenu des fichiers. Il extrait automatiquement le contexte métier nécessaire pour ancrer les agents d'IA et alimenter les analyses avancées.
Cette automatisation élimine le besoin d'analyser manuellement les documents et d'utiliser du code ETL personnalisé. Vous pouvez ainsi découvrir, classer et utiliser des données qui étaient auparavant inaccessibles.
Une analyse de profilage des données non structurées analyse le contenu des fichiers non structurés pour extraire des informations et déduire des schémas. Cette fonctionnalité est différente de celle des insights sur les données structurées, qui génère des descriptions et des requêtes SQL en fonction des métadonnées des tables structurées existantes, et du profilage des données statistiques standards, qui calcule des métriques telles que le nombre de valeurs nulles et les distributions de valeurs.
Découverte automatisée et profilage sémantique
Vous pouvez profiler des données non structurées à l'aide de deux workflows différents, selon votre point de départ :
Lors d'une analyse de découverte Cloud Storage : une analyse de découverte localise automatiquement vos fichiers non structurés dans Cloud Storage et les catalogue dans une ou plusieurs tables d'objets dans BigQuery pour analyse. Une table d'objets est une table en lecture seule sur des objets de données non structurés stockés dans Cloud Storage. Lorsque vous exécutez une analyse de découverte avec l'option Activer l'inférence sémantique activée, elle sert de point d'entrée automatisé pour le profilage des données non structurées.
En tant qu'analyse de profil de données autonome pour les données non structurées : si vous disposez déjà de tables d'objets BigQuery, vous pouvez exécuter une analyse de profil de données pour les données non structurées directement sur ces tables. Dans ce workflow autonome, vous pouvez également guider l'extraction en fournissant une requête personnalisée dans la spécification DataScan.
Lorsque le profilage des données non structurées est effectué (automatiquement lors d'une analyse de découverte ou en tant qu'analyse autonome), le système enregistre les tables d'objets en tant qu'entrées dans le catalogue de connaissances. Une entrée représente un élément de données pour lequel vous capturez des métadonnées. Lorsqu'une analyse de découverte crée plusieurs tables, chaque entrée possède son propre onglet "Insights". Vous pouvez ensuite ouvrir cette entrée pour explorer les insights générés sur les données. Le système effectue les actions suivantes :
Identifie et regroupe les fichiers (analyse de découverte uniquement). Identifie et organise automatiquement les fichiers non structurés dans Cloud Storage en tables d'objets. Ces tables d'objets sont en lecture seule et fournissent une interface structurée à vos données non structurées.
Effectue une analyse du profil de données non structurées. Utilise les modèles Gemini de Vertex AI pour analyser le contenu des fichiers afin de comprendre leur signification et leur structure. Cela inclut l'inférence d'entités, qui utilise l'IA générative pour extraire des attributs spécifiques (par exemple,
Company,ProductouSerial Number) du contenu du fichier. Il inclut également l'extraction des relations, qui identifie la façon dont ces entités sont connectées (par exemple,Component is_part_of Product) pour créer un graphique sémantique. Si vous exécutez une analyse de profilage autonome, vous pouvez guider cette extraction en fournissant une invite personnalisée dans la spécification DataScan.Génère des schémas et des profils de graphiques. Fournit un schéma relationnel suggéré par l'IA et associe un aspect
Graph Profile(dataplex-types.global.graph-profile) à l'entrée de catalogue représentant la table d'objets. Les aspects permettent de compléter les entrées en fournissant des métadonnées. Cet aspect des métadonnées contient les schémas inférés pour les entités (NodeType) et les relations (EdgeType).Enrichit les métadonnées. remplit automatiquement le Knowledge Catalog avec des métadonnées générées par l'IA. Les données sont ainsi consultables et prêtes à être extraites.
Au lieu de concevoir manuellement des schémas de base de données, vous pouvez effectuer l'extraction de données à l'aide de l'orchestration de pipelines ou de SQL en un clic. Ce processus matérialise les entités et les relations inférées dans des formats structurés, tels que des tables ou des vues BigQuery physiques.
Méthodes d'API
Vous pouvez configurer, exécuter et gérer des analyses de profil de données pour les données non structurées et les entrées de catalogue qui en résultent à l'aide des méthodes d'API REST suivantes :
| Méthode API | Description |
|---|---|
projects.locations.dataScans.create |
Crée une analyse de découverte (à l'aide de dataDiscoverySpec) ou une analyse de profilage des données autonome pour les données non structurées (à l'aide de unstructuredDataProfileSpec). |
projects.locations.dataScans.run |
Déclenche une tâche d'analyse de profil de données ou de découverte à la demande pour analyser les fichiers non structurés et générer des insights sémantiques. |
projects.locations.dataScans.get |
Récupère les détails de configuration et les derniers résultats d'un job d'analyse de profilage des données existant. |
projects.locations.dataScans.jobs.list |
Liste les jobs d'analyse historiques pour une analyse de profilage des données ou une analyse de découverte spécifique. |
projects.locations.dataScans.jobs.get |
Récupère les résultats d'exécution et les journaux détaillés d'un job d'analyse de profil de données spécifique. |
projects.locations.entryGroups.entries.get |
Récupère une entrée de catalogue représentant une table d'objets, y compris ses aspects de métadonnées générés par IA (tels que GraphProfile). |
projects.locations.entryGroups.entries.patch |
Met à jour une entrée de catalogue pour associer, modifier ou organiser des aspects de métadonnées (tels que dataplex-types.global.graph-profile). |
Cas d'utilisation
Vous pouvez utiliser les analyses de profils de données pour les données non structurées à diverses fins dans différents secteurs, y compris les suivantes :
Configuration du pipeline et normalisation sans ETL Facilitez l'extraction de données de Cloud Storage vers BigQuery en remplaçant les analyseurs personnalisés par une suggestion de schéma automatisée et un déploiement en un clic pour matérialiser les données dans des tables, des vues ou des graphiques sémantiques BigQuery.
Par exemple, dans le secteur de l'e-commerce et de la vente au détail, une place de marché peut automatiquement normaliser les factures et les bons de commande des fournisseurs dans des centaines de mises en page PDF différentes en un schéma BigQuery cohérent et unifié (en mappant
Unit Pr.,Price/PkgetItem Costsur une seule colonneUnit_Price) sans écrire de code d'analyse personnalisé. Dans le secteur de la santé, les biostatisticiens peuvent ingérer des protocoles d'essais cliniques multicentriques et des formulaires de rapport de cas dans des tableaux structurés pour une analyse rapide des cohortes.Classification et validation du contenu : Regroupez automatiquement les données obscures dans des composants consultables enrichis de métadonnées générées par l'IA. Les responsables des données peuvent ainsi valider et surveiller à grande échelle les entités extraites à l'aide de la validation humaine en boucle.
Par exemple, dans les services financiers, une banque d'investissement effectuant une due diligence pour une fusion et acquisition peut classer automatiquement de grands référentiels de contrats et d'accords de crédit historiques, en extrayant des entités juridiques complexes (
Contracting_Parties,Indemnity_Cap,Governing_Law). Les responsables des données peuvent explorer le graphique de connaissances visuel dans l'onglet Insights pour identifier les passifs à haut risque avant d'exporter les données vers des rapports exécutifs.Ancrage des agents d'IA. Ancrez les agents de génération augmentée par récupération (RAG) avec des graphiques validés. Cela fournit une "chaîne de traçabilité" claire qui relie les fichiers bruts à la logique métier structurée, ce qui réduit les hallucinations et permet aux agents d'IA de parcourir les jointures de plusieurs tables sans aucune ambiguïté.
Par exemple, dans les opérations de fabrication et industrielles, une entreprise de machinerie lourde peut extraire les relations entre les équipements à partir de décennies de journaux de maintenance sur le terrain et de rapports d'incidents non structurés. Lorsqu'un technicien sur site demande à un agent d'IA conversationnelle comment résoudre une baisse de pression hydraulique inhabituelle, l'agent utilise le graphique de relations validé (
Error_Code indicates_failure Hydraulic_Valve) pour fournir un plan de réparation précis et détaillé, en citant le signalement d'incident historique exact.
Limites
Avant d'utiliser des analyses de profilage des données pour les données non structurées, consultez les limites suivantes :
Formats acceptés Alors que les analyses de découverte identifient et regroupent automatiquement différents types de fichiers non structurés dans des tables d'objets BigQuery, le moteur d'inférence sémantique pour les analyses de profil de données non structurées est principalement optimisé pour les documents PDF.
Zones géographiques : Les analyses de profil de données pour les données non structurées ne sont disponibles que dans les régions qui acceptent les modèles Gemini 2.5 Pro de Vertex AI (par exemple,
us-central1,europe-west1,asia-southeast1). Pour obtenir la liste des régions acceptées, consultez la section Régions acceptées dans Gemini 2.5 Pro. Les analyses créées dans des régions non acceptées renvoient des erreurs de validation ou d'exécution.Champ d'application des ressources : Les analyses de profil de données pour les données non structurées fonctionnent exclusivement sur les tables d'objets BigQuery. Elles ne sont pas compatibles avec les tables structurées BigQuery standards, les tables externes sur les données structurées ni les vues BigQuery.
Tarifs
Pendant la phase de Preview publique, les analyses de profilage des données non structurées sont disponibles pour l'expérimentation et les tests selon des conditions promotionnelles spécifiques :
Inférence sémantique : L'utilisation des modèles Gemini Vertex AI pour extraire des informations sémantiques et inférer des profils de graphiques lors des analyses de découverte est sans frais pendant la période d'aperçu.
Coûts des ressources sous-jacentes : Des frais standards s'appliquent pour les ressources nécessaires au stockage et au traitement de vos données :
Knowledge Catalog
Les analyses de découverte sont facturées en fonction des SKU de traitement Knowledge Catalog Premium (heures DCU) pour l'analyse et le regroupement de base des fichiers non structurés. Pour en savoir plus, consultez les tarifs de Knowledge Catalog.
Les aspects de métadonnées générés par IA, y compris les profils de graphiques, entraînent des frais de stockage standards dans Knowledge Catalog.
BigQuery et Dataform
Si vous utilisez la méthode d'extraction de pipeline, les frais standards d'exécution Dataform et des jobs BigQuery s'appliquent.
Si vous utilisez la méthode SQL, les frais BigQuery ML standards (
ML.PROCESS_DOCUMENT) et les frais de traitement des requêtes BigQuery s'appliquent.Toutes les données matérialisées dans BigQuery, y compris les tables d'objets, les métadonnées inférées et les entités extraites, entraînent des frais standards de stockage et de requête BigQuery. Pour en savoir plus, consultez la page Tarifs de BigQuery.
Les structures de facturation officielles dédiées aux analyses de profils de données pour les données non structurées et l'inférence sémantique commenceront à s'appliquer à partir de la disponibilité générale.
Quotas
Les quotas standards de ressources et d'API DataScan s'appliquent à chaque job individuel d'analyse de découverte ou de profilage des données. Un quota spécifique régit le volume d'inférence sémantique : le nombre total d'exécutions quotidiennes d'analyses de profil de données pour les données non structurées dans les tables d'objets BigQuery est limité à 140 exécutions par projet et par jour.
Lorsque le profilage des données non structurées est effectué lors d'une analyse de découverte, les limites du nombre de tables qu'une analyse de découverte peut prendre en charge s'appliquent également. Pour en savoir plus, consultez Quotas et limites de BigQuery.
Étapes suivantes
- Découvrez comment utiliser l'analyse de découverte pour les données non structurées.
- Découvrez comment utiliser le profil de données pour les données non structurées.
- En savoir plus sur la découverte de données
- Consultez À propos du profilage des données.