Créer et utiliser des analyses de profilage des données

Knowledge Catalog (anciennement Dataplex Universal Catalog) vous permet d'identifier les caractéristiques statistiques courantes (valeurs courantes, distribution des données, nombre de valeurs nulles) des colonnes de vos tables BigQuery. Ces informations vous aident à comprendre et à analyser plus efficacement vos données.

Pour en savoir plus sur les analyses de profilage des données Knowledge Catalog, consultez À propos du profilage de données.

Avant de commencer

Activer l'API Dataplex

Rôles requis pour activer les API

Pour activer les API, vous devez disposer de l'autorisation serviceusage.services.enable. Si vous avez créé le projet, vous disposez probablement déjà de cette autorisation grâce au rôle Propriétaire (roles/owner). Sinon, vous pouvez obtenir cette autorisation grâce au rôle Administrateur Service Usage (roles/serviceusage.serviceUsageAdmin). Découvrez comment attribuer des rôles.

Activer l'API

Rôles et autorisations nécessaires

Cette section décrit les rôles et autorisations IAM nécessaires pour utiliser les analyses de profil de données Knowledge Catalog.

Rôles et autorisations des utilisateurs

Pour obtenir les autorisations nécessaires pour créer et gérer des analyses de profils de données, demandez à votre administrateur de vous accorder les rôles IAM suivants :

  • Créer, exécuter, mettre à jour et supprimer des analyses de profil de données : Éditeur Dataplex DataScan (roles/dataplex.dataScanEditor) sur le projet contenant l'analyse de données
  • Afficher les résultats, les jobs et l'historique des analyses de profil de données : Lecteur Dataplex DataScan (roles/dataplex.dataScanViewer) sur le projet contenant l'analyse de données
  • Publier les résultats de l'analyse du profil de données dans Knowledge Catalog : Éditeur Dataplex Catalog (roles/dataplex.catalogEditor) sur le groupe d'entrées @bigquery
  • Affichez les résultats publiés de l'analyse des profils de données dans BigQuery, dans l'onglet Profil de données : Lecteur de données BigQuery (roles/bigquery.dataViewer) sur la table
  • Exécutez des analyses de profilage des données :
  • Exécutez des analyses de profil de données sur les tables externes BigQuery qui utilisent des données Cloud Storage :
  • Exécuter des analyses de profilage des données pour les tables Iceberg REST Catalog, SAP BDC Delta Lake et Apache Hive dans Google Cloud Lakehouse : Lecteur BigLake (roles/biglake.viewer) sur les tables analysées
  • Exporter les résultats d'analyse du profil de données vers une table BigQuery : Éditeur de données BigQuery (roles/bigquery.dataEditor) sur la table

Pour en savoir plus sur l'attribution de rôles, consultez Gérer l'accès aux projets, aux dossiers et aux organisations.

Ces rôles prédéfinis contiennent les autorisations requises pour créer et gérer des analyses de profilage des données. Pour connaître les autorisations exactes requises, développez la section Autorisations requises :

Autorisations requises

Vous devez disposer des autorisations suivantes pour créer et gérer des analyses de profils de données :

  • Créer, exécuter, mettre à jour et supprimer des analyses de profil de données :
    • dataplex.datascans.create sur le projet
    • dataplex.datascans.update sur l'analyse des données
    • dataplex.datascans.delete sur l'analyse des données
    • dataplex.datascans.run sur l'analyse des données
    • dataplex.datascans.get sur l'analyse des données
    • dataplex.datascans.list sur le projet
    • dataplex.dataScanJobs.get sur le job d'analyse de données
    • dataplex.dataScanJobs.list sur l'analyse des données
  • Affichez les résultats, les jobs et l'historique des analyses de profilage de données :
    • dataplex.datascans.getData sur l'analyse des données
    • dataplex.datascans.list sur le projet
    • dataplex.dataScanJobs.get sur le job d'analyse de données
    • dataplex.dataScanJobs.list sur l'analyse des données
  • Publiez les résultats de l'analyse de profilage des données dans Knowledge Catalog :
    • dataplex.entryGroups.useDataProfileAspect sur le groupe d'entrées
    • bigquery.tables.update sur la table
    • dataplex.entries.update à l'entrée
  • Affichez les résultats de profil de données publiés pour une table dans BigQuery ou Knowledge Catalog :
    • bigquery.tables.get sur la table
    • bigquery.tables.getData sur la table

Vous pouvez également obtenir ces autorisations avec des rôles personnalisés ou d'autres rôles prédéfinis.

Rôles et autorisations des comptes de service Knowledge Catalog

Quelle que soit l'identité d'exécution que vous sélectionnez (l'agent de service par défaut de Knowledge Catalog, un compte de service personnalisé ou les identifiants de l'utilisateur final), cette identité nécessite les rôles et autorisations suivants pour exécuter les jobs d'analyse de profilage des données dans le backend et exporter les résultats.

Pour vous assurer que l'identité d'exécution dispose des autorisations nécessaires pour exécuter des analyses de profil de données et exporter les résultats, demandez à votre administrateur d'accorder les rôles IAM suivants à l'identité d'exécution :

  • Exécutez des analyses de profilage des données :
  • Exécutez des analyses de profil de données pour les tables externes BigQuery qui utilisent des données Cloud Storage :
  • Exécuter des analyses de profilage des données pour les tables Iceberg REST Catalog, SAP BDC Delta Lake et Apache Hive dans Google Cloud Lakehouse : Lecteur BigLake (roles/biglake.viewer) sur les tables analysées
  • Exporter les résultats d'analyse du profil de données vers une table BigQuery : Éditeur de données BigQuery (roles/bigquery.dataEditor) sur la table

Pour en savoir plus sur l'attribution de rôles, consultez Gérer l'accès aux projets, aux dossiers et aux organisations.

Ces rôles prédéfinis contiennent les autorisations requises pour exécuter des analyses de profil de données et exporter les résultats. Pour connaître les autorisations exactes requises, développez la section Autorisations requises :

Autorisations requises

Les autorisations suivantes sont requises pour exécuter des analyses de profilage des données et exporter les résultats :

  • Exécutez des analyses de profil de données sur les données BigQuery :
    • bigquery.jobs.create sur le projet
    • bigquery.tables.get sur la table
    • bigquery.tables.getData sur la table
  • Exécutez des analyses de profil de données pour les tables externes BigQuery qui utilisent des données Cloud Storage :
    • storage.buckets.get sur le bucket
    • storage.objects.get sur l'objet
  • Exporter les résultats de l'analyse du profil de données vers une table BigQuery :
    • bigquery.tables.create sur l'ensemble de données
    • bigquery.tables.updateData sur la table

Votre administrateur peut également attribuer à l'identité d'exécution ces autorisations avec des rôles personnalisés ou d'autres rôles prédéfinis.

Si une table utilise la sécurité au niveau des lignes de BigQuery, Knowledge Catalog ne peut analyser que les lignes visibles par le compte de service Knowledge Catalog. Pour permettre à Knowledge Catalog d'analyser toutes les lignes, ajoutez son compte de service à un filtre de ligne où le prédicat est TRUE.

Si une table utilise la sécurité au niveau des colonnes de BigQuery, Knowledge Catalog doit avoir accès aux colonnes protégées pour les analyser. Pour accorder l'accès, attribuez au compte de service Knowledge Catalog le rôle Lecteur détaillé Data Catalog (roles/datacatalog.fineGrainedReader) sur tous les tags avec stratégie utilisés dans le tableau. Un utilisateur qui crée ou met à jour une analyse des données doit également disposer des autorisations sur les colonnes protégées.

Attribuer des rôles au compte de service Knowledge Catalog

Pour exécuter des analyses de profilage des données, Knowledge Catalog utilise un compte de service qui nécessite des autorisations pour exécuter des jobs BigQuery et lire les données des table BigQuery. Pour attribuer les rôles requis, procédez comme suit :

  1. Récupérez l'adresse e-mail du compte de service Knowledge Catalog. Si vous n'avez jamais créé d'analyse de profilage des données ni d'analyse de la qualité des données dans ce projet, exécutez la commande gcloud suivante pour générer l'identité de service :

    gcloud beta services identity create --service=dataplex.googleapis.com
    

    La commande renvoie l'adresse e-mail du compte de service, qui se présente au format suivant : service-PROJECT_ID@gcp-sa-dataplex.iam.gserviceaccount.com.

    Si le compte de service existe déjà, vous pouvez trouver son adresse e-mail en affichant les comptes principaux portant le nom Dataplex sur la page IAM de la consoleGoogle Cloud .

  2. Attribuez au compte de service le rôle Utilisateur de job BigQuery (roles/bigquery.jobUser) dans votre projet. Ce rôle permet au compte de service d'exécuter des jobs BigQuery pour l'analyse.

    gcloud projects add-iam-policy-binding PROJECT_ID \
        --member="serviceAccount:service-PROJECT_NUMBER@gcp-sa-dataplex.iam.gserviceaccount.com" \
        --role="roles/bigquery.jobUser"
    

    Remplacez les éléments suivants :

    • PROJECT_ID : ID de votre projet Google Cloud .
    • service-PROJECT_NUMBER@gcp-sa-dataplex.iam.gserviceaccount.com : adresse e-mail du compte de service du Knowledge Catalog.
  3. Attribuez au compte de service le rôle Lecteur de données BigQuery (roles/bigquery.dataViewer) pour chaque table que vous souhaitez profiler. Ce rôle accorde un accès en lecture seule aux tables.

    gcloud bigquery tables add-iam-policy-binding DATASET_ID.TABLE_ID \
        --member="serviceAccount:service-PROJECT_NUMBER@gcp-sa-dataplex.iam.gserviceaccount.com" \
        --role="roles/bigquery.dataViewer"
    

    Remplacez les éléments suivants :

    • DATASET_ID : ID de l'ensemble de données contenant la table.
    • TABLE_ID : ID de la table à profiler.
    • service-PROJECT_NUMBER@gcp-sa-dataplex.iam.gserviceaccount.com : adresse e-mail du compte de service du Knowledge Catalog.

Exigences de mise en réseau

Pour exécuter une analyse, vous devez activer l'accès privé à Google sur le sous-réseau VPC que vous utilisez pour l'analyse. Si vous ne spécifiez pas de sous-réseau, assurez-vous que l'accès privé à Google est activé sur votre sous-réseau par défaut.

Configurer l'identité d'exécution

Par défaut, les analyses de profilage des données s'exécutent à l'aide de l'agent de service Knowledge Catalog. Vous pouvez remplacer ce paramètre pour utiliser un compte de service personnalisé ou vos propres identifiants utilisateur finaux.

L'utilisation d'une identité d'exécution personnalisée modifie la façon dont l'analyse vous est facturée. Lorsque vous spécifiez une identité d'exécution personnalisée, les coûts de calcul et de stockage associés à l'analyse sont facturés directement à votre projet BigQuery, en contournant les SKU Premium standards de Knowledge Catalog.

Autorisations requises pour les identités d'exécution personnalisées

Pour configurer un compte de service personnalisé ou utiliser des identifiants d'utilisateur final, vous devez disposer des autorisations IAM supplémentaires suivantes :

  • Pour utiliser un compte de service personnalisé, vous devez disposer des autorisations suivantes :
    • Autorisation iam.serviceAccounts.actAs accordée pour le projet contenant le compte de service (par exemple, roles/iam.serviceAccountUser).
    • L'agent de service de votre projet (service-PROJECT_NUMBER@gcp-sa-dataplex.iam.gserviceaccount.com) doit disposer de l'autorisation iam.serviceAccounts.getAccessToken sur le compte de service personnalisé (par exemple, en ayant le rôle roles/iam.serviceAccountTokenCreator).
    • Le compte de service personnalisé doit disposer de bigquery.tables.getData sur la table à analyser, de bigquery.jobs.insert dans le projet d'analyse et de bigquery.dataEditor sur l'ensemble de données d'exportation (si vous utilisez l'exportation).
  • Pour utiliser les identifiants de l'utilisateur final, vous avez besoin des éléments suivants :
    • bigquery.tables.getData sur la table à analyser.
    • bigquery.jobs.insert dans le projet d'analyse.
    • bigquery.dataEditor sur l'ensemble de données à exporter (si vous utilisez l'exportation).

Pour configurer l'identité d'exécution, sélectionnez l'une des options suivantes :

Console

Pour configurer l'identité d'exécution dans la console Google Cloud , sélectionnez l'identité lorsque vous créez votre analyse de profil de données.

Dans la section Identité d'exécution, sélectionnez l'une des options suivantes :

  • Compte de service Dataplex : comportement par défaut.
  • Compte de service spécifique : saisissez l'adresse e-mail du compte de service que vous souhaitez utiliser.
  • Identifiants utilisateur : utilisez vos propres identifiants pour exécuter l'analyse.

REST

Pour utiliser un compte de service personnalisé, ajoutez l'objet executionIdentity à la définition de ressource DataScan lors de la requête create :

"executionIdentity": {
  "serviceAccount": {
     "email": "YOUR_SERVICE_ACCOUNT_EMAIL"
  }
}
  

Remplacez les éléments suivants :

  • YOUR_SERVICE_ACCOUNT_EMAIL : adresse e-mail du compte de service que vous souhaitez utiliser.

Pour utiliser les identifiants de l'utilisateur final, spécifiez plutôt l'objet userCredential :

"executionIdentity": {
  "userCredential": {}
}
  

Créer une analyse de profilage de données

Console

  1. Dans la console Google Cloud , accédez à la page Qualité et profilage des données de Knowledge Catalog.

    Accéder à la page "Qualité et profilage des données"

  2. Cliquez sur Créer une analyse de profilage de données.

  3. Facultatif : Saisissez un nom à afficher.

  4. Saisissez un ID. Consultez les conventions d'attribution de noms pour les ressources.

  5. Facultatif : saisissez une description.

  6. Dans le champ Table, cliquez sur Parcourir. Choisissez la table à analyser, puis cliquez sur Sélectionner. Seules les tables BigQuery standards, Iceberg REST Catalog, SAP BDC Delta Lake et Apache Hive sur Google CloudLakehouse sont acceptées.

    Pour les tables des ensembles de données multirégionaux, choisissez une région dans laquelle créer l'analyse de données.

    Pour parcourir les tables organisées dans les lacs Knowledge Catalog, cliquez sur Parcourir les lacs Knowledge Catalog.

  7. Dans la section Mode, sélectionnez l'une des options suivantes :

    • Standard : profile vos données avec des paramètres d'analyse personnalisables. Il s'agit du mode par défaut.

    • Léger : fournit des insights rapides grâce à une analyse à faible latence et à faible fidélité.

  8. Si vous avez choisi le mode Standard, configurez les options suivantes. Ces options n'apparaissent pas lorsque vous sélectionnez le mode Léger.

    1. Dans le champ Champ d'application, sélectionnez Incrémentiel ou Intégralité des données.

      Si vous choisissez des données incrémentielles, sélectionnez pour le champ Colonne de code temporel une colonne de votre table BigQuery (de type DATE ou TIMESTAMP). Le catalogue de connaissances utilise cette colonne pour identifier les nouveaux enregistrements à mesure qu'ils sont ajoutés. Pour les tables partitionnées sur une colonne de type DATE ou TIMESTAMP, il est recommandé d'utiliser cette colonne comme colonne de partition.

    2. Facultatif : Pour filtrer vos données, effectuez l'une des opérations suivantes :

      • Pour filtrer par ligne, cochez la case Filtrer les lignes. Saisissez une expression SQL valide pouvant être utilisée dans une clause WHERE en syntaxe GoogleSQL. Exemple : col1 >= 0.

        Le filtre peut être une combinaison de conditions SQL sur plusieurs colonnes. Exemple : col1 >= 0 AND col2 < 10.

      • Pour filtrer par colonne, cochez la case Filtrer les colonnes.

      • Pour inclure des colonnes dans l'analyse de profilage, cliquez sur Parcourir dans le champ Inclure des colonnes. Sélectionnez les colonnes à inclure, puis cliquez sur Sélectionner.

      • Pour exclure des colonnes de l'analyse de profilage, dans le champ Exclure des colonnes, cliquez sur Parcourir. Sélectionnez les colonnes à exclure, puis cliquez sur Sélectionner.

    3. Pour appliquer l'échantillonnage à l'analyse de profilage des données, sélectionnez un pourcentage d'échantillonnage dans la liste Taille d'échantillonnage. Choisissez un pourcentage compris entre 0 et 100 %, avec un maximum de trois chiffres après la virgule.

      • Pour les ensembles de données plus volumineux, choisissez un pourcentage d'échantillonnage plus faible. Par exemple, pour une table de 1 Po, si vous saisissez une valeur comprise entre 0,1 et 1 %, le profil de données échantillonne entre 1 et 10 To de données.

      • Vous devez disposer d'au moins 100 enregistrements dans les données échantillonnées pour obtenir un résultat.

      • Pour les analyses de données incrémentielles, l'analyse de profilage des données applique l'échantillonnage au dernier incrément.

  9. Facultatif : Publiez les résultats de l'analyse de profilage des données sur les pages BigQuery et Knowledge Catalog de laGoogle Cloud console pour la table source. Cochez la case Publier les résultats dans Knowledge Catalog.

    Vous pouvez consulter les derniers résultats d'analyse dans l'onglet Profil de données des pages BigQuery et Knowledge Catalog pour la table source. Pour permettre aux utilisateurs d'accéder aux résultats d'analyse publiés, consultez la section Accorder l'accès aux résultats d'analyse de profilage de données de ce document.

    L'option de publication peut ne pas être disponible dans les cas suivants :

    • Vous ne disposez pas des autorisations requises pour cette table.
    • Une autre analyse de profil de données est configurée pour publier les résultats.
  10. Dans la section Planification, choisissez l'une des options suivantes :

    • Répétition : exécutez l'analyse de profilage des données selon une planification horaire, quotidienne, hebdomadaire, mensuelle ou personnalisée. Spécifiez la fréquence et l'heure d'exécution de l'analyse. Si vous choisissez "Personnalisée", utilisez le format cron pour spécifier la planification.

    • À la demande : exécutez l'analyse de profilage des données à la demande.

    • Exécution unique : exécutez l'analyse de profilage des données une seule fois maintenant, puis supprimez-la après le délai de suppression automatique. Cette fonctionnalité est disponible en version preview.

      • Définir la suppression automatique des résultats d'analyse : la durée de suppression automatique définit la durée pendant laquelle une analyse de profil de données reste active après son exécution. Une analyse de profil de données sans heure de suppression automatique spécifiée est automatiquement supprimée au bout de 24 heures. La durée de suppression automatique peut aller de 0 seconde (suppression immédiate) à 365 jours.
  11. Cliquez sur Continuer.

  12. Facultatif : exportez les résultats de l'analyse vers une table BigQuery standard. Dans la section Exporter les résultats d'analyse dans une table BigQuery, procédez comme suit :

    1. Dans le champ Sélectionnez un ensemble de données BigQuery, cliquez sur Parcourir. Sélectionnez un ensemble de données BigQuery dans lequel stocker les résultats de l'analyse de profilage des données.

    2. Dans le champ Table BigQuery, spécifiez la table dans laquelle stocker les résultats de l'analyse de profilage des données. Si vous utilisez une table existante, assurez-vous qu'elle est compatible avec le schéma de la table d'exportation. Si la table spécifiée n'existe pas, Knowledge Catalog la crée pour vous.

  13. Facultatif : Ajoutez des étiquettes. Les étiquettes sont des paires clé/valeur qui vous permettent de regrouper des objets associés ou de les combiner à d'autres Google Cloud ressources.

  14. Pour créer l'analyse, cliquez sur Créer.

    Si vous définissez la planification sur "À la demande", vous pouvez également exécuter l'analyse maintenant en cliquant sur Exécuter l'analyse.

gcloud

Pour créer une analyse de profilage des données, utilisez la commande gcloud dataplex datascans create data-profile.

Si les données source sont organisées dans un lac Knowledge Catalog, incluez le flag --data-source-entity :

gcloud dataplex datascans create data-profile DATASCAN \
--location=LOCATION \
--data-source-entity=DATA_SOURCE_ENTITY

Si les données source ne sont pas organisées dans un lac Knowledge Catalog, incluez le flag --data-source-resource :

gcloud dataplex datascans create data-profile DATASCAN \
--location=LOCATION \
--data-source-resource=DATA_SOURCE_RESOURCE

Remplacez les variables suivantes :

  • DATASCAN : nom de l'analyse de profilage des données.
  • LOCATION : Google Cloud région dans laquelle créer l'analyse de profilage des données.
  • DATA_SOURCE_ENTITY : entité Knowledge Catalog contenant les données pour l'analyse de profilage des données. Exemple : projects/test-project/locations/test-location/lakes/test-lake/zones/test-zone/entities/test-entity.
  • DATA_SOURCE_RESOURCE : nom de la ressource contenant les données pour l'analyse de profilage des données. Exemple : //bigquery.googleapis.com/projects/test-project/datasets/test-dataset/tables/test-table.

C#

C#

Avant d'essayer cet exemple, suivez les instructions de configuration pour C# du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour C#.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.

using Google.Api.Gax.ResourceNames;
using Google.Cloud.Dataplex.V1;
using Google.LongRunning;

public sealed partial class GeneratedDataScanServiceClientSnippets
{
    /// <summary>Snippet for CreateDataScan</summary>
    /// <remarks>
    /// This snippet has been automatically generated and should be regarded as a code template only.
    /// It will require modifications to work:
    /// - It may require correct/in-range values for request initialization.
    /// - It may require specifying regional endpoints when creating the service client as shown in
    ///   https://cloud.google.com/dotnet/docs/reference/help/client-configuration#endpoint.
    /// </remarks>
    public void CreateDataScanRequestObject()
    {
        // Create client
        DataScanServiceClient dataScanServiceClient = DataScanServiceClient.Create();
        // Initialize request argument(s)
        CreateDataScanRequest request = new CreateDataScanRequest
        {
            ParentAsLocationName = LocationName.FromProjectLocation("[PROJECT]", "[LOCATION]"),
            DataScan = new DataScan(),
            DataScanId = "",
            ValidateOnly = false,
        };
        // Make the request
        Operation<DataScan, OperationMetadata> response = dataScanServiceClient.CreateDataScan(request);

        // Poll until the returned long-running operation is complete
        Operation<DataScan, OperationMetadata> completedResponse = response.PollUntilCompleted();
        // Retrieve the operation result
        DataScan result = completedResponse.Result;

        // Or get the name of the operation
        string operationName = response.Name;
        // This name can be stored, then the long-running operation retrieved later by name
        Operation<DataScan, OperationMetadata> retrievedResponse = dataScanServiceClient.PollOnceCreateDataScan(operationName);
        // Check if the retrieved long-running operation has completed
        if (retrievedResponse.IsCompleted)
        {
            // If it has completed, then access the result
            DataScan retrievedResult = retrievedResponse.Result;
        }
    }
}

Go

Go

Avant d'essayer cet exemple, suivez les instructions de configuration pour Go du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Go.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.


//go:build examples

package main

import (
	"context"

	dataplex "cloud.google.com/go/dataplex/apiv1"
	dataplexpb "cloud.google.com/go/dataplex/apiv1/dataplexpb"
)

func main() {
	ctx := context.Background()
	// This snippet has been automatically generated and should be regarded as a code template only.
	// It will require modifications to work:
	// - It may require correct/in-range values for request initialization.
	// - It may require specifying regional endpoints when creating the service client as shown in:
	//   https://pkg.go.dev/cloud.google.com/go#hdr-Client_Options
	c, err := dataplex.NewDataScanClient(ctx)
	if err != nil {
		// TODO: Handle error.
	}
	defer c.Close()

	req := &dataplexpb.CreateDataScanRequest{
		// TODO: Fill request struct fields.
		// See https://pkg.go.dev/cloud.google.com/go/dataplex/apiv1/dataplexpb#CreateDataScanRequest.
	}
	op, err := c.CreateDataScan(ctx, req)
	if err != nil {
		// TODO: Handle error.
	}

	resp, err := op.Wait(ctx)
	if err != nil {
		// TODO: Handle error.
	}
	// TODO: Use resp.
	_ = resp
}

Java

Java

Avant d'essayer cet exemple, suivez les instructions de configuration pour Java du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Java.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.

import com.google.cloud.dataplex.v1.CreateDataScanRequest;
import com.google.cloud.dataplex.v1.DataScan;
import com.google.cloud.dataplex.v1.DataScanServiceClient;
import com.google.cloud.dataplex.v1.LocationName;

public class SyncCreateDataScan {

  public static void main(String[] args) throws Exception {
    syncCreateDataScan();
  }

  public static void syncCreateDataScan() throws Exception {
    // This snippet has been automatically generated and should be regarded as a code template only.
    // It will require modifications to work:
    // - It may require correct/in-range values for request initialization.
    // - It may require specifying regional endpoints when creating the service client as shown in
    // https://cloud.google.com/java/docs/setup#configure_endpoints_for_the_client_library
    try (DataScanServiceClient dataScanServiceClient = DataScanServiceClient.create()) {
      CreateDataScanRequest request =
          CreateDataScanRequest.newBuilder()
              .setParent(LocationName.of("[PROJECT]", "[LOCATION]").toString())
              .setDataScan(DataScan.newBuilder().build())
              .setDataScanId("dataScanId1260787906")
              .setValidateOnly(true)
              .build();
      DataScan response = dataScanServiceClient.createDataScanAsync(request).get();
    }
  }
}

Python

Python

Avant d'essayer cet exemple, suivez les instructions de configuration pour Python du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Python.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.

# Copyright 2026 Google LLC
#
# Licensed under the Apache License, Version 2.0 (the "License");
# you may not use this file except in compliance with the License.
# You may obtain a copy of the License at
#
#      http://www.apache.org/licenses/LICENSE-2.0
#
# Unless required by applicable law or agreed to in writing, software
# distributed under the License is distributed on an "AS IS" BASIS,
# WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied.
# See the License for the specific language governing permissions and
# limitations under the License.

import google.api_core.exceptions
from google.cloud import dataplex_v1


def create_data_profile_scan_global(
    project_id: str,
    dataset_id: str,
    table_id: str,
    location: str,
) -> None:
    """Creates a Dataplex Data Profile Scan using global API endpoint routing.

    Args:
        project_id (str): Google Cloud project ID where the scan is created.
        dataset_id (str): Target BigQuery dataset ID.
        table_id (str): Target BigQuery table ID to scan.
        location (str): Google Cloud region where serverless compute runs.
    """
    client = dataplex_v1.DataScanServiceClient()

    parent = client.common_location_path(project=project_id, location=location)

    bigquery_table = (
        f"//bigquery.googleapis.com/projects/{project_id}"
        f"/datasets/{dataset_id}/tables/{table_id}"
    )

    data_profile_spec = dataplex_v1.DataProfileSpec(sampling_percent=100.0)

    data_scan = dataplex_v1.DataScan(
        display_name="Global Data Profile Scan",
        description="Regional data profile scan generating automated table statistics.",
        data=dataplex_v1.DataSource(resource=bigquery_table),
        data_profile_spec=data_profile_spec,
    )

    request = dataplex_v1.CreateDataScanRequest(
        parent=parent,
        data_scan=data_scan,
    )

    try:
        operation = client.create_data_scan(request=request)
        print(operation.result())

    except google.api_core.exceptions.AlreadyExists:
        print("A scan with this ID already exists.")
    except google.api_core.exceptions.InvalidArgument as e:
        print(f"Your scan configuration is invalid: {e}")
    except google.api_core.exceptions.GoogleAPIError as e:
        print(f"Unexpected exception: {e}")


Ruby

Ruby

Avant d'essayer cet exemple, suivez les instructions de configuration pour Ruby du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Ruby.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.

require "google/cloud/dataplex/v1"

##
# Snippet for the create_data_scan call in the DataScanService service
#
# This snippet has been automatically generated and should be regarded as a code
# template only. It will require modifications to work:
# - It may require correct/in-range values for request initialization.
# - It may require specifying regional endpoints when creating the service
# client as shown in https://cloud.google.com/ruby/docs/reference.
#
# This is an auto-generated example demonstrating basic usage of
# Google::Cloud::Dataplex::V1::DataScanService::Client#create_data_scan.
#
def create_data_scan
  # Create a client object. The client can be reused for multiple calls.
  client = Google::Cloud::Dataplex::V1::DataScanService::Client.new

  # Create a request. To set request fields, pass in keyword arguments.
  request = Google::Cloud::Dataplex::V1::CreateDataScanRequest.new

  # Call the create_data_scan method.
  result = client.create_data_scan request

  # The returned object is of type Gapic::Operation. You can use it to
  # check the status of an operation, cancel it, or wait for results.
  # Here is how to wait for a response.
  result.wait_until_done! timeout: 60
  if result.response?
    p result.response
  else
    puts "No response received."
  end
end

REST

Pour créer une analyse de profilage de données, utilisez la méthode dataScans.create.

Exporter le schéma de table

Si vous souhaitez exporter les résultats de l'analyse de profilage des données vers une table BigQuery existante, assurez-vous qu'elle est compatible avec le schéma de table suivant :

Nom de la colonne Type de données de la colonne Nom du sous-champ (le cas échéant) Type de données du sous-champ Mode Exemple
data_profile_scan struct/record resource_name string nullable //dataplex.googleapis.com/projects/test-project/locations/europe-west2/datascans/test-datascan
project_id string nullable test-project
location string nullable us-central1
data_scan_id string nullable test-datascan
data_source struct/record resource_name string nullable

Cas d'entité : //dataplex.googleapis.com/projects/test-project/locations/europe-west2/lakes/test-lake/zones/test-zone/entities/test-entity

Cas de table : //bigquery.googleapis.com/projects/test-project/datasets/test-dataset/tables/test-table

dataplex_entity_project_id string nullable test-project
dataplex_entity_project_number integer nullable 123456789012
dataplex_lake_id string nullable

(Valide uniquement si la source est une entité)

test-lake

dataplex_zone_id string nullable

(Valide uniquement si la source est une entité)

test-zone

dataplex_entity_id string nullable

(Valide uniquement si la source est une entité)

test-entity

table_project_id string nullable dataplex-table
table_project_number int64 nullable 345678901234
dataset_id string nullable

(Valide uniquement si la source est une table)

test-dataset

table_id string nullable

(Valide uniquement si la source est une table)

test-table

data_profile_job_id string nullable caeba234-cfde-4fca-9e5b-fe02a9812e38
data_profile_job_configuration json trigger string nullable ondemand/schedule
incremental boolean nullable true/false
sampling_percent float nullable

(0-100)

20.0 (indique 20 %)

row_filter string nullable col1 >= 0 AND col2 < 10
column_filter json nullable {"include_fields":["col1","col2"], "exclude_fields":["col3"]}
job_labels json nullable {"key1":value1}
job_start_time timestamp nullable 2023-01-01 00:00:00 UTC
job_end_time timestamp nullable 2023-01-01 00:00:00 UTC
job_rows_scanned integer nullable 7500
column_name string nullable column-1
column_type string nullable string
column_mode string nullable repeated
percent_null float nullable

(0.0-100.0)

20.0 (indique 20 %)

percent_unique float nullable

(0.0-100.0)

92.5

min_string_length integer nullable

(Valide uniquement si le type de colonne est une chaîne)

10

max_string_length integer nullable

(Valide uniquement si le type de colonne est une chaîne)

4

average_string_length float nullable

(Valide uniquement si le type de colonne est une chaîne)

7.2

min_value float nullable (Valable uniquement si le type de colonne est numérique : entier/nombre à virgule flottante)
max_value float nullable (Valable uniquement si le type de colonne est numérique : entier/nombre à virgule flottante)
average_value float nullable (Valable uniquement si le type de colonne est numérique : entier/nombre à virgule flottante)
standard_deviation float nullable (Valable uniquement si le type de colonne est numérique : entier/nombre à virgule flottante)
quartile_lower integer nullable (Valable uniquement si le type de colonne est numérique : entier/nombre à virgule flottante)
quartile_median integer nullable (Valable uniquement si le type de colonne est numérique : entier/nombre à virgule flottante)
quartile_upper integer nullable (Valable uniquement si le type de colonne est numérique : entier/nombre à virgule flottante)
top_n struct/record - repeated value string nullable "4009"
count integer nullable 20
percent float nullable 10 (indique 10 %)

Configuration de l'exportation vers une table

Lorsque vous exportez des données vers des tables BigQueryExport, suivez ces consignes :

  • Pour le champ resultsTable, utilisez le format suivant : //bigquery.googleapis.com/projects/{project-id}/datasets/{dataset-id}/tables/{table-id}.
  • Utilisez une table BigQuery standard.
  • Si la table n'existe pas lorsque l'analyse est créée ou mise à jour, Knowledge Catalog la crée pour vous.
  • Par défaut, la table est partitionnée quotidiennement sur la colonne job_start_time.
  • Si vous souhaitez que la table soit partitionnée selon d'autres configurations ou si vous ne voulez pas la partition, recréez la table avec le schéma et les configurations requis, puis fournissez la table préalablement créée en tant que table de résultats.
  • Assurez-vous que la table de résultats se trouve au même emplacement que la table source.
  • Si VPC-SC est configuré dans le projet, la table de résultats doit se trouver dans le même périmètre VPC-SC que la table source.
  • Si la table est modifiée lors de l'étape d'exécution de l'analyse, le job en cours d'exécution est exporté vers la table de résultats précédente et la modification de la table prend effet à partir du prochain job d'analyse.
  • Ne modifiez pas le schéma de table. Si vous avez besoin de colonnes personnalisées, créez une vue sur la table.
  • Pour réduire les coûts, définissez un délai d'expiration pour la partition en fonction de votre cas d'utilisation. Pour en savoir plus, découvrez comment définir le délai d'expiration de la partition.

Créer plusieurs analyses de profilage des données

Vous pouvez configurer des analyses de profilage de données pour plusieurs tables d'un ensemble de données BigQuery en même temps à l'aide de la console Google Cloud .

  1. Dans la console Google Cloud , accédez à la page Qualité et profilage des données de Knowledge Catalog.

    Accéder à la page "Qualité et profilage des données"

  2. Cliquez sur Créer une analyse de profilage de données.

  3. Sélectionnez l'option Plusieurs analyses de profilage des données.

  4. Saisissez un préfixe d'ID. Knowledge Catalog génère automatiquement des ID d'analyse en utilisant le préfixe fourni et des suffixes uniques.

  5. Saisissez une Description pour toutes les analyses de profilage des données.

  6. Dans le champ Ensemble de données, cliquez sur Parcourir. Sélectionnez un ensemble de données dans lequel choisir des tables. Cliquez sur Sélectionner.

  7. Si l'ensemble de données est multirégional, sélectionnez une région dans laquelle créer les analyses de profilage des données.

  8. Dans la section Mode, choisissez l'une des options suivantes :

    • Standard : profile vos données avec des paramètres d'analyse personnalisables. Il s'agit du mode par défaut.

    • Léger : fournit des insights rapides grâce à une analyse à faible latence et à faible fidélité. Cette fonctionnalité est disponible en version bêta.

  9. Si vous avez choisi le mode Standard, configurez les paramètres suivants pour les analyses. Ces paramètres ne s'affichent pas lorsque le mode Simplifié est sélectionné.

    1. Dans le champ Champ d'application, sélectionnez Incrémentiel ou Intégralité des données.

      Si vous choisissez des données incrémentielles, vous pouvez uniquement sélectionner les tables partitionnées sur une colonne de type DATE ou TIMESTAMP.

    2. Pour appliquer l'échantillonnage aux analyses de profilage des données, sélectionnez un pourcentage d'échantillonnage dans la liste Taille d'échantillonnage.

      Choisissez un pourcentage compris entre 0 et 100 %, avec un maximum de trois chiffres après la virgule.

  10. Facultatif : Publiez les résultats de l'analyse de profilage des données sur les pages BigQuery et Knowledge Catalog de laGoogle Cloud console pour la table source. Cochez la case Publier les résultats dans Knowledge Catalog.

    Vous pouvez consulter les derniers résultats d'analyse dans l'onglet Profil de données des pages BigQuery et Knowledge Catalog pour la table source. Pour permettre aux utilisateurs d'accéder aux résultats d'analyse publiés, consultez la section Accorder l'accès aux résultats d'analyse de profilage de données de ce document.

  11. Dans la section Planification, choisissez l'une des options suivantes :

    • Répétition : exécutez l'analyse de profilage des données selon une planification horaire, quotidienne, hebdomadaire, mensuelle ou personnalisée. Spécifiez la fréquence et l'heure d'exécution des analyses. Si vous choisissez "Personnalisée", utilisez le format cron pour spécifier la planification.

    • À la demande : exécutez les analyses de profilage des données à la demande.

      • Exécution unique : exécutez l'analyse de profilage des données une seule fois maintenant, puis supprimez-la après le délai de suppression automatique. Cette fonctionnalité est disponible en version preview.

        • Définissez la suppression automatique des résultats d'analyse : le délai de suppression automatique définit la durée pendant laquelle une analyse du profil de données reste active après son exécution. Une analyse de profil de données sans délai de suppression automatique spécifié est automatiquement supprimée au bout de 24 heures. La durée de suppression automatique peut aller de 0 seconde (suppression immédiate) à 365 jours.
  12. Cliquez sur Continuer.

  13. Pour l'option Choisir des tables, cliquez sur Parcourir. Choisissez une ou plusieurs tables à analyser, puis cliquez sur Sélectionner.

  14. Cliquez sur Continuer.

  15. Facultatif : exportez les résultats de l'analyse vers une table BigQuery standard. Dans la section Exporter les résultats d'analyse dans une table BigQuery, procédez comme suit :

    1. Dans le champ Sélectionnez un ensemble de données BigQuery, cliquez sur Parcourir. Sélectionnez un ensemble de données BigQuery dans lequel stocker les résultats de l'analyse de profilage des données.

    2. Dans le champ Table BigQuery, spécifiez la table dans laquelle stocker les résultats de l'analyse de profilage des données. Si vous utilisez une table existante, assurez-vous qu'elle est compatible avec le schéma de la table d'exportation. Si la table spécifiée n'existe pas, Knowledge Catalog la crée pour vous.

      Knowledge Catalog utilise la même table de résultats pour toutes les analyses de profilage des données.

  16. Facultatif : Ajoutez des étiquettes. Les étiquettes sont des paires clé/valeur qui vous permettent de regrouper des objets associés ou de les combiner à d'autres ressources Google Cloud .

  17. Pour créer les analyses, cliquez sur Créer.

    Si vous définissez la planification sur "À la demande", vous pouvez également exécuter les analyses maintenant en cliquant sur Exécuter l'analyse.

Exécuter une analyse de profilage des données

Console

  1. Dans la console Google Cloud , accédez à la page Qualité et profilage des données de Knowledge Catalog.

    Accéder à la page "Qualité et profilage des données"

  2. Cliquez sur l'analyse de profilage des données à exécuter.
  3. Cliquez sur Exécuter maintenant.

gcloud

Pour exécuter une analyse de profilage des données, utilisez la commande gcloud dataplex datascans run :

gcloud dataplex datascans run DATASCAN \
--location=LOCATION

Remplacez les variables suivantes :

  • DATASCAN : nom de l'analyse de profilage des données.
  • LOCATION : Google Cloud région dans laquelle l'analyse de profilage des données a été créée.

C#

C#

Avant d'essayer cet exemple, suivez les instructions de configuration pour C# du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour C#.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.

using Google.Cloud.Dataplex.V1;

public sealed partial class GeneratedDataScanServiceClientSnippets
{
    /// <summary>Snippet for RunDataScan</summary>
    /// <remarks>
    /// This snippet has been automatically generated and should be regarded as a code template only.
    /// It will require modifications to work:
    /// - It may require correct/in-range values for request initialization.
    /// - It may require specifying regional endpoints when creating the service client as shown in
    ///   https://cloud.google.com/dotnet/docs/reference/help/client-configuration#endpoint.
    /// </remarks>
    public void RunDataScanRequestObject()
    {
        // Create client
        DataScanServiceClient dataScanServiceClient = DataScanServiceClient.Create();
        // Initialize request argument(s)
        RunDataScanRequest request = new RunDataScanRequest
        {
            DataScanName = DataScanName.FromProjectLocationDataScan("[PROJECT]", "[LOCATION]", "[DATASCAN]"),
        };
        // Make the request
        RunDataScanResponse response = dataScanServiceClient.RunDataScan(request);
    }
}

Go

Go

Avant d'essayer cet exemple, suivez les instructions de configuration pour Go du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Go.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.


//go:build examples

package main

import (
	"context"

	dataplex "cloud.google.com/go/dataplex/apiv1"
	dataplexpb "cloud.google.com/go/dataplex/apiv1/dataplexpb"
)

func main() {
	ctx := context.Background()
	// This snippet has been automatically generated and should be regarded as a code template only.
	// It will require modifications to work:
	// - It may require correct/in-range values for request initialization.
	// - It may require specifying regional endpoints when creating the service client as shown in:
	//   https://pkg.go.dev/cloud.google.com/go#hdr-Client_Options
	c, err := dataplex.NewDataScanClient(ctx)
	if err != nil {
		// TODO: Handle error.
	}
	defer c.Close()

	req := &dataplexpb.RunDataScanRequest{
		// TODO: Fill request struct fields.
		// See https://pkg.go.dev/cloud.google.com/go/dataplex/apiv1/dataplexpb#RunDataScanRequest.
	}
	resp, err := c.RunDataScan(ctx, req)
	if err != nil {
		// TODO: Handle error.
	}
	// TODO: Use resp.
	_ = resp
}

Java

Java

Avant d'essayer cet exemple, suivez les instructions de configuration pour Java du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Java.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.

import com.google.cloud.dataplex.v1.DataScanName;
import com.google.cloud.dataplex.v1.DataScanServiceClient;
import com.google.cloud.dataplex.v1.RunDataScanRequest;
import com.google.cloud.dataplex.v1.RunDataScanResponse;

public class SyncRunDataScan {

  public static void main(String[] args) throws Exception {
    syncRunDataScan();
  }

  public static void syncRunDataScan() throws Exception {
    // This snippet has been automatically generated and should be regarded as a code template only.
    // It will require modifications to work:
    // - It may require correct/in-range values for request initialization.
    // - It may require specifying regional endpoints when creating the service client as shown in
    // https://cloud.google.com/java/docs/setup#configure_endpoints_for_the_client_library
    try (DataScanServiceClient dataScanServiceClient = DataScanServiceClient.create()) {
      RunDataScanRequest request =
          RunDataScanRequest.newBuilder()
              .setName(DataScanName.of("[PROJECT]", "[LOCATION]", "[DATASCAN]").toString())
              .build();
      RunDataScanResponse response = dataScanServiceClient.runDataScan(request);
    }
  }
}

Python

Python

Avant d'essayer cet exemple, suivez les instructions de configuration pour Python du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Python.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.

# This snippet has been automatically generated and should be regarded as a
# code template only.
# It will require modifications to work:
# - It may require correct/in-range values for request initialization.
# - It may require specifying regional endpoints when creating the service
#   client as shown in:
#   https://googleapis.dev/python/google-api-core/latest/client_options.html
from google.cloud import dataplex_v1


def sample_run_data_scan():
    # Create a client
    client = dataplex_v1.DataScanServiceClient()

    # Initialize request argument(s)
    request = dataplex_v1.RunDataScanRequest(
        name="name_value",
    )

    # Make the request
    response = client.run_data_scan(request=request)

    # Handle the response
    print(response)

Ruby

Ruby

Avant d'essayer cet exemple, suivez les instructions de configuration pour Ruby du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Ruby.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.

require "google/cloud/dataplex/v1"

##
# Snippet for the run_data_scan call in the DataScanService service
#
# This snippet has been automatically generated and should be regarded as a code
# template only. It will require modifications to work:
# - It may require correct/in-range values for request initialization.
# - It may require specifying regional endpoints when creating the service
# client as shown in https://cloud.google.com/ruby/docs/reference.
#
# This is an auto-generated example demonstrating basic usage of
# Google::Cloud::Dataplex::V1::DataScanService::Client#run_data_scan.
#
def run_data_scan
  # Create a client object. The client can be reused for multiple calls.
  client = Google::Cloud::Dataplex::V1::DataScanService::Client.new

  # Create a request. To set request fields, pass in keyword arguments.
  request = Google::Cloud::Dataplex::V1::RunDataScanRequest.new

  # Call the run_data_scan method.
  result = client.run_data_scan request

  # The returned object is of type Google::Cloud::Dataplex::V1::RunDataScanResponse.
  p result
end

REST

Pour exécuter une analyse de profilage des données, utilisez la méthode dataScans.run.

Airflow

Pour exécuter une analyse de profil de données à l'aide d'un graphe orienté acyclique (DAG) dans Managed Service pour Apache Airflow (Cloud Composer), utilisez DataplexRunDataProfileScanOperator :

from datetime import datetime
from airflow import DAG
from airflow.providers.google.cloud.operators.dataplex import DataplexRunDataProfileScanOperator

with DAG(
  "dataplex_data_profile_scan",
  start_date=datetime(2026, 1, 1),
  schedule_interval="@daily",
  catchup=False,
) as dag:

  run_profile_scan = DataplexRunDataProfileScanOperator(
      task_id="run_dataplex_profile_scan",
      project_id="PROJECT_ID",
      region="REGION",
      data_scan_id="DATASCAN_ID",
  )

Remplacez les variables suivantes :

  • PROJECT_ID : ID de votre projet Google Cloud .
  • REGION : Google Cloud région dans laquelle l'analyse de profilage des données a été créée.
  • DATASCAN_ID : ID de votre analyse de profilage des données.

Annuler une tâche d'analyse de profil de données

Si une tâche d'analyse de profil de données s'exécute plus longtemps que prévu ou a été lancée avec une configuration incorrecte, vous pouvez l'annuler. Il s'agit d'une opération qui sera effectuée dans la mesure du possible. Si le job est déjà dans un état final (par exemple, SUCCEEDED ou FAILED), la demande d'annulation est ignorée.

Rôles et autorisations nécessaires

Pour obtenir les autorisations nécessaires pour annuler un job d'analyse de profil de données, demandez à votre administrateur de vous accorder le rôle IAM Éditeur Dataplex (roles/dataplex.editor) ou Administrateur Dataplex DataScan (roles/dataplex.dataScanAdmin) sur votre projet.

Annuler une mission

Vous pouvez annuler une tâche d'analyse de profilage de données en cours d'exécution ou en attente à l'aide de l'API REST.

Console

  1. Dans la console Google Cloud , accédez à la page Qualité et profilage des données.

    Accéder à la page "Qualité et profilage des données"

  2. Cliquez sur le nom de l'analyse de profilage de données contenant le job que vous souhaitez annuler.

  3. Dans l'onglet Historique des jobs, recherchez le job dont l'état est En cours d'exécution ou En attente.

  4. Cliquez sur le bouton Annuler associé au job.

REST

Utilisez la méthode projects.locations.dataScans.jobs.cancel.

POST https://dataplex.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/dataScans/DATASCAN_ID/jobs/JOB_ID:cancel

Remplacez les éléments suivants :

  • PROJECT_ID : ID du projet.
  • LOCATION : région où se trouve l'analyse des données.
  • DATASCAN_ID : ID de l'analyse de données.
  • JOB_ID : ID du job à annuler.

Afficher les résultats d'analyse de profil de données

Console

  1. Dans la console Google Cloud , accédez à la page Qualité et profilage des données de Knowledge Catalog.

    Accéder à la page "Qualité et profilage des données"

  2. Cliquez sur le nom d'une analyse de profilage de données.

    • La section Vue d'ensemble affiche des informations sur les jobs les plus récents, y compris la date d'exécution de l'analyse, le nombre d'enregistrements de table analysés et l'état du job.

    • La section Configuration de l'analyse de profilage des données affiche des informations sur l'analyse.

  3. Pour afficher des informations détaillées sur un job, comme les colonnes de la table analysée, des statistiques sur les colonnes trouvées lors de l'analyse et les journaux de job, cliquez sur l'onglet Historique des jobs. Cliquez ensuite sur un ID de job.

gcloud

Pour afficher les résultats d'un job d'analyse de profilage des données, utilisez la commande gcloud dataplex datascans jobs describe :

gcloud dataplex datascans jobs describe JOB \
--location=LOCATION \
--datascan=DATASCAN \
--view=FULL

Remplacez les variables suivantes :

  • JOB : ID du job d'analyse de profilage des données.
  • LOCATION : Google Cloud région dans laquelle l'analyse de profilage des données a été créée.
  • DATASCAN : nom de l'analyse de profilage des données à laquelle appartient le job.
  • --view=FULL : pour afficher le résultat du job d'analyse, spécifiez FULL.

C#

C#

Avant d'essayer cet exemple, suivez les instructions de configuration pour C# du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour C#.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.

using Google.Cloud.Dataplex.V1;

public sealed partial class GeneratedDataScanServiceClientSnippets
{
    /// <summary>Snippet for GetDataScan</summary>
    /// <remarks>
    /// This snippet has been automatically generated and should be regarded as a code template only.
    /// It will require modifications to work:
    /// - It may require correct/in-range values for request initialization.
    /// - It may require specifying regional endpoints when creating the service client as shown in
    ///   https://cloud.google.com/dotnet/docs/reference/help/client-configuration#endpoint.
    /// </remarks>
    public void GetDataScanRequestObject()
    {
        // Create client
        DataScanServiceClient dataScanServiceClient = DataScanServiceClient.Create();
        // Initialize request argument(s)
        GetDataScanRequest request = new GetDataScanRequest
        {
            DataScanName = DataScanName.FromProjectLocationDataScan("[PROJECT]", "[LOCATION]", "[DATASCAN]"),
            View = GetDataScanRequest.Types.DataScanView.Unspecified,
        };
        // Make the request
        DataScan response = dataScanServiceClient.GetDataScan(request);
    }
}

Go

Go

Avant d'essayer cet exemple, suivez les instructions de configuration pour Go du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Go.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.


//go:build examples

package main

import (
	"context"

	dataplex "cloud.google.com/go/dataplex/apiv1"
	dataplexpb "cloud.google.com/go/dataplex/apiv1/dataplexpb"
)

func main() {
	ctx := context.Background()
	// This snippet has been automatically generated and should be regarded as a code template only.
	// It will require modifications to work:
	// - It may require correct/in-range values for request initialization.
	// - It may require specifying regional endpoints when creating the service client as shown in:
	//   https://pkg.go.dev/cloud.google.com/go#hdr-Client_Options
	c, err := dataplex.NewDataScanClient(ctx)
	if err != nil {
		// TODO: Handle error.
	}
	defer c.Close()

	req := &dataplexpb.GetDataScanRequest{
		// TODO: Fill request struct fields.
		// See https://pkg.go.dev/cloud.google.com/go/dataplex/apiv1/dataplexpb#GetDataScanRequest.
	}
	resp, err := c.GetDataScan(ctx, req)
	if err != nil {
		// TODO: Handle error.
	}
	// TODO: Use resp.
	_ = resp
}

Java

Java

Avant d'essayer cet exemple, suivez les instructions de configuration pour Java du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Java.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.

import com.google.cloud.dataplex.v1.DataScan;
import com.google.cloud.dataplex.v1.DataScanName;
import com.google.cloud.dataplex.v1.DataScanServiceClient;
import com.google.cloud.dataplex.v1.GetDataScanRequest;

public class SyncGetDataScan {

  public static void main(String[] args) throws Exception {
    syncGetDataScan();
  }

  public static void syncGetDataScan() throws Exception {
    // This snippet has been automatically generated and should be regarded as a code template only.
    // It will require modifications to work:
    // - It may require correct/in-range values for request initialization.
    // - It may require specifying regional endpoints when creating the service client as shown in
    // https://cloud.google.com/java/docs/setup#configure_endpoints_for_the_client_library
    try (DataScanServiceClient dataScanServiceClient = DataScanServiceClient.create()) {
      GetDataScanRequest request =
          GetDataScanRequest.newBuilder()
              .setName(DataScanName.of("[PROJECT]", "[LOCATION]", "[DATASCAN]").toString())
              .build();
      DataScan response = dataScanServiceClient.getDataScan(request);
    }
  }
}

Python

Python

Avant d'essayer cet exemple, suivez les instructions de configuration pour Python du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Python.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.

# This snippet has been automatically generated and should be regarded as a
# code template only.
# It will require modifications to work:
# - It may require correct/in-range values for request initialization.
# - It may require specifying regional endpoints when creating the service
#   client as shown in:
#   https://googleapis.dev/python/google-api-core/latest/client_options.html
from google.cloud import dataplex_v1


def sample_get_data_scan():
    # Create a client
    client = dataplex_v1.DataScanServiceClient()

    # Initialize request argument(s)
    request = dataplex_v1.GetDataScanRequest(
        name="name_value",
    )

    # Make the request
    response = client.get_data_scan(request=request)

    # Handle the response
    print(response)

Ruby

Ruby

Avant d'essayer cet exemple, suivez les instructions de configuration pour Ruby du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Ruby.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.

require "google/cloud/dataplex/v1"

##
# Snippet for the get_data_scan call in the DataScanService service
#
# This snippet has been automatically generated and should be regarded as a code
# template only. It will require modifications to work:
# - It may require correct/in-range values for request initialization.
# - It may require specifying regional endpoints when creating the service
# client as shown in https://cloud.google.com/ruby/docs/reference.
#
# This is an auto-generated example demonstrating basic usage of
# Google::Cloud::Dataplex::V1::DataScanService::Client#get_data_scan.
#
def get_data_scan
  # Create a client object. The client can be reused for multiple calls.
  client = Google::Cloud::Dataplex::V1::DataScanService::Client.new

  # Create a request. To set request fields, pass in keyword arguments.
  request = Google::Cloud::Dataplex::V1::GetDataScanRequest.new

  # Call the get_data_scan method.
  result = client.get_data_scan request

  # The returned object is of type Google::Cloud::Dataplex::V1::DataScan.
  p result
end

REST

Pour afficher les résultats d'une analyse de profilage des données, utilisez la méthode dataScans.get.

Afficher les résultats publiés

Si les résultats de l'analyse de profilage des données sont publiés sur les pages BigQuery et Knowledge Catalog de la console Google Cloud , vous pouvez consulter les derniers résultats de l'analyse dans l'onglet Profil de données de la table source.

  1. Dans la console Google Cloud , accédez à la page Rechercher de Knowledge Catalog.

    Accéder à la recherche

  2. Recherchez la table, puis sélectionnez-la.

  3. Cliquez sur l'onglet Profil de données.

    Les derniers résultats publiés s'affichent.

Afficher le job d'analyse de profilage des données le plus récent

Console

  1. Dans la console Google Cloud , accédez à la page Qualité et profilage des données de Knowledge Catalog.

    Accéder à la page "Qualité et profilage des données"

  2. Cliquez sur le nom d'une analyse de profilage de données.

  3. Cliquez sur l'onglet Résultats du dernier job.

    Lorsqu'au moins une exécution a été effectuée avec succès, l'onglet Résultats du dernier job fournit des informations sur le job le plus récent. Cet onglet recense les colonnes de la table analysée et les statistiques sur les colonnes trouvées lors de l'analyse.

gcloud

Pour afficher la dernière analyse de profilage des données réussie, utilisez la commande gcloud dataplex datascans describe :

gcloud dataplex datascans describe DATASCAN \
--location=LOCATION \
--view=FULL

Remplacez les variables suivantes :

  • DATASCAN : nom de l'analyse de profilage des données pour laquelle vous souhaitez afficher le job le plus récent.
  • LOCATION : Google Cloud région dans laquelle l'analyse de profilage des données a été créée.
  • --view=FULL : pour afficher le résultat du job d'analyse, spécifiez FULL.

REST

Pour afficher le job d'analyse le plus récent, utilisez la méthode dataScans.get.

Afficher l'historique des résultats d'analyse

Knowledge Catalog enregistre l'historique des analyses de profilage des données pour les 300 derniers jobs ou l'année écoulée, selon la première échéance.

Console

  1. Dans la console Google Cloud , accédez à la page Qualité et profilage des données de Knowledge Catalog.

    Accéder à la page "Qualité et profilage des données"

  2. Cliquez sur le nom d'une analyse de profilage de données.

  3. Cliquez sur l'onglet Historique des jobs.

    L'onglet Historique des jobs fournit des informations sur les anciens jobs, comme le nombre d'enregistrements analysés dans chaque job, l'état du job et l'heure à laquelle le job a été exécuté.

  4. Pour afficher des informations détaillées sur un job, cliquez sur l'un des jobs de la colonne ID de job.

gcloud

Pour afficher l'historique des jobs d'analyse de profilage des données, utilisez la commande gcloud dataplex datascans jobs list :

gcloud dataplex datascans jobs list \
--location=LOCATION \
--datascan=DATASCAN

Remplacez les variables suivantes :

  • LOCATION : Google Cloud région dans laquelle l'analyse de profilage des données a été créée.
  • DATASCAN : nom de l'analyse de profilage des données pour laquelle vous souhaitez afficher les jobs.

C#

C#

Avant d'essayer cet exemple, suivez les instructions de configuration pour C# du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour C#.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.

using Google.Api.Gax;
using Google.Cloud.Dataplex.V1;
using System;

public sealed partial class GeneratedDataScanServiceClientSnippets
{
    /// <summary>Snippet for ListDataScanJobs</summary>
    /// <remarks>
    /// This snippet has been automatically generated and should be regarded as a code template only.
    /// It will require modifications to work:
    /// - It may require correct/in-range values for request initialization.
    /// - It may require specifying regional endpoints when creating the service client as shown in
    ///   https://cloud.google.com/dotnet/docs/reference/help/client-configuration#endpoint.
    /// </remarks>
    public void ListDataScanJobsRequestObject()
    {
        // Create client
        DataScanServiceClient dataScanServiceClient = DataScanServiceClient.Create();
        // Initialize request argument(s)
        ListDataScanJobsRequest request = new ListDataScanJobsRequest
        {
            ParentAsDataScanName = DataScanName.FromProjectLocationDataScan("[PROJECT]", "[LOCATION]", "[DATASCAN]"),
            Filter = "",
        };
        // Make the request
        PagedEnumerable<ListDataScanJobsResponse, DataScanJob> response = dataScanServiceClient.ListDataScanJobs(request);

        // Iterate over all response items, lazily performing RPCs as required
        foreach (DataScanJob item in response)
        {
            // Do something with each item
            Console.WriteLine(item);
        }

        // Or iterate over pages (of server-defined size), performing one RPC per page
        foreach (ListDataScanJobsResponse page in response.AsRawResponses())
        {
            // Do something with each page of items
            Console.WriteLine("A page of results:");
            foreach (DataScanJob item in page)
            {
                // Do something with each item
                Console.WriteLine(item);
            }
        }

        // Or retrieve a single page of known size (unless it's the final page), performing as many RPCs as required
        int pageSize = 10;
        Page<DataScanJob> singlePage = response.ReadPage(pageSize);
        // Do something with the page of items
        Console.WriteLine($"A page of {pageSize} results (unless it's the final page):");
        foreach (DataScanJob item in singlePage)
        {
            // Do something with each item
            Console.WriteLine(item);
        }
        // Store the pageToken, for when the next page is required.
        string nextPageToken = singlePage.NextPageToken;
    }
}

Go

Go

Avant d'essayer cet exemple, suivez les instructions de configuration pour Go du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Go.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.


//go:build examples

package main

import (
	"context"

	dataplex "cloud.google.com/go/dataplex/apiv1"
	dataplexpb "cloud.google.com/go/dataplex/apiv1/dataplexpb"
	"google.golang.org/api/iterator"
)

func main() {
	ctx := context.Background()
	// This snippet has been automatically generated and should be regarded as a code template only.
	// It will require modifications to work:
	// - It may require correct/in-range values for request initialization.
	// - It may require specifying regional endpoints when creating the service client as shown in:
	//   https://pkg.go.dev/cloud.google.com/go#hdr-Client_Options
	c, err := dataplex.NewDataScanClient(ctx)
	if err != nil {
		// TODO: Handle error.
	}
	defer c.Close()

	req := &dataplexpb.ListDataScanJobsRequest{
		// TODO: Fill request struct fields.
		// See https://pkg.go.dev/cloud.google.com/go/dataplex/apiv1/dataplexpb#ListDataScanJobsRequest.
	}
	it := c.ListDataScanJobs(ctx, req)
	for {
		resp, err := it.Next()
		if err == iterator.Done {
			break
		}
		if err != nil {
			// TODO: Handle error.
		}
		// TODO: Use resp.
		_ = resp

		// If you need to access the underlying RPC response,
		// you can do so by casting the `Response` as below.
		// Otherwise, remove this line. Only populated after
		// first call to Next(). Not safe for concurrent access.
		_ = it.Response.(*dataplexpb.ListDataScanJobsResponse)
	}
}

Java

Java

Avant d'essayer cet exemple, suivez les instructions de configuration pour Java du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Java.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.

import com.google.cloud.dataplex.v1.DataScanJob;
import com.google.cloud.dataplex.v1.DataScanName;
import com.google.cloud.dataplex.v1.DataScanServiceClient;
import com.google.cloud.dataplex.v1.ListDataScanJobsRequest;

public class SyncListDataScanJobs {

  public static void main(String[] args) throws Exception {
    syncListDataScanJobs();
  }

  public static void syncListDataScanJobs() throws Exception {
    // This snippet has been automatically generated and should be regarded as a code template only.
    // It will require modifications to work:
    // - It may require correct/in-range values for request initialization.
    // - It may require specifying regional endpoints when creating the service client as shown in
    // https://cloud.google.com/java/docs/setup#configure_endpoints_for_the_client_library
    try (DataScanServiceClient dataScanServiceClient = DataScanServiceClient.create()) {
      ListDataScanJobsRequest request =
          ListDataScanJobsRequest.newBuilder()
              .setParent(DataScanName.of("[PROJECT]", "[LOCATION]", "[DATASCAN]").toString())
              .setPageSize(883849137)
              .setPageToken("pageToken873572522")
              .setFilter("filter-1274492040")
              .build();
      for (DataScanJob element : dataScanServiceClient.listDataScanJobs(request).iterateAll()) {
        // doThingsWith(element);
      }
    }
  }
}

Python

Python

Avant d'essayer cet exemple, suivez les instructions de configuration pour Python du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Python.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.

# This snippet has been automatically generated and should be regarded as a
# code template only.
# It will require modifications to work:
# - It may require correct/in-range values for request initialization.
# - It may require specifying regional endpoints when creating the service
#   client as shown in:
#   https://googleapis.dev/python/google-api-core/latest/client_options.html
from google.cloud import dataplex_v1


def sample_list_data_scan_jobs():
    # Create a client
    client = dataplex_v1.DataScanServiceClient()

    # Initialize request argument(s)
    request = dataplex_v1.ListDataScanJobsRequest(
        parent="parent_value",
    )

    # Make the request
    page_result = client.list_data_scan_jobs(request=request)

    # Handle the response
    for response in page_result:
        print(response)

Ruby

Ruby

Avant d'essayer cet exemple, suivez les instructions de configuration pour Ruby du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Ruby.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.

require "google/cloud/dataplex/v1"

##
# Snippet for the list_data_scan_jobs call in the DataScanService service
#
# This snippet has been automatically generated and should be regarded as a code
# template only. It will require modifications to work:
# - It may require correct/in-range values for request initialization.
# - It may require specifying regional endpoints when creating the service
# client as shown in https://cloud.google.com/ruby/docs/reference.
#
# This is an auto-generated example demonstrating basic usage of
# Google::Cloud::Dataplex::V1::DataScanService::Client#list_data_scan_jobs.
#
def list_data_scan_jobs
  # Create a client object. The client can be reused for multiple calls.
  client = Google::Cloud::Dataplex::V1::DataScanService::Client.new

  # Create a request. To set request fields, pass in keyword arguments.
  request = Google::Cloud::Dataplex::V1::ListDataScanJobsRequest.new

  # Call the list_data_scan_jobs method.
  result = client.list_data_scan_jobs request

  # The returned object is of type Gapic::PagedEnumerable. You can iterate
  # over elements, and API calls will be issued to fetch pages as needed.
  result.each do |item|
    # Each element is of type ::Google::Cloud::Dataplex::V1::DataScanJob.
    p item
  end
end

REST

Pour afficher l'historique des jobs d'analyse de profilage des données, utilisez la méthode dataScans.jobs.list.

États des jobs

Les tâches d'analyse de données peuvent présenter les états suivants :

  • PENDING : la tâche a été créée, mais n'a pas encore commencé à s'exécuter. Dans cet état, l'analyse configure activement l'infrastructure ou acquiert des emplacements. Cette phase peut prendre de 10 à 20 secondes ou plus, en fonction de la complexité du schéma et de la contention des ressources.

  • RUNNING : le job est en cours d'exécution.

  • CANCELING : la tâche est en cours d'annulation.

  • CANCELLED : la tâche a bien été annulée.

  • SUCCEEDED : la tâche s'est terminée avec succès. L'état d'achèvement peut être en retard sur l'achèvement réel de la requête (jusqu'à 60 secondes) en raison des étapes de post-traitement, telles que l'agrégation et la synchronisation des métadonnées.

  • FAILED : la tâche échoue en raison d'une erreur. L'état d'achèvement peut être en retard sur l'achèvement réel de la requête (jusqu'à 60 secondes) en raison des étapes de post-traitement, telles que l'agrégation et la synchronisation des métadonnées.

  • SUCCEEDED_WITH_ERRORS : le job s'est terminé avec succès, mais des erreurs se sont produites lors de l'exécution.

Bonnes pratiques de surveillance

Lorsque vous surveillez vos jobs d'analyse des données, tenez compte des bonnes pratiques suivantes :

  • Évitez l'interrogation agressive : évitez l'interrogation agressive (par exemple, en appelant GetJob ou l'équivalent toutes les une à cinq secondes). L'interrogation agressive gaspille le quota d'API et n'accélère pas les transitions d'état.

  • Utilisez un intervalle exponentiel entre les tentatives : si l'interrogation répétitive est inévitable, utilisez un intervalle exponentiel entre les tentatives en commençant par 10 à 15 secondes.

  • Utilisez le découplage asynchrone basé sur les événements (recommandé) : au lieu d'interroger l'API de manière synchrone, utilisez des déclencheurs Eventarc qui écoutent les journaux d'audit Cloud (cloudaudit.googleapis.com). Vous pouvez utiliser ces déclencheurs pour lancer des workflows en aval immédiatement après les événements de fin de tâche DataScan. Cette approche permet de contourner les limites d'interrogation de l'API, de préserver le quota et de réduire la latence perçue.

Accorder l'accès aux résultats d'analyse de profilage de données

Pour permettre aux utilisateurs de votre organisation d'afficher les résultats d'analyse, procédez comme suit :

  1. Dans la console Google Cloud , accédez à la page Qualité et profilage des données de Knowledge Catalog.

    Accéder à la page "Qualité et profilage des données"

  2. Cliquez sur l'analyse de profilage des données dont vous ne souhaitez plus partager les résultats.

  3. Cliquez sur l'onglet Autorisations.

  4. Procédez comme suit :

    • Pour accorder l'accès à un compte principal, cliquez sur Accorder l'accès. Accordez le rôle Lecteur de données Dataplex DataScan au compte principal associé.
    • Pour supprimer l'accès d'un compte principal, sélectionnez le compte principal pour lequel vous souhaitez supprimer le rôle Lecteur de données Dataplex DataScan. Cliquez sur  > Supprimer l'accès, puis confirmez lorsque vous y êtes invité.

Gérer les analyses de profilage des données pour une table spécifique

Les étapes décrites dans ce document expliquent comment gérer les analyses de profilage des données dans votre projet à l'aide de la page Qualité et profilage des données de Knowledge Catalog dans la console Google Cloud .

Vous pouvez également créer et gérer des analyses de profilage de données lorsque vous travaillez avec une table spécifique. Dans la console Google Cloud , sur la page Knowledge Catalog de la table, utilisez l'onglet Profil de données. Procédez comme suit :

  1. Dans la console Google Cloud , accédez à la page Rechercher de Knowledge Catalog.

    Accéder à la recherche

    Recherchez la table, puis sélectionnez-la.

  2. Cliquez sur l'onglet Profil de données.

  3. Selon que la table comporte ou non une analyse de profilage des données dont les résultats sont publiés, vous pouvez effectuer les opérations suivantes :

    • Les résultats de l'analyse de profilage de données sont publiés : les derniers résultats de l'analyse publiée s'affichent sur la page.

      Pour gérer les analyses de profilage des données de ce tableau, cliquez sur Analyse de profilage des données, puis sélectionnez l'une des options suivantes :

      • Créer une analyse : créez une analyse de profilage des données. Pour en savoir plus, consultez la section Créer une analyse de profilage de données de ce document. Lorsque vous créez une analyse à partir de la page d'informations d'une table, celle-ci est présélectionnée.

      • Exécuter : exécutez l'analyse.

      • Modifier la configuration d'analyse : modifiez les paramètres, y compris le nom à afficher, les filtres, la taille de l'échantillon et la planification.

      • Gérer les autorisations d'analyse : contrôlez qui peut accéder aux résultats de l'analyse. Pour en savoir plus, consultez la section Accorder l'accès aux résultats d'analyse de profilage des données de ce document.

      • Afficher l'historique des résultats : affichez des informations détaillées sur les jobs d'analyse de profilage des données précédents. Pour en savoir plus, consultez les sections Afficher les résultats d'analyse de profilage de données et Afficher l'historique des résultats d'analyse de ce document.

      • Afficher toutes les analyses : affichez la liste des analyses de profilage des données qui s'appliquent à ce tableau.

    • Les résultats de l'analyse du profilage de données ne sont pas publiés : cliquez sur le menu à côté de Profil de données rapide, puis sélectionnez l'une des options suivantes :

      • Personnaliser le profilage des données : créez une analyse de profilage des données. Pour en savoir plus, consultez la section Créer une analyse de profilage de données de ce document. Lorsque vous créez une analyse à partir de la page d'informations d'une table, celle-ci est présélectionnée.

      • Afficher les profils précédents : affichez la liste des analyses de profilage des données qui s'appliquent à cette table.

Mettre à jour une analyse de profilage des données

Console

  1. Dans la console Google Cloud , accédez à la page Qualité et profilage des données de Knowledge Catalog.

    Accéder à la page "Qualité et profilage des données"

  2. Cliquez sur le nom d'une analyse de profilage de données.

  3. Cliquez sur Modifier, puis modifiez les valeurs.

  4. Cliquez sur Enregistrer.

gcloud

Pour mettre à jour une analyse de profilage des données, utilisez la commande gcloud dataplex datascans update data-profile :

gcloud dataplex datascans update data-profile DATASCAN \
--location=LOCATION \
--description=DESCRIPTION

Remplacez les variables suivantes :

  • DATASCAN : nom de l'analyse de profilage des données à mettre à jour.
  • LOCATION : Google Cloud région dans laquelle l'analyse de profilage des données a été créée.
  • DESCRIPTION : nouvelle description de l'analyse de profilage des données.

C#

C#

Avant d'essayer cet exemple, suivez les instructions de configuration pour C# du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour C#.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.

using Google.Cloud.Dataplex.V1;
using Google.LongRunning;
using Google.Protobuf.WellKnownTypes;

public sealed partial class GeneratedDataScanServiceClientSnippets
{
    /// <summary>Snippet for UpdateDataScan</summary>
    /// <remarks>
    /// This snippet has been automatically generated and should be regarded as a code template only.
    /// It will require modifications to work:
    /// - It may require correct/in-range values for request initialization.
    /// - It may require specifying regional endpoints when creating the service client as shown in
    ///   https://cloud.google.com/dotnet/docs/reference/help/client-configuration#endpoint.
    /// </remarks>
    public void UpdateDataScanRequestObject()
    {
        // Create client
        DataScanServiceClient dataScanServiceClient = DataScanServiceClient.Create();
        // Initialize request argument(s)
        UpdateDataScanRequest request = new UpdateDataScanRequest
        {
            DataScan = new DataScan(),
            UpdateMask = new FieldMask(),
            ValidateOnly = false,
        };
        // Make the request
        Operation<DataScan, OperationMetadata> response = dataScanServiceClient.UpdateDataScan(request);

        // Poll until the returned long-running operation is complete
        Operation<DataScan, OperationMetadata> completedResponse = response.PollUntilCompleted();
        // Retrieve the operation result
        DataScan result = completedResponse.Result;

        // Or get the name of the operation
        string operationName = response.Name;
        // This name can be stored, then the long-running operation retrieved later by name
        Operation<DataScan, OperationMetadata> retrievedResponse = dataScanServiceClient.PollOnceUpdateDataScan(operationName);
        // Check if the retrieved long-running operation has completed
        if (retrievedResponse.IsCompleted)
        {
            // If it has completed, then access the result
            DataScan retrievedResult = retrievedResponse.Result;
        }
    }
}

Go

Go

Avant d'essayer cet exemple, suivez les instructions de configuration pour Go du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Go.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.


//go:build examples

package main

import (
	"context"

	dataplex "cloud.google.com/go/dataplex/apiv1"
	dataplexpb "cloud.google.com/go/dataplex/apiv1/dataplexpb"
)

func main() {
	ctx := context.Background()
	// This snippet has been automatically generated and should be regarded as a code template only.
	// It will require modifications to work:
	// - It may require correct/in-range values for request initialization.
	// - It may require specifying regional endpoints when creating the service client as shown in:
	//   https://pkg.go.dev/cloud.google.com/go#hdr-Client_Options
	c, err := dataplex.NewDataScanClient(ctx)
	if err != nil {
		// TODO: Handle error.
	}
	defer c.Close()

	req := &dataplexpb.UpdateDataScanRequest{
		// TODO: Fill request struct fields.
		// See https://pkg.go.dev/cloud.google.com/go/dataplex/apiv1/dataplexpb#UpdateDataScanRequest.
	}
	op, err := c.UpdateDataScan(ctx, req)
	if err != nil {
		// TODO: Handle error.
	}

	resp, err := op.Wait(ctx)
	if err != nil {
		// TODO: Handle error.
	}
	// TODO: Use resp.
	_ = resp
}

Java

Java

Avant d'essayer cet exemple, suivez les instructions de configuration pour Java du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Java.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.

import com.google.cloud.dataplex.v1.DataScan;
import com.google.cloud.dataplex.v1.DataScanServiceClient;
import com.google.cloud.dataplex.v1.UpdateDataScanRequest;
import com.google.protobuf.FieldMask;

public class SyncUpdateDataScan {

  public static void main(String[] args) throws Exception {
    syncUpdateDataScan();
  }

  public static void syncUpdateDataScan() throws Exception {
    // This snippet has been automatically generated and should be regarded as a code template only.
    // It will require modifications to work:
    // - It may require correct/in-range values for request initialization.
    // - It may require specifying regional endpoints when creating the service client as shown in
    // https://cloud.google.com/java/docs/setup#configure_endpoints_for_the_client_library
    try (DataScanServiceClient dataScanServiceClient = DataScanServiceClient.create()) {
      UpdateDataScanRequest request =
          UpdateDataScanRequest.newBuilder()
              .setDataScan(DataScan.newBuilder().build())
              .setUpdateMask(FieldMask.newBuilder().build())
              .setValidateOnly(true)
              .build();
      DataScan response = dataScanServiceClient.updateDataScanAsync(request).get();
    }
  }
}

Python

Python

Avant d'essayer cet exemple, suivez les instructions de configuration pour Python du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Python.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.

# This snippet has been automatically generated and should be regarded as a
# code template only.
# It will require modifications to work:
# - It may require correct/in-range values for request initialization.
# - It may require specifying regional endpoints when creating the service
#   client as shown in:
#   https://googleapis.dev/python/google-api-core/latest/client_options.html
from google.cloud import dataplex_v1


def sample_update_data_scan():
    # Create a client
    client = dataplex_v1.DataScanServiceClient()

    # Initialize request argument(s)
    data_scan = dataplex_v1.DataScan()
    data_scan.data.entity = "entity_value"

    request = dataplex_v1.UpdateDataScanRequest(
        data_scan=data_scan,
    )

    # Make the request
    operation = client.update_data_scan(request=request)

    print("Waiting for operation to complete...")

    response = operation.result()

    # Handle the response
    print(response)

Ruby

Ruby

Avant d'essayer cet exemple, suivez les instructions de configuration pour Ruby du guide de démarrage rapide de Knowledge Catalog à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Knowledge Catalog pour Ruby.

Pour vous authentifier auprès de Knowledge Catalog, configurez les Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.

require "google/cloud/dataplex/v1"

##
# Snippet for the update_data_scan call in the DataScanService service
#
# This snippet has been automatically generated and should be regarded as a code
# template only. It will require modifications to work:
# - It may require correct/in-range values for request initialization.
# - It may require specifying regional endpoints when creating the service
# client as shown in https://cloud.google.com/ruby/docs/reference.
#
# This is an auto-generated example demonstrating basic usage of
# Google::Cloud::Dataplex::V1::DataScanService::Client#update_data_scan.
#
def update_data_scan
  # Create a client object. The client can be reused for multiple calls.
  client = Google::Cloud::Dataplex::V1::DataScanService::Client.new

  # Create a request. To set request fields, pass in keyword arguments.
  request = Google::Cloud::Dataplex::V1::UpdateDataScanRequest.new

  # Call the update_data_scan method.
  result = client.update_data_scan request

  # The returned object is of type Gapic::Operation. You can use it to
  # check the status of an operation, cancel it, or wait for results.
  # Here is how to wait for a response.
  result.wait_until_done! timeout: 60
  if result.response?
    p result.response
  else
    puts "No response received."
  end
end

REST

Pour modifier une analyse de profilage de données, utilisez la méthode dataScans.patch.

Supprimer une analyse de profilage des données

Console

  1. Dans la console Google Cloud , accédez à la page Qualité et profilage des données de Knowledge Catalog.

    Accéder à la page "Qualité et profilage des données"

  2. Cliquez sur l'analyse que vous souhaitez supprimer.

  3. Cliquez sur Supprimer, puis confirmez l'opération lorsque vous y êtes invité.

gcloud

Pour supprimer une analyse de profilage des données, utilisez la commande gcloud dataplex datascans delete :

gcloud dataplex datascans delete DATASCAN \
--location=LOCATION --async

Remplacez les variables suivantes :

  • DATASCAN : nom de l'analyse de profilage des données à supprimer.
  • LOCATION : Google Cloud région dans laquelle l'analyse de profilage des données a été créée.

REST

Pour supprimer une analyse de profilage des données, utilisez la méthode dataScans.delete.

Étapes suivantes