Dataset-Statistiken generieren

In diesem Dokument wird beschrieben, wie Sie Dataset-Statistiken für BigQuery-Datasets und Apache Iceberg-Namespaces generieren. Diese werden in BigQuery als Datasets dargestellt. Dataset-Statistiken helfen Ihnen, Beziehungen zwischen Tabellen in einem Dataset oder Namespace zu verstehen, indem Beziehungsdiagramme und tabellenübergreifende Abfragen generiert werden.

Dataset-Statistiken helfen Ihnen, die Erkundung von Datasets und Namespaces mit mehreren Tabellen zu beschleunigen, indem Beziehungen zwischen Tabellen in einem Diagramm automatisch erkannt und visualisiert werden. Außerdem werden Beziehungen zwischen Primär- und Fremdschlüsseln identifiziert und tabellenübergreifende Beispielabfragen generiert. Das ist nützlich, um die Datenstruktur ohne Dokumentation zu verstehen, schemadefinierte, nutzungsbasierte oder KI-abgeleitete Beziehungen zwischen Tabellen zu erkennen und komplexe Abfragen zu generieren, die mehrere Tabellen verknüpfen.

Eine Übersicht über Tabellen- und Dataset-Statistiken finden Sie unter Übersicht über Datenstatistiken.

Modi zum Generieren von Dataset-Statistiken

Beim Generieren von Dataset-Statistiken bietet BigQuery zwei Modi:

Modus Beschreibung Nutzung
Generieren und veröffentlichen

Speichert generierte Dataset-Statistiken als Metadatenaspekte und Beziehungen in Knowledge Catalog. Sie benötigen die erforderlichen Berechtigungen zum Veröffentlichen. Wenn Sie Generieren und veröffentlichen verwenden, führt BigQuery Folgendes aus:

  • Speichert die Dataset-Beschreibung in Knowledge Catalog.
  • Erfasst vorgeschlagene Abfragen und Fragen als wiederverwendbare Aspekte.
  • Erfasst Beziehungen als Metadaten in Knowledge Catalog.
  • Ermöglicht Nutzern mit entsprechendem Knowledge Catalog-Zugriff, veröffentlichte Statistiken anzusehen, und sorgt so für gemeinsames Organisationswissen.
  • Ermöglicht Ihnen, Beschreibungen direkt in Knowledge Catalog über die API zu bearbeiten und zu speichern. Sie können die vorgeschlagenen Abfragen über die Google Cloud Console bearbeiten.

Verwenden Sie diesen Modus für unternehmensweite Datendokumentation, die dauerhaft gespeichert und wiederverwendbar ist, oder wenn Sie kataloggesteuerte Governance Workflows erstellen.

Ohne Veröffentlichung generieren

Erstellt Dataset-Statistiken wie Beschreibungen, Fragen in natürlicher Sprache Fragen, Beziehungen und SQL-Abfragen bei Bedarf. Mit **Ohne Veröffentlichung generieren** werden keine Statistiken in Knowledge Catalog veröffentlicht.

Verwenden Sie diesen Modus für schnelle, Ad-hoc-Analysen, um den Katalog nicht zu überladen.

Hinweis

Datenstatistiken werden mit Gemini in BigQuery generiert. Damit Sie Statistiken generieren können, müssen Sie zuerst Gemini in BigQuery einrichten.

APIs aktivieren

Aktivieren Sie die folgenden APIs in Ihrem Projekt, um Datenstatistiken zu verwenden: Dataplex API, BigQuery API und Gemini for Google Cloud API.

Rollen, die zum Aktivieren von APIs erforderlich sind

Zum Aktivieren von APIs benötigen Sie die Berechtigung serviceusage.services.enable. Wenn Sie das Projekt erstellt haben, haben Sie diese Berechtigung wahrscheinlich bereits über die Rolle „Inhaber“ (roles/owner). Andernfalls können Sie diese Berechtigung über die Rolle „Service Usage-Administrator“ (roles/serviceusage.serviceUsageAdmin) erhalten. Informationen zum Zuweisen von Rollen.

APIs aktivieren

Weitere Informationen zum Aktivieren der Gemini for Google Cloud API finden Sie unter Gemini for Google Cloud API in einem Google Cloud Projektaktivieren.

Datenprofilscan ausführen

Um die Qualität der Statistiken zu verbessern, generieren Sie einen Datenprofilscan für Tabellen in Ihrem Dataset.

Erforderliche Rollen

Bitten Sie Ihren Administrator, Ihnen die folgenden IAM-Rollen zuzuweisen, um die Berechtigungen zu erhalten, die Sie zum Generieren, Verwalten und Abrufen von Dataset-Statistiken benötigen:

  • Zum Generieren, Verwalten und Abrufen von Statistiken:
    • Dataplex DataScan-Bearbeiter (roles/dataplex.dataScanEditor) oder Dataplex DataScan-Administrator (roles/dataplex.dataScanAdmin) für das Projekt
    • BigQuery-Datenbearbeiter (roles/bigquery.dataEditor) für Tabellen
    • BigQuery-Nutzer (roles/bigquery.user) oder BigQuery Studio-Nutzer (roles/bigquery.studioUser) für das Projekt
    • BigQuery-Ressourcenbetrachter (roles/bigquery.resourceViewer) für das Projekt
  • Zum Ansehen von Statistiken:
  • Zum Veröffentlichen von Statistiken in Knowledge Catalog: Dataplex-Eintrags- und Eintragslinkinhaber (roles/dataplex.entryOwner) für die Eintragsgruppe

Weitere Informationen zum Zuweisen von Rollen finden Sie unter Zugriff auf Projekte, Ordner und Organisationen verwalten.

Sie können die erforderlichen Berechtigungen auch über benutzerdefinierte Rollen oder andere vordefinierte Rollen erhalten.

Erweitern Sie den Abschnitt Erforderliche Berechtigungen , um die genauen Berechtigungen anzuzeigen, die zum Generieren von Statistiken erforderlich sind:

Erforderliche Berechtigungen

  • bigquery.datasets.get: Metadaten des Datasets lesen
  • bigquery.jobs.create: Jobs erstellen
  • bigquery.jobs.listAll: Alle Jobs im Projekt auflisten
  • bigquery.tables.get: Tabellenmetadaten abrufen
  • bigquery.tables.getData: Tabellendaten und -metadaten abrufen
  • dataplex.datascans.create: Datenprofilscan-Ressource erstellen
  • dataplex.datascans.get: Metadaten der Datenprofilscan-Ressource lesen
  • dataplex.datascans.getData: Ergebnisse der Datenprofilscan-Ausführung lesen
  • dataplex.datascans.run: On-Demand-Datenprofilscan ausführen
  • dataplex.entryGroups.useSchemaJoinEntryLink: schema-join-Eintragslinks verwenden
  • dataplex.entryGroups.useSchemaJoinAspect: Schemazusammenführungsaspekte verwenden
  • dataplex.entryLinks.create: Eintragslinks erstellen
  • dataplex.entryLinks.update: Eintragslinks aktualisieren
  • dataplex.entryLinks.delete: Eintragslinks löschen
  • dataplex.entries.link: Einträge verknüpfen
  • dataplex.entries.update: Einträge aktualisieren
  • dataplex.entryGroups.useDescriptionsAspect: Beschreibungsaspekte verwenden
  • dataplex.entryGroups.useQueriesAspect: Abfrageaspekte verwenden

Dataset-Statistiken generieren

Console

  1. Öffnen Sie in der Google Cloud Console BigQuery Studio.

    Zu BigQuery Studio

  2. Wählen Sie im Bereich Explorer das Projekt und das Dataset aus, für das Sie Statistiken generieren möchten. Wählen Sie für Iceberg-Namespaces das Dataset aus, das Ihren Katalognamespace darstellt.

  3. Klicken Sie auf den Tab Statistiken.

  4. Klicken Sie auf Generieren und veröffentlichen , um Statistiken zu generieren und in Knowledge Catalog zu veröffentlichen.

    Klicken Sie auf Ohne Veröffentlichung generieren , um Statistiken zu generieren, ohne sie in Knowledge Catalog zu veröffentlichen.

    Weitere Informationen zu den Unterschieden zwischen den Generieren und veröffentlichen und Ohne Veröffentlichung generieren Modi finden Sie unter Modi zum Generieren von Dataset-Statistiken.

  5. Wenn sich Ihr Dataset in einer Multiregion befindet, werden Sie möglicherweise aufgefordert, eine Region auszuwählen, um Statistiken zu generieren. Wählen Sie eine Region am multiregionalen Standort aus, an dem der Statistikscan erstellt wird.

    Es dauert einige Minuten, bis die Statistiken erfasst werden. Die Qualität der Statistiken verbessert sich, wenn die Tabellen im Dataset Datenprofilergebnisse enthalten.

Nachdem die Statistiken generiert wurden, zeigt BigQuery eine Dataset-Beschreibung, ein Beziehungsdiagramm, eine Beziehungstabelle und tabellenübergreifende Beispielabfragen an.

REST

Verwenden Sie die Knowledge Catalog DataScans API, um Statistiken programmatisch zu generieren. Dazu müssen Sie die folgenden Schritte ausführen:

  1. Datenprofilscan für die Datendokumentation für das BigQuery-Dataset generieren
  2. Status des Datenprofilscans für die Datendokumentation prüfen
  3. Veröffentlichung in Knowledge Catalog prüfen

Datenprofilscan für die Datendokumentation für das BigQuery-Dataset generieren

  1. Erstellen Sie einen Datenprofilscan für die Datendokumentation mit der dataScans.create Methode. Optional können Sie diese Statistiken in Knowledge Catalog veröffentlichen, indem Sie den Parameter catalog_publishing_enabled auf true setzen.

    Beispiel:

    alias gcurl='curl -H "Authorization: Bearer $(gcloud auth print-access-token)" -H "Content-Type: application/json"'
    gcurl -X POST \
    https://dataplex.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/\
    dataScans?dataScanId=DATASCAN_ID \
    -d '{
      "data": {
        "resource": "//bigquery.googleapis.com/projects/PROJECT_ID/datasets/DATASET_ID"
      },
      "executionSpec": {
        "trigger": { "onDemand": {} }
      },
      "type": "DATA_DOCUMENTATION",
      "dataDocumentationSpec": {
        "catalog_publishing_enabled": true
      }
    }'
    

    Ersetzen Sie Folgendes:

    • PROJECT_ID: die ID des Google Cloud Projekts, in dem sich das Dataset befindet
    • LOCATION: die Region, in der der Datenprofilscan ausgeführt wird
    • DATASCAN_ID: ein eindeutiger Name, den Sie für diesen Scan angeben
    • DATASET_ID: die ID des BigQuery-Datasets, das gescannt wird
  2. Starten Sie den Datenprofilscan-Job für die Datendokumentation mit der dataScans.run Methode.

    Beispiel:

    gcurl -X POST \
    https://dataplex.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/\
    dataScans/DATASCAN_ID:run
    

    Diese Anfrage gibt eine eindeutige Job-ID zusammen mit dem ursprünglichen Status zurück.

Status des Datenprofilscans für die Datendokumentation prüfen

Prüfen Sie mit der dataScans.get Methode, ob die Ausführung des Scanjobs abgeschlossen ist. Wenn Sie alle Ergebnisse einschließlich der Statistiken und des Veröffentlichungsstatus abrufen möchten, setzen Sie den Parameter view auf FULL.

Rufen Sie mit der Job-ID den Status des Jobs ab. Beispiel:

gcurl -X GET https://dataplex.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/dataScans/DATASCAN_ID/jobs/JOB_ID?view=FULL

Der Job ist abgeschlossen, wenn der Status entweder SUCCEEDED oder FAILURE ist.

Eine erfolgreiche Jobantwort enthält die generierten Statistiken im Feld dataDocumentationResult.

Veröffentlichung in Knowledge Catalog prüfen

Wenn catalog_publishing_enabled auf true gesetzt ist, werden die Statistiken nach Abschluss des Datenprofilscan-Jobs asynchron in Knowledge Catalog veröffentlicht. Verwenden Sie die Dataplex API, um die Aspekte des Datasets zu prüfen und so zu bestätigen, dass die Statistiken gespeichert wurden.

Während Statistiken aus dem Datenprofilscan auf Dataset-Ebene generiert werden, werden die resultierenden Eintragslinks zwischen den Tabellen gespeichert, die sie verbinden. Verwenden Sie die lookupEntryLinks Methode , um diese Beziehungen zu prüfen und die Eintragslinks abzurufen, die mit einem bestimmten Tabelleneintrag verknüpft sind.

Verwenden Sie die entries.get Methode, um Metadaten für Ihr BigQuery-Dataset abzurufen. Wenn Sie alle Aspekte einbeziehen möchten, setzen Sie den Parameter view auf FULL. Beispiel:

gcurl -X GET https://dataplex.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/entryGroups/@bigquery/entries/bigquery.googleapis.com/projects/DATASET_PROJECT_ID/datasets/DATASET_ID?view=FULL

Ersetzen Sie Folgendes:

  • PROJECT_ID: die ID des Google Cloud Projekts, in dem der Datenprofilscan konfiguriert wurde
  • LOCATION: die Region, in der sich die Eintragsgruppe befindet
  • DATASET_PROJECT_ID: die ID des Google Cloud Projekts, in dem sich das BigQuery-Dataset befindet
  • DATASET: die ID des BigQuery-Datasets

Wenn die Veröffentlichung in Knowledge Catalog erfolgreich ist, werden die folgenden Aspekte an das BigQuery-Dataset angehängt:

  • Beschreibungen: enthält KI-generierte Beschreibungen des Datasets
  • Abfragen: enthält relevante SQL-Abfragen im Zusammenhang mit dem Dataset
  • Beziehungen: werden als Eintragslinks zwischen den Tabellen im Dataset gespeichert

Dataset-Beschreibung ansehen und speichern

Gemini generiert eine Beschreibung des Datasets in natürlicher Sprache, in der die Arten von Tabellen und die Geschäftsdomain zusammengefasst werden. Klicken Sie auf In Details speichern, um diese Beschreibung in den Metadaten des Datasets zu speichern.

Sie können die Beschreibung bearbeiten, bevor Sie die Details speichern.

Beziehungsdiagramm ansehen

Das Diagramm Beziehungen bietet eine visuelle Darstellung der Beziehungen zwischen den Tabellen im Dataset. Die 10 am stärksten verbundenen Tabellen werden als Knoten angezeigt, wobei Linien die Beziehungen zwischen ihnen darstellen.

  • Wenn Sie Details zu Beziehungen sehen möchten, z. B. die Spalten, die zwei Tabellen verknüpfen, bewegen Sie den Mauszeiger auf die Kante, die die Tabellenknoten verbindet.
  • Wenn Sie das Diagramm für eine bessere Übersicht neu anordnen möchten, ziehen Sie die Tabellenknoten.

Beziehungstabelle verwenden

In der Beziehungstabelle werden die erkannten Beziehungen in Tabellenform aufgeführt. Jede Zeile stellt eine Beziehung zwischen zwei Tabellen dar und zeigt die Quelltabelle und -spalte sowie die Zieltabelle und -spalte. In der Spalte Quelle wird angegeben, wie die Beziehung ermittelt wurde:

  • LLM-abgeleitet Beziehungen, die von Gemini anhand von Tabellen- und Spaltennamen und -beschreibungen im gesamten Dataset abgeleitet wurden.
  • Nutzungsbasiert Beziehungen, die aus Abfragelogs extrahiert wurden und auf häufigen Verknüpfungen basieren.
  • Schemadefiniert Beziehungen, die aus vorhandenen Primär- und Fremdschlüsselzuordnungen im Tabellenschema abgeleitet wurden.

Sie können die Beziehungen nach einer bestimmten Tabelle filtern oder Feedback zur Qualität der erkannten Beziehungen geben. Klicken Sie auf Als JSON exportieren, um die generierte Dataset-Beschreibung und die Beziehungen in eine JSON-Datei zu exportieren.

Abfrageempfehlungen verwenden

Basierend auf den erkannten Beziehungen generiert Gemini Beispielabfragen. Dabei handelt es sich um Fragen in natürlicher Sprache mit entsprechenden SQL-Abfragen, die mehrere Tabellen im Dataset verknüpfen.

  1. Klicken Sie auf eine Frage, um eine SQL-Abfrage aufzurufen.

  2. Klicken Sie auf In Abfrage kopieren, um die Abfrage im BigQuery-Abfrageeditor zu öffnen. Anschließend können Sie die Abfrage ausführen oder ändern.

  3. Wenn Sie eine weiterführende Frage stellen möchten, klicken Sie auf Weiterführende Frage stellen. Dadurch wird ein unbenannter Data Canvas geöffnet, auf dem Sie mit Gemini chatten können, um Ihre Daten zu analysieren.

KI-Insights verwalten

Nachdem Sie Statistiken für ein Dataset generiert haben, können Sie sie in Knowledge Catalog verwalten, aktualisieren oder löschen. Weitere Informationen finden Sie unter Dataset-Statistiken verwalten.

Nächste Schritte