Dataset-Statistiken generieren
In diesem Dokument wird beschrieben, wie Sie Dataset-Statistiken für BigQuery-Datasets generieren. Dataset-Statistiken helfen Ihnen, Beziehungen zwischen Tabellen in einem Dataset zu verstehen, indem sie Beziehungsdiagramme und tabellenübergreifende Abfragen generieren.
Dataset-Statistiken helfen Ihnen, die Analyse von Datasets mit mehreren Tabellen zu beschleunigen, indem sie Beziehungen zwischen Tabellen automatisch erkennen und in einem Diagramm visualisieren, Beziehungen zwischen Primär- und Fremdschlüsseln identifizieren und tabellenübergreifende Beispielabfragen generieren. Das ist nützlich, um die Datenstruktur ohne Dokumentation zu verstehen, schemadefinierte, nutzungsbasierte oder KI-abgeleitete Beziehungen zwischen Tabellen zu erkennen und komplexe Abfragen zu generieren, die mehrere Tabellen verknüpfen.
Eine Übersicht über Tabellen- und Dataset-Statistiken finden Sie unter Übersicht über Datenstatistiken.
Modi zum Generieren von Dataset-Statistiken
Beim Generieren von Dataset-Statistiken bietet BigQuery zwei Modi:
| Modus | Beschreibung | Nutzung |
|---|---|---|
| Generieren und veröffentlichen |
Speichert generierte Dataset-Statistiken als Metadatenaspekte und Beziehungen in Knowledge Catalog. Sie benötigen die erforderlichen Berechtigungen, um Statistiken zu veröffentlichen. Wenn Sie Generieren und veröffentlichen verwenden, führt BigQuery Folgendes aus:
|
Verwenden Sie diesen Modus für unternehmensweite Datendokumentation, die dauerhaft gespeichert und wiederverwendbar ist, oder wenn Sie kataloggesteuerte Governance Workflows erstellen. |
| Ohne Veröffentlichung generieren |
Erstellt Dataset-Statistiken wie Beschreibungen, Fragen in natürlicher Sprache Fragen, Beziehungen und SQL-Abfragen bei Bedarf. Mit **Ohne Veröffentlichung generieren** werden keine Statistiken in Knowledge Catalog veröffentlicht. |
Verwenden Sie diesen Modus für schnelle, Ad-hoc-Analysen, um den Katalog nicht zu überladen. |
Hinweis
Datenstatistiken werden mit Gemini in BigQuery generiert. Damit Sie Statistiken generieren können, müssen Sie zuerst Gemini in BigQuery einrichten.
APIs aktivieren
Wenn Sie Datenstatistiken verwenden möchten, aktivieren Sie die folgenden APIs in Ihrem Projekt: Dataplex API, BigQuery API und Gemini for Google Cloud API.
Erforderliche Rollen zum Aktivieren von APIs
Zum Aktivieren von APIs benötigen Sie die Berechtigung serviceusage.services.enable. Wenn Sie das Projekt erstellt haben, haben Sie diese Berechtigung wahrscheinlich bereits über die Rolle „Inhaber“ (roles/owner). Andernfalls können Sie diese Berechtigung über die Rolle „Service Usage-Administrator“ (roles/serviceusage.serviceUsageAdmin) erhalten. Informationen zum Zuweisen von Rollen.
Weitere Informationen zum Aktivieren der Gemini for Google Cloud API finden Sie unter Gemini for Google Cloud API in einem Google Cloud Projektaktivieren.
Datenprofilscan ausführen
Um die Qualität der Statistiken zu verbessern, generieren Sie einen Datenprofilscan für Tabellen in Ihrem Dataset.
Erforderliche Rollen
Bitten Sie Ihren Administrator, Ihnen die folgenden IAM-Rollen zuzuweisen, um die Berechtigungen zu erhalten, die Sie zum Generieren, Verwalten und Abrufen von Dataset-Statistiken benötigen:
-
Zum Generieren, Verwalten und Abrufen von Statistiken:
- Dataplex DataScan-Bearbeiter (
roles/dataplex.dataScanEditor) oder Dataplex DataScan-Administrator (roles/dataplex.dataScanAdmin) für das Projekt - BigQuery-Datenbearbeiter (
roles/bigquery.dataEditor) für Tabellen - BigQuery-Nutzer (
roles/bigquery.user) oder BigQuery Studio-Nutzer (roles/bigquery.studioUser) für das Projekt - BigQuery-Ressourcenbetrachter (
roles/bigquery.resourceViewer) für das Projekt
- Dataplex DataScan-Bearbeiter (
-
Zum Aufrufen von Statistiken:
- Dataplex DataScan DataViewer (
roles/dataplex.dataScanDataViewer) für das Projekt - BigQuery-Datenbetrachter (
roles/bigquery.dataViewer) für das Dataset
- Dataplex DataScan DataViewer (
-
Zum Veröffentlichen von Statistiken in Knowledge Catalog:
Dataplex-Eintrags- und Eintragslinkinhaber (
roles/dataplex.entryOwner) für die Eintragsgruppe
Weitere Informationen zum Zuweisen von Rollen finden Sie unter Zugriff auf Projekte, Ordner und Organisationen verwalten.
Sie können die erforderlichen Berechtigungen auch über benutzerdefinierte Rollen oder andere vordefinierte Rollen erhalten.
Erweitern Sie den Abschnitt Erforderliche Berechtigungen , um die genauen Berechtigungen anzuzeigen, die zum Generieren von Statistiken erforderlich sind:
Erforderliche Berechtigungen
bigquery.datasets.get: Dataset-Metadaten lesenbigquery.jobs.create: Jobs erstellenbigquery.jobs.listAll: Alle Jobs im Projekt auflistenbigquery.tables.get: Tabellenmetadaten abrufenbigquery.tables.getData: Tabellendaten und -metadaten abrufendataplex.datascans.create: Datenprofilscan-Ressource erstellendataplex.datascans.get: Metadaten der Datenprofilscan-Ressource lesendataplex.datascans.getData: Ergebnisse der Datenprofilscan-Ausführung lesendataplex.datascans.run: On-Demand-Datenprofilscan ausführendataplex.entryGroups.useSchemaJoinEntryLink: Eintragslinks vom Typschema-joinverwendendataplex.entryGroups.useSchemaJoinAspect: Aspekte vom Typ „schema-join“ verwendendataplex.entryLinks.create: Eintragslinks erstellendataplex.entryLinks.update: Eintragslinks aktualisierendataplex.entryLinks.delete: Eintragslinks löschendataplex.entries.link: Einträge verknüpfendataplex.entries.update: Einträge aktualisierendataplex.entryGroups.useDescriptionsAspect: Aspekte vom Typ „description“ verwendendataplex.entryGroups.useQueriesAspect: Aspekte vom Typ „query“ verwenden
Dataset-Statistiken generieren
Console
Öffnen Sie in der Google Cloud console BigQuery Studio.
Wählen Sie im Bereich Explorer das Projekt und dann das Dataset aus, für das Sie Statistiken generieren möchten.
Klicken Sie auf den Tab Statistiken.
Klicken Sie auf Generieren und veröffentlichen , um Statistiken zu generieren und in Knowledge Catalog zu veröffentlichen.
Klicken Sie auf Ohne Veröffentlichung generieren , um Statistiken zu generieren, ohne sie in Knowledge Catalog zu veröffentlichen.
Weitere Informationen zu den Unterschieden zwischen den Generieren und veröffentlichen und Ohne Veröffentlichung generieren Modi finden Sie unter Modi zum Generieren von Dataset-Statistiken.
Wenn sich Ihr Dataset in einer Multiregion befindet, werden Sie möglicherweise aufgefordert, eine Region auszuwählen, um Statistiken zu generieren. Wählen Sie eine Region am multiregionalen Standort aus, an dem der Statistikscan erstellt wird.
Es dauert einige Minuten, bis die Statistiken erfasst werden. Die Qualität der Statistiken verbessert sich, wenn die Tabellen im Dataset Datenprofilergebnisse enthalten.
Nachdem die Statistiken generiert wurden, zeigt BigQuery eine Dataset-Beschreibung, ein Beziehungsdiagramm, eine Beziehungstabelle und tabellenübergreifende Beispielabfragen an.
REST
Verwenden Sie die Knowledge Catalog DataScans API, um Statistiken programmatisch zu generieren. Dazu müssen Sie die folgenden Schritte ausführen:
- Datenprofilscan für die Datendokumentation für das BigQuery-Dataset generieren
- Status des Datenprofilscans für die Datendokumentation prüfen
- Veröffentlichung in Knowledge Catalog prüfen
Datenprofilscan für die Datendokumentation für das BigQuery-Dataset generieren
Erstellen Sie einen Datenprofilscan für die Datendokumentation mit der
dataScans.createMethode. Optional können Sie diese Statistiken in Knowledge Catalog veröffentlichen, indem Sie den Parametercatalog_publishing_enabledauftruesetzen.Beispiel:
alias gcurl='curl -H "Authorization: Bearer $(gcloud auth print-access-token)" -H "Content-Type: application/json"' gcurl -X POST \ https://dataplex.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/\ dataScans?dataScanId=DATASCAN_ID \ -d '{ "data": { "resource": "//bigquery.googleapis.com/projects/PROJECT_ID/datasets/DATASET_ID" }, "executionSpec": { "trigger": { "onDemand": {} } }, "type": "DATA_DOCUMENTATION", "dataDocumentationSpec": { "catalog_publishing_enabled": true } }'Ersetzen Sie Folgendes:
- PROJECT_ID: die ID des Google Cloud Projekts, in dem sich das Dataset befindet
- LOCATION: die Region, in der der Datenprofilscan ausgeführt wird
- DATASCAN_ID: ein eindeutiger Name, den Sie für diesen Scan angeben
- DATASET_ID: die ID des BigQuery-Datasets, das gescannt wird
Starten Sie den Datenprofilscan-Job für die Datendokumentation mit der
dataScans.runMethode.Beispiel:
gcurl -X POST \ https://dataplex.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/\ dataScans/DATASCAN_ID:runDiese Anfrage gibt eine eindeutige Job-ID zusammen mit dem ursprünglichen Status zurück.
Status des Datenprofilscans für die Datendokumentation prüfen
Prüfen Sie mit der
dataScans.get Methode, ob der Scan-Job abgeschlossen ist.
Wenn Sie alle Ergebnisse einschließlich der Statistiken und des Veröffentlichungsstatus abrufen möchten, setzen Sie den Parameter view auf FULL.
Rufen Sie den Status des Jobs mit der Job-ID ab. Beispiel:
gcurl -X GET https://dataplex.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/dataScans/DATASCAN_ID/jobs/JOB_ID?view=FULL
Der Job ist abgeschlossen, wenn der Status entweder SUCCEEDED oder FAILURE ist.
Eine erfolgreiche Jobantwort enthält die generierten Statistiken im Feld dataDocumentationResult.
Veröffentlichung in Knowledge Catalog prüfen
Wenn catalog_publishing_enabled auf true gesetzt ist, werden die Statistiken nach Abschluss des Datenprofilscan-Jobs asynchron in Knowledge Catalog veröffentlicht. Verwenden Sie die Dataplex API, um die Aspekte des Datasets zu prüfen und so zu bestätigen, dass die Statistiken gespeichert wurden.
Während die Statistiken aus dem Datenprofilscan auf Dataset-Ebene generiert werden, werden die resultierenden Eintragslinks zwischen den Tabellen gespeichert, die sie verbinden. Verwenden Sie die
lookupEntryLinks Methode
, um diese
Beziehungen zu prüfen und die Eintragslinks abzurufen, die mit einem bestimmten Tabelleneintrag verknüpft sind.
Verwenden Sie die
entries.get Methode, um Metadaten für Ihr BigQuery-Dataset abzurufen.
Wenn Sie alle Aspekte einbeziehen möchten, setzen Sie den Parameter view auf FULL. Beispiel:
gcurl -X GET https://dataplex.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/entryGroups/@bigquery/entries/bigquery.googleapis.com/projects/DATASET_PROJECT_ID/datasets/DATASET_ID?view=FULL
Ersetzen Sie Folgendes:
- PROJECT_ID: die ID des Google Cloud Projekts, in dem der Datenprofilscan konfiguriert wurde
- LOCATION: die Region, in der sich die Eintragsgruppe befindet
- DATASET_PROJECT_ID: die ID des Google Cloud Projekts, in dem sich das BigQuery-Dataset befindet
- DATASET: die ID des BigQuery-Datasets
Wenn die Veröffentlichung in Knowledge Catalog erfolgreich ist, werden dem BigQuery-Dataset die folgenden Aspekte angehängt:
- Beschreibungen: enthält KI-generierte Beschreibungen des Datasets
- Abfragen: enthält relevante SQL-Abfragen im Zusammenhang mit dem Dataset
- Beziehungen: werden als Eintragslinks zwischen den Tabellen im Dataset gespeichert
Dataset-Beschreibung ansehen und speichern
Gemini generiert eine Beschreibung des Datasets in natürlicher Sprache, in der die Arten von Tabellen und die Geschäftsdomain zusammengefasst werden. Klicken Sie auf In Details speichern, um diese Beschreibung in den Metadaten des Datasets zu speichern.
Sie können die Beschreibung bearbeiten, bevor Sie die Details speichern.
Beziehungsdiagramm ansehen
Das Diagramm Beziehungen bietet eine visuelle Darstellung der Beziehungen zwischen den Tabellen im Dataset. Die 10 am stärksten verbundenen Tabellen werden als Knoten angezeigt, wobei Linien die Beziehungen zwischen ihnen darstellen.
- Wenn Sie Details zu einer Beziehung sehen möchten, z. B. die Spalten, die zwei Tabellen verknüpfen, bewegen Sie den Mauszeiger auf die Linie, die die Tabellenknoten verbindet.
- Wenn Sie das Diagramm neu anordnen möchten, um die Sichtbarkeit zu verbessern, ziehen Sie die Tabellenknoten.
Beziehungstabelle verwenden
In der Beziehungstabelle werden die gefundenen Beziehungen in Tabellenform aufgeführt. Jede Zeile stellt eine Beziehung zwischen zwei Tabellen dar und zeigt die Quelltabelle und -spalte sowie die Zieltabelle und -spalte. In der Spalte Quelle wird angegeben, wie die Beziehung ermittelt wurde:
- LLM-abgeleitet Beziehungen, die von Gemini anhand von Tabellen- und Spaltennamen und -beschreibungen im gesamten Dataset abgeleitet wurden.
- Nutzungsbasiert Beziehungen, die aus Abfragelogs extrahiert wurden und auf häufigen Joins basieren.
- Schemadefiniert Beziehungen, die aus vorhandenen Primär- und Fremdschlüsselzuordnungen im Tabellenschema abgeleitet wurden.
Sie können die Beziehungen nach einer bestimmten Tabelle filtern oder Feedback zur Qualität der erkannten Beziehungen geben. Klicken Sie auf Als JSON exportieren, um die generierte Dataset-Beschreibung und die Beziehungen in eine JSON-Datei zu exportieren.
Abfrageempfehlungen verwenden
Basierend auf den gefundenen Beziehungen generiert Gemini Beispielabfragen. Dabei handelt es sich um Fragen in natürlicher Sprache mit entsprechenden SQL-Abfragen, die mehrere Tabellen im Dataset verknüpfen.
Klicken Sie auf eine Frage, um eine SQL-Abfrage aufzurufen.
Klicken Sie auf In Abfrage kopieren, um die Abfrage im BigQuery-Abfrageeditor zu öffnen. Anschließend können Sie die Abfrage ausführen oder ändern.
Wenn Sie eine weiterführende Frage stellen möchten, klicken Sie auf Weiterführende Frage stellen. Dadurch wird ein unbenannter Data Canvas geöffnet, auf dem Sie mit Gemini chatten können, um Ihre Daten zu analysieren.
KI-Insights verwalten
Nachdem Sie Statistiken für ein Dataset generiert haben, können Sie sie in Knowledge Catalog verwalten, aktualisieren oder löschen. Weitere Informationen finden Sie unter Dataset-Statistiken verwalten.
Nächste Schritte
- Erfahren Sie mehr über die Übersicht über Datenstatistiken.
- Erfahren Sie, wie Sie Tabellenstatistiken generieren.
- Learn more about Data Profiling in Knowledge Catalog