Knowledge Catalog mit BigQuery verwenden
Knowledge Catalog (früher Dataplex Universal Catalog) interagiert mit BigQuery als zentrale Ebene für Datenverwaltung und Agentenzugriff für die Metadaten von BigQuery. Weitere Informationen finden Sie in der Übersicht zum Knowledge Catalog.
Wie verwende ich Knowledge Catalog mit BigQuery?
Knowledge Catalog interagiert auf folgende Weise mit BigQuery.
Automatisierte Metadatenaufnahme
Knowledge Catalog ermittelt und indexiert automatisch technische Metadaten aus BigQuery-Assets. Der Support umfasst
- Asset-Typen: Datasets, Tabellen, Ansichten, Modelle, Routinen, Verbindungen, verknüpfte Datasets und Diagramme (Vorschau).
- BigQuery Sharing: Datenpools und Einträge aus BigQuery Sharing (früher Analytics Hub).
- Echtzeitaktualisierungen: Das System unterstützt die Aufnahme nahezu in Echtzeit und bietet Feeds für Metadatenänderungen über Pub/Sub, um Downstream-Systeme über Schemaänderungen oder Löschvorgänge in BigQuery zu benachrichtigen.
- Dark Data-Erkennung: Knowledge Catalog kann unstrukturierte Dateien scannen (z. B. PDFs in Cloud Storage), Entitäten extrahieren und in abfragbare Assets in BigQuery konvertieren. Dadurch werden bisher nicht zugängliche „Dark Data“ für BigQuery-basierte Analysen und KI-Fundierung verfügbar.
Metadatendarstellung und ‑anreicherung
- Einträge: Jede BigQuery-Tabelle oder jedes BigQuery-Asset wird im Katalog als Eintrag und nicht als gesamte Tabelle dargestellt, z. B.
project.dataset.table. - Integration von Datenqualitäts-Scorecards: Knowledge Catalog bietet für jeden Eintrag im Katalog eine Datenqualitäts-Scorecard. Neben den integrierten Knowledge Catalog-Datenscans sind auch Assertion-Ergebnisse aus Dataform eine Quelle für diese Übersicht.
Automatisierte Metadatenanreicherung: Für Tabellen und Ansichten, die mit Dataform erstellt wurden, können Sie semantische Metadaten direkt in Ihrem Code definieren. Diese Metadaten werden nach erfolgreichem Abschluss einer Pipeline-Aktion automatisch mit dem Knowledge Catalog synchronisiert. Die folgenden Aspekttypen werden unterstützt:
- Übersicht: Dokumentation und Zusammenfassungstext für den Eintrag.
- Allgemeine Aspekte: semantische Metadatentags für technische Details wie Tabellensystem und Typinformationen.
Eine Anleitung zum Prüfen des Status eines Metadaten-Updates finden Sie unter Letzte manuelle Ausführungen ansehen.
Nachdem die Metadaten synchronisiert wurden, können Sie in Knowledge Catalog nach dem Eintrag suchen und ihn aufrufen. Weitere Informationen finden Sie unter Nach Ressourcen suchen.
Metadaten auf Spaltenebene: Einzelne Spalten oder Felder werden als Pfade dargestellt. So können Sie bestimmten Feldern in einer BigQuery-Tabelle spezifische Metadaten wie PII-Markierungen oder Datenqualitätswerte zuweisen und nicht nur der Tabelle selbst.
Aspekte: Technische Metadaten werden mit Aspekten angereichert, die Daten geschäftlichen Kontext hinzufügen, z. B. Eigentumsrechte, Datenqualität und Dokumentation.
Datenprodukte: Sie können zugehörige BigQuery-Assets in Datenprodukte packen, z. B. E-Commerce-Geschäftsdaten, die gemeinsame Zugriffs- und Governance-Einschränkungen haben.
Datenerkennung und ‑suche
- Semantische Suche: Nutzer können in natürlicher Sprache nach BigQuery-Daten suchen. Das ist besonders nützlich für Data Scientists und KI-Agenten, um vertrauenswürdige Datenprodukte mit langen oder komplexen Anfragen zu finden.
- Namensübersetzung: Für eine einfachere programmatische Suche ermöglicht das System die Übersetzung von BigQuery-SQL-Namen oder vollqualifizierten Namen in Namen von Knowledge Catalog-Einträgen.
Agentischer Zugriff und Fundierung
- Agentenzugriff: KI-Agenten können Knowledge Catalog-Tools über einen lokalen oder Remote-MCP-Server erkennen und adaptiv verwenden.
- Kontext für KI-Agenten: Im Knowledge Catalog wird ein Kontextdiagramm erstellt, in dem BigQuery-Datasets mit Unternehmenssemantik verknüpft werden. So werden KI-Halluzinationen reduziert, da Modelle unternehmensgenehmigte Daten verwenden.
Governance und Compliance
- Datenherkunft: Knowledge Catalog verfolgt automatisch, wie Daten in BigQuery-Tabellen einfließen und transformiert werden und wie sie aus BigQuery-Tabellen herausfließen und transformiert werden. Diese Funktion ist wichtig, um sensible Informationen wie personenidentifizierbare Informationen in den Daten zu prüfen.
- Zugriffssteuerung:Die Metadatenverwaltung ist in Identity and Access Management (IAM) und VPC Service Controls integriert, um sicherzustellen, dass die Ermittlung und der Zugriff auf BigQuery-Metadaten den Sicherheitsrichtlinien der Organisation entsprechen.
Hinweise zur Migration
Die Migration von Data Catalog (eingestellt) zu Knowledge Catalog umfasst mehrere Schritte. Standardmetadaten aus BigQuery (z. B. Datasets, Tabellen, Ansichten) sind automatisch in Knowledge Catalog verfügbar. Bei der Migration geht es also hauptsächlich um benutzerdefinierte Metadaten, die API-Nutzung und Standardeinstellungen der Benutzeroberfläche.
Im Folgenden sind die wichtigsten Punkte aufgeführt, die Sie bei der Migration berücksichtigen sollten.
Änderung verstehen
Knowledge Catalog bietet im Vergleich zu Data Catalog erweiterte Funktionen für die Metadatenverwaltung, Governance und Ermittlung. Knowledge Catalog verwendet eine andere API (die Knowledge Catalog API) und ein leicht abweichendes Datenmodell. So werden in Knowledge Catalog beispielsweise Aspekte und Aspekttypen anstelle von Tags und Tag-Vorlagen verwendet.
Aktuelle Nutzung des Datenkatalogs bewerten
- Keine benutzerdefinierten Metadaten: Wenn Sie Knowledge Catalog nur für die automatische Aufnahme und Erkennung von Standard-BigQuery-Metadaten verwendet haben, ohne benutzerdefinierte Tags, Tag-Vorlagen, benutzerdefinierte Einträge oder Eintragssammlungen zu erstellen, ist die Umstellung unkompliziert. Sie können die Knowledge Catalog-Oberfläche sofort verwenden.
- Benutzerdefinierte Metadaten oder programmatische Verwendung: Wenn Sie benutzerdefinierte Tags oder Vorlagen, benutzerdefinierte Einträge erstellt oder die Data Catalog API, Clientbibliotheken, Google Cloud CLI-Befehle oder Terraform verwendet haben, benötigen Sie einen strukturierteren Übergang.
Spezifische Hinweise zu BigQuery
- Automatische Aufnahme: Technische Metadaten aus BigQuery-Assets (Datasets, Tabellen, Ansichten, Modelle, Routinen und Grafiken) werden weiterhin automatisch in Knowledge Catalog aufgenommen, wie es auch bei Dataplex Universal Catalog der Fall war.
- Richtlinien-Tags: Richtlinien-Tags, die für die BigQuery-Zugriffssteuerung auf Spaltenebene verwendet werden, sind nicht eingestellt und ihre Verwaltung erfolgt weiterhin in BigQuery.
- Herkunft: Die Datenherkunft für BigQuery-Vorgänge wird im Knowledge Catalog angezeigt. Weitere Informationen zur Datenherkunft finden Sie unter Datenherkunft für eine BigQuery-Tabelle nachverfolgen.
Umstellungsleitfaden folgen
Wenn Sie zu Knowledge Catalog migrieren möchten, folgen Sie der Anleitung unter Von Data Catalog auf Knowledge Catalog umstellen.
Informationen zum Aktualisieren programmatischer Workflows auf die Knowledge Catalog API finden Sie unter Data Catalog API-Methoden Knowledge Catalog zuordnen.
Nächste Schritte
Weitere Informationen zu Knowledge Catalog:
- Anwendungsfälle für Knowledge Catalog
- FAQs zum Knowledge Catalog
- Metadatenverwaltung in Knowledge Catalog