Knowledge Catalog mit BigQuery verwenden
Knowledge Catalog (früher Dataplex Universal Catalog) interagiert mit BigQuery als zentrale Ebene für Datengovernance und agentenbasierte Zugriffe für die Metadaten von BigQuery. Weitere Informationen finden Sie in der Knowledge Catalog-Übersicht.
Wie verwende ich Knowledge Catalog mit BigQuery?
Knowledge Catalog interagiert auf folgende Weise mit BigQuery.
Automatisierte Metadatenaufnahme
Knowledge Catalog ermittelt und indexiert automatisch technische Metadaten aus BigQuery-Assets. Der Support umfasst
- Asset-Typen: Datasets, Tabellen, Ansichten, Modelle, Routinen, Verbindungen und verknüpfte Datasets.
- BigQuery Sharing: Exchanges und Einträge aus BigQuery Sharing (früher Analytics Hub).
- Echtzeitaktualisierungen: Das System unterstützt die Aufnahme nahezu in Echtzeit und bietet Metadatenänderungsfeeds über Pub/Sub, um Downstream-Systeme über Schemaänderungen oder Löschungen in BigQuery zu benachrichtigen.
- Ermittlung von Dark Data: Knowledge Catalog kann unstrukturierte Dateien scannen (z. B. PDFs in Cloud Storage), Entitäten extrahieren und sie in abfragbare Assets in BigQuery umwandeln. Mit dieser Funktion können bisher nicht zugängliche „Dark Data“ für BigQuery-basierte Analysen und KI-Grundlagen verwendet werden.
Metadatendarstellung und -anreicherung
- Einträge: Jede BigQuery
Tabelle oder jedes BigQuery-Asset wird als ein Eintrag
im Katalog dargestellt, nicht die gesamte Tabelle, z. B.
project.dataset.table. - Integration der Datenqualitäts-Scorecard: Knowledge Catalog bietet für jeden Eintrag im Katalog eine Datenqualitäts-Scorecard. Neben den integrierten Knowledge Catalog-Datenprüfungen sind auch Zusicherungs-Ergebnisse aus Dataform eine Quelle für diese Scorecard (Vorabversion).
Automatisierte Metadatenanreicherung: Für Tabellen und Ansichten, die mit Dataform erstellt wurden, können Sie semantische Metadaten direkt in Ihrem Code definieren. Diese Metadaten werden nach erfolgreichem Abschluss einer Pipeline-Aktion automatisch mit Knowledge Catalog synchronisiert (Vorabversion). Die folgenden Aspekttypen werden unterstützt:
- Übersicht: Dokumentation und Zusammenfassungstext für den Eintrag.
- Allgemeine Aspekte: Semantische Metadaten-Tags für technische Details wie Tabellensystem und Typinformationen.
Informationen zum Prüfen des Status einer Metadatenaktualisierung finden Sie unter Vergangene manuelle Ausführungen ansehen.
Nachdem die Metadaten synchronisiert wurden, können Sie in Knowledge Catalog nach dem Eintrag suchen und ihn ansehen. Weitere Informationen finden Sie unter Nach Ressourcen suchen.
Metadaten auf Spaltenebene: Einzelne Spalten oder Felder werden als Pfade dargestellt. So können Sie einzelnen Feldern in einer BigQuery-Tabelle bestimmte Metadaten wie PII-Marker oder Datenqualitäts-Scores zuordnen, anstatt nur der Tabelle selbst.
Aspekte: Technische Metadaten werden mit Aspekten angereichert, die Daten um geschäftlichen Kontext ergänzen, z. B. Eigentümer, Datenqualität und Dokumentation.
Datenprodukte: Sie können verknüpfte BigQuery-Assets zu Datenprodukten zusammenfassen, z. B. E-Commerce-Geschäftsdaten, die gemeinsame Zugriffs- und Governance-Einschränkungen haben.
Datenerkennung und -suche
- Semantische Suche: Nutzer können in natürlicher Sprache nachBigQuery-Daten suchen. Das ist besonders nützlich für Data Scientists und KI-Agenten, um vertrauenswürdige Datenprodukte mit langen oder komplexen Abfragen zu finden.
- Namensübersetzung: Zur einfacheren programmatischen Suche können BigQuery-SQL-Namen oder vollständig qualifizierte Namen in Knowledge Catalog-Eintragsnamen übersetzt werden.
Agentenbasierter Zugriff und Grundlagen
- Agentenbasierter Zugriff: KI-Agenten können Knowledge Catalog-Tools über einen lokalen oder Remote-MCP-Server ermitteln und adaptiv verwenden.
- Kontext für KI-Agenten: Knowledge Catalog erstellt einen Kontextgraphen, der BigQuery-Datasets mit geschäftlicher Semantik verknüpft. So werden KI Halluzinationen reduziert, da Modelle unternehmensgenehmigte Daten verwenden.
Governance und Compliance
- Datenherkunft: Knowledge Catalog verfolgt automatisch, wie Daten in BigQuery-Tabellen einfließen und transformiert werden und wie sie aus BigQuery-Tabellen ausfließen. Diese Funktion ist entscheidend für die Prüfung sensibler Daten wie personenidentifizierbarer Informationen im gesamten Datenbestand.
- Zugriffssteuerung: Die Metadatenverwaltung ist in Identity and Access Management (IAM) und VPC Service Controls eingebunden, um sicherzustellen, dass die Ermittlung und der Zugriff auf BigQuery-Metadaten den Sicherheitsrichtlinien der Organisation entsprechen.
Hinweise zur Migration
Die Migration von Data Catalog (eingestellt) zu Knowledge Catalog umfasst mehrere Schritte. Standardmetadaten aus BigQuery (z. B. Datasets, Tabellen, Ansichten) sind automatisch in Knowledge Catalog verfügbar. Daher konzentriert sich die Migration hauptsächlich auf benutzerdefinierte Metadaten, die API-Nutzung und die Standardeinstellungen der Benutzeroberfläche.
Im Folgenden sind die wichtigsten Punkte aufgeführt, die bei der Migration zu beachten sind.
Änderung verstehen
Knowledge Catalog bietet im Vergleich zu Data Catalog erweiterte Funktionen für die Metadatenverwaltung, Governance und Ermittlung. Knowledge Catalog verwendet eine andere API (die Knowledge Catalog API) und hat ein etwas anderes Datenmodell. Knowledge Catalog verwendet beispielsweise Aspekte und Aspekttypen anstelle von Tags und Tag-Vorlagen.
Aktuelle Data Catalog-Nutzung bewerten
- Keine benutzerdefinierten Metadaten: Wenn Sie Knowledge Catalog nur für die automatische Aufnahme und Ermittlung von Standard-BigQuery Metadaten verwendet haben, ohne benutzerdefinierte Tags, Tag-Vorlagen, benutzerdefinierte Einträge oder Eintragsgruppen zu erstellen, ist die Migration unkompliziert. Sie können die Knowledge Catalog-Oberfläche sofort verwenden.
- Benutzerdefinierte Metadaten oder programmatische Verwendung: Wenn Sie benutzerdefinierte Tags oder Vorlagen, benutzerdefinierte Einträge erstellt oder die Data Catalog API, Client Bibliotheken, Google Cloud CLI-Befehle oder Terraform verwendet haben, ist eine strukturiertere Migration erforderlich.
Spezielle Hinweise zu BigQuery
- Automatische Aufnahme: Technische Metadaten aus BigQuery Assets (Datasets, Tabellen, Ansichten, Modelle und Routinen) werden weiterhin automatisch in Knowledge Catalog aufgenommen, wie es bei Dataplex Universal Catalog der Fall war.
- Richtlinien-Tags: Richtlinien-Tags, die für die BigQuery-Zugriffssteuerung auf Spaltenebene verwendet werden, sind nicht eingestellt und ihre Verwaltung bleibt in BigQuery.
- Herkunft: Die Datenherkunft für BigQuery-Vorgänge wird in Knowledge Catalog angezeigt. Weitere Informationen zur Datenherkunft finden Sie unter Datenherkunft für eine BigQuery-Tabelle nachverfolgen.
Migrationsanleitung befolgen
Informationen zum Migrieren zu Knowledge Catalog finden Sie unter Von Data Catalog auf Knowledge Catalog umstellen.
Informationen zum Aktualisieren programmatischer Workflows auf die Knowledge Catalog API finden Sie unter Data Catalog API-Methoden Knowledge Catalog zuordnen.
Nächste Schritte
Weitere Informationen zu Knowledge Catalog:
- Anwendungsfälle für Knowledge Catalog
- Häufig gestellte Fragen zu Knowledge Catalog
- Informationen zur Metadatenverwaltung in Knowledge Catalog