Knowledge Catalog (ehemals Dataplex Universal Catalog) bietet eine einheitliche, strukturierte Plattform für die Metadatenverwaltung für Ihre verteilten Datenbestände. Technische Strukturen, geschäftlicher Kontext, Datenqualitätsmesswerte und betriebliche Beziehungen werden automatisch erkannt, indexiert und organisiert.
Durch die Organisation von Metadaten in einem flexiblen, erweiterbaren Metamodell, schafft Knowledge Catalog die strukturelle Grundlage des Active Context Graph in der Agentische Daten-Cloud von Google. Mit diesem Kontextgraphen können Datenteams Assets erkennen und verwalten, während generative KI-Agents fundierte, vertrauenswürdige geschäftliche Kontexte abrufen können.
Knowledge Catalog-Metamodell
Knowledge Catalog organisiert Metadaten über eine modulare Hierarchie von Containern, Assets, Schemas und Beziehungen:
- Container und Assets: Eintragsgruppen organisieren Einträge, die einzelne Daten-Assets und ihre Schemaspalten darstellen.
- Strukturierte Anreicherung: Aspekttypen definieren Schemas für Aspekte, die Einträgen, Spalten oder Beziehungen strukturierte Metadaten zuordnen.
- Standards und Governance: Eintragstypen definieren Vorlagen, die erforderliche Aspekte für Einträge erzwingen.
- Beziehungen: Eintragslinktypen definieren Beziehungen (Eintragslinks) die verknüpfte Einträge und Geschäftsbegriffe verbinden.
In der folgenden Tabelle wird der Unterschied zwischen vom System verwalteten Ressourcen (automatisch von Google Cloud) und benutzerdefinierten Ressourcen zusammengefasst:
| Metamodellelement | Vom System verwaltet (integriert) | Benutzerdefiniert |
|---|---|---|
| Eintragsgruppen | Pro Projekt für Google Cloud Dienste vordefiniert (z. B.
@bigquery, @spanner, @pubsub). |
Von Nutzern erstellt, um benutzerdefinierte Daten-Assets und Berechtigungen zu gruppieren und zu verwalten. |
| Einträge | Automatisch aus Google Cloud Quellen gefüllt (z. B. BigQuery-Tabellen, ‑Ansichten, ‑Datasets und ‑Modelle). | Von Nutzern erstellt, um benutzerdefinierte Datenquellen, Dateien oder Drittanbieterdatenbanken darzustellen. |
| Aspekttypen | Vordefinierte Systemvorlagen (z. B. Schema,
Overview, Contacts, DataQuality,
Lineage). |
Von Nutzern erstellt, um domainspezifische Metadatenschemas zu definieren (z. B. PII-Klassifizierung oder SLA-Stufen). |
| Aspekte | Automatisch aus Quellsystemen, Abfragelogs oder automatisierten Scans gefüllt. | Von Nutzern, Pipelines oder Agents erstellt und an Einträge, Spalten oder Eintragslinks angehängt. |
| Eintragstypen | Vordefinierte Vorlagen, die Google Cloud Ressourcentypen darstellen. | Von Nutzern definiert, um obligatorische und optionale Aspekte für benutzerdefinierte Daten-Assets anzugeben. |
| Eintragslinks | Integrierte Beziehungstypen (z. B. synonym,
definition, schema-join,
related). |
Zwischen bestimmten Einträgen oder Spalten erstellte Instanzen, um systemübergreifende Verbindungen zu modellieren. |
In den folgenden Abschnitten werden die Hauptkomponenten des Knowledge Catalog-Metamodells beschrieben.
Eintragsgruppen
Eine Eintragsgruppe (EntryGroup) ist ein regionaler Container für Einträge und Eintragslinks, der als administrative und sicherheitstechnische Grenze für die Verwaltung dieser Ressourcen dient.
Mit Eintragsgruppen können Sie Folgendes konfigurieren:
- Zugriffssteuerung für Identity and Access Management: Gewähren Sie bestimmten Teams Berechtigungen zum Ansehen oder Bearbeiten für eine Eintragsgruppe, ohne die Berechtigungen für einzelne Einträge zu ändern.
- Standort- und Projektzuordnung: Gruppieren Sie Assets nach geografischer Region und Projektinhaberschaft.
Für Google Cloud Quellen erstellt
Knowledge Catalog automatisch Systemeintragsgruppen pro Projekt (z. B. @bigquery oder
@spanner). Für benutzerdefinierte Datenquellen erstellen Sie benutzerdefinierte Eintragsgruppen.
Ein Finanzteam kann beispielsweise eine benutzerdefinierte Eintragsgruppe mit dem Namen production_finance_data erstellen, um die Zugriffsberechtigungen für alle finanzbezogenen benutzerdefinierten Einträge an einem zentralen Ort zu verwalten.
Weitere Informationen finden Sie unter Eintragsgruppen.
Einträge und Schemapfade
Ein Eintrag (Entry) stellt ein einzelnes Daten-Asset dar. Ein Eintrag kann eine strukturierte Datenbanktabelle, ein Analysemodell, eine unstrukturierte Objekttabelle oder ein benutzerdefiniertes externes Dataset darstellen.
Zu den wichtigsten Komponenten eines Eintrags gehören:
- Eintrags-ID: Ein eindeutiger Ressourcenname innerhalb der übergeordneten Eintragsgruppe.
- Eintragstyp: Die Vorlage, die die Struktur des Eintrags und die erforderlichen Aspekte definiert.
- Aspekte: Strukturierte Metadatenattribute, die an den Eintrag angehängt sind.
- Schemapfade (Spalten): Bestimmte Unterabschnitte oder Felder im Daten Asset, z. B. eine Spalte in einer BigQuery-Tabelle oder ein Feld in einem JSON-Schema.
Mit Spalten können Sie Metadaten an einzelne Felder innerhalb eines Assets anhängen. Spalten werden nicht manuell definiert, sondern automatisch gefüllt, wenn Sie einen Aspekt vom Typ schema an einen Eintrag anhängen. Sie können mit Punktnotation auf verschachtelte Felder verweisen (z. B. customer.address.postal_code).
Eine BigQuery-Tabelle mit dem Namen orders_project.sales.customer_orders wird beispielsweise als Eintrag dargestellt. Wenn Sie das Feld email_address in dieser Tabelle als sensibel kennzeichnen möchten, hängen Sie einen Klassifizierungsaspekt direkt an den Spaltenpfad email_address an.
Weitere Informationen finden Sie unter Einträge.
Aspekttypen
Ein Aspekttyp (AspectType) ist eine wiederverwendbare Schemavorlage, die die Felder, Datentypen und Validierungsregeln für einen Aspekt definiert. Jeder Aspekt ist eine Instanz eines Aspekttyps.
Aspekttypen können vom System definiert (von bereitgestellt Google Cloud) oder benutzerdefiniert (von Ihrer Organisation erstellt) sein.
Wenn Sie die metadata_template für einen benutzerdefinierten Aspekttyp definieren, können Sie die folgenden unterstützten Datentypen verwenden:
| Felddatentyp | Beschreibung | Anwendungsbeispiel |
|---|---|---|
string |
Textwert (UTF-8). | E-Mail-Adresse des Inhabers, Label zur Datenklassifizierung, Abteilungsname. |
integer / number |
Numerische Werte (Ganzzahlen oder Gleitkommazahlen). | Aufbewahrungsdauer der Daten in Tagen, SLA-Zielprozentsatz, Prioritätsrang. |
boolean |
Flag „Wahr“ oder „Falsch“. | contains_pii: true, is_certified: false. |
enum |
Eine vordefinierte Liste zulässiger Stringwerte. | Umgebung: ["DEV", "STAGING", "PROD"]. |
datetime / timestamp |
Datum und Uhrzeit im ISO 8601-Format. | Letztes Zertifizierungsdatum, Frist für die Compliance-Überprüfung. |
record |
Ein verschachteltes strukturiertes Objekt mit untergeordneten Feldern. | ContactInfo { name: string, email: string, phone: string }. |
array |
Eine Liste mit wiederholten Werten eines beliebigen primitiven Typs oder Datensatztyps. | Liste der sekundären Dateninhaber: ["user1@example.com", "user2@example.com"]. |
map |
Schlüssel/Wert-String-Paare für erweiterbare Attribute. | Benutzerdefinierte Bereitstellungs-Tags: {"cost_center": "1042", "tier": "gold"}. |
Wenn Sie beispielsweise eine wiederverwendbare Vorlage für Kontaktinformationen definieren möchten, können Sie einen Aspekttyp mit dem Namen ContactInfo mit Feldern für owner_name (string), email (string) und support_channel (string) erstellen.
Weitere Informationen finden Sie unter Aspekttypen.
Aspekte
Ein Aspekt (Aspect) ist eine Gruppe von zugehörigen Metadatenfeldern, die einem Aspekttyp entsprechen. Aspekte werden an einen Eintrag, einen Eintragspfad (Spalte) oder einen Eintragslink angehängt, um diese Ressource zu beschreiben.
Im Gegensatz zu älteren Tagging-Systemen sind Aspekte in Knowledge Catalog direkt in ihren übergeordneten Einträgen oder Eintragslinks gekapselt. So können Sie atomare Lese- und Schreibvorgänge ausführen.
Aspekte werden in mehreren Funktionen verwendet:
- Technische Struktur: Der
SchemaAspekt beschreibt Tabellenspalten, Datentypen und Beschreibungen. - Geschäftlicher Kontext: Benutzerdefinierte Aspekte beschreiben Inhaberschaft, Compliance und Lebenszyklusstatus.
- Betriebliches Vertrauen: Aspekte der Datenqualität erfassen Ergebnisse automatisierter Regelscans und Validierungswerte.
- Unstrukturierte Entitätsgraphen: Der Aspekt
GraphProfileerfasst KI-extrahierte Entitäten und Beziehungsränder aus Rohdateien.
Sie können beispielsweise eine Instanz des ContactInfo Aspekttyps mit
Werten {"owner_name": "Alex", "email": "alex@example.com"} erstellen und an den
customer_orders Eintrag anhängen.
Weitere Informationen finden Sie unter Aspekte.
Eintragstypen
Ein Eintragstyp (EntryType) ist eine Governance-Vorlage zum Erstellen benutzerdefinierter Einträge. Er erzwingt Standards für die Metadatenqualität, indem er die erforderlichen Aspekttypen festlegt, die an einen Eintrag dieses Typs angehängt werden müssen.
Wenn Sie einen Eintrag eines bestimmten Eintragstyps erstellen, prüft Knowledge Catalog, ob alle Aspekttypen, die im Eintragstyp als required gekennzeichnet sind, vorhanden und gültig sind.
Sie können beispielsweise einen Eintragstyp mit dem Namen CertifiedDataProduct erstellen, der die Aspekttypen OwnerInfo und DataRetentionPolicy als erforderlich festlegt. Jeder neue Eintrag, der mit diesem Eintragstyp erstellt wird, muss diese Aspekte enthalten, bevor Sie ihn speichern können.
Weitere Informationen finden Sie unter Eintragstypen.
Eintragslinks und Eintragslinktypen
Ein Eintragslink (EntryLink) stellt eine semantische Beziehung zwischen zwei Dateneinträgen oder zwischen bestimmten Spalten in Einträgen her. Jeder Eintragslink ist eine Instanz eines Eintragslinktyps (EntryLinkType).
Eintragslinks können gerichtet oder ungerichtet sein:
- Symmetrisch (ungerichtet): Beziehungen, bei denen beide Seiten gleichberechtigt sind
(z. B.
synonym,related, oderschema-join). - Asymmetrisch (gerichtet): Beziehungen mit einer expliziten Quelle und einem expliziten Ziel (z. B.
definition, die einen Begriff aus dem Unternehmensglossar mit einer Tabellenspalte verknüpft).
Sie können Aspekte auch direkt an Eintragslinks anhängen (außer an schema-join-Links). So können Sie die Beziehung selbst beschreiben, z. B. Join-Konfidenzwerte, Transformationsregeln oder Zuordnungsnotizen aufzeichnen.
Knowledge Catalog unterstützt die folgenden integrierten Eintragslinktypen:
synonym: Verbindet gleichwertige Geschäftskonzepte oder alternative Begriffe.related: Verbindet lose gekoppelte Assets über verschiedene Systeme hinweg.definition: Verbindet Definitionen aus dem Unternehmensglossar mit physischen Spalten oder Einträgen.schema-join: Verbindet Tabellen, die über übereinstimmende Fremdschlüssel oder Schemapfade verknüpft werden können.
Weitere Informationen finden Sie in der
EntryLinks REST-Referenz.
Geschäftsglossare und ‑begriffe
Mit einem Unternehmensglossar können Sie eine formale Geschäftstaxonomie erstellen, indem Sie Glossare, Kategorien und Geschäftsbegriffe definieren.
Mit Eintragslinks vom Typ definition oder synonym können Sie Geschäftsbegriffe direkt physischen Einträgen und Spaltenpfaden zuordnen. Wenn Nutzer oder KI-Agents mit natürlicher Sprache im Katalog suchen, löst die Suchmaschine diese Geschäftsbegriffe auf, um die richtigen physischen Daten-Assets zu finden.
Weitere Informationen finden Sie unter Geschäftsglossare verwalten.
Unterstützte Google Cloud Quellen
Knowledge Catalog nimmt automatisch Metadaten aus den folgenden Google Cloud Quellen auf. Für einige Dienste wie AlloyDB for PostgreSQL und Cloud SQL müssen Sie zuerst die Knowledge Catalog-Integration aktivieren, bevor Metadaten aufgenommen werden können:
Analyse und Lakehouse
- BigQuery-Datasets, ‑Tabellen, ‑Ansichten, ‑Modelle, ‑Routinen, ‑Verbindungen und verknüpfte Datasets
- BigQuery Sharing-Börsen und ‑Einträge (ehemals Analytics Hub)
- Dataform-Repositories und Code-Assets
- Dataproc Metastore-Dienste, ‑Datenbanken und ‑Tabellen
Iceberg REST Catalog-Tabellen (einschließlich Google Cloud Lakehouse Runtime Catalog IRC, Databricks Unity IRC, AWS Glue Data Catalog IRC und Snowflake Horizon IRC)
KI und maschinelles Lernen
- Vertex AI-Modelle, ‑Datasets, ‑Featuregruppen, ‑Featureansichten und ‑Onlineshop-Instanzen
Business Intelligence
- Looker (Google Cloud Core)-Instanzen, ‑Dashboards, ‑Dashboardelemente, ‑Looks, ‑LookML-Projekte, ‑Modelle, ‑Explores und ‑Ansichten (Vorabversion)
Datenbanken
- Bigtable-Instanzen, ‑Cluster und ‑Tabellen (einschließlich Details zur Spaltenfamilie)
- Spanner-Instanzen, ‑Datenbanken, ‑Tabellen und ‑Ansichten
Streaming und Messaging
- Pub/Sub-Themen
Unstrukturierte Daten
Betriebliche Datenbanken
- AlloyDB for PostgreSQL-Cluster, ‑Instanzen, ‑Datenbanken, ‑Schemas, ‑Tabellen und ‑Ansichten (Vorabversion). Knowledge Catalog ruft Metadaten nur aus primären AlloyDB-Instanzen, nicht aus Lesereplikaten ab. Weitere Informationen finden Sie unter AlloyDB for PostgreSQL-Ressourcen mit Knowledge Catalog verwalten.
- Cloud SQL-Instanzen, ‑Datenbanken, ‑Schemas, ‑Tabellen und ‑Ansichten. Knowledge Catalog ruft Metadaten nur aus primären Cloud SQL-Instanzen, nicht aus Lesereplikaten ab. Weitere Informationen finden Sie unter Cloud SQL-Ressourcen mit Knowledge Catalog verwalten.
Wenn Sie Metadaten aus einer Drittanbieterquelle in Knowledge Catalog importieren möchten, können Sie Knowledge Catalog-Connectors oder eine Pipeline für verwaltete Verbindungen verwenden. Weitere Informationen finden Sie unter Informationen zu Knowledge Catalog Connectors und Übersicht über verwaltete Verbindungen.
Projekt- und Standortbeschränkungen
Catalog-Ressourcen in Knowledge Catalog befinden sich in bestimmten Google Cloud Projekten und geografischen Standorten. Es gelten die folgenden Einschränkungen für den Bereich:
| Ressource | Standortregel | Projektregel |
|---|---|---|
| Einträge | Der Standort des Eintrags muss mit dem Standort des zugehörigen EntryType,
übereinstimmen oder der EntryType muss global sein. |
Kann auf globale oder projektinterne Eintragstypen verweisen. |
| Aspekte für Einträge | Der AspectType des Aspekts muss am selben Standort
wie der Eintrag gespeichert sein oder der AspectType muss global sein. |
Kann auf globale oder projektinterne Aspekttypen verweisen. |
| Eintragslinks | Der Standort des Eintragslinks muss mit dem Standort des zugehörigen EntryLinkType übereinstimmen oder
der EntryLinkType muss global sein. |
Kann Einträge verknüpfen, die sich in verschiedenen Projekten innerhalb derselben Organisation befinden. |
| Eintragstypen | Besteht aus Aspekttypen, die am selben Standort wie der Eintragstyp gespeichert sind,
oder Aspekttypen, die global sind. |
Wenn ein Eintragstyp auf benutzerdefinierte Aspekttypen verweist, müssen sich die Aspekttypen im selben Projekt und am selben Standort befinden. |
Feeds für Metadatenänderungen
Knowledge Catalog kann Ereignisse zu Metadatenänderungen in nahezu Echtzeit über Feeds für Metadatenänderungen streamen.
Ein Feed für Metadatenänderungen veröffentlicht Benachrichtigungen über das Erstellen, Aktualisieren oder Löschen von Einträgen in einem von Ihnen konfigurierten Pub/Sub-Thema. Abonnentenclients können diese Ereignisse nutzen, um betriebliche Workflows zu automatisieren, z. B. Datenqualitätsprüfungen auszulösen, wenn sich ein Schema ändert, oder nachgelagerte Governance-Dashboards zu aktualisieren.
Weitere Informationen finden Sie unter Feeds für Metadatenänderungen.
Preise
Knowledge Catalog verwendet die SKU für die Metadatenspeicherung, um das gespeicherte Metadatenvolumen in Rechnung zu stellen. Weitere Informationen finden Sie unter Knowledge Catalog-Preise.
Für Folgendes fallen keine Kosten an:
- Erstellen und Verwalten von Ressourcen für das Catalog-Metamodell (Eintragstypen, Aspekttypen, Eintragsgruppen, Einträge und Eintragslinks).
- API-Aufrufe und Suchanfragen, die in der Google Cloud Console ausgeführt werden.
Nächste Schritte
Tabelle Metadaten hinzufügen
Assets erkennen und einer BigQuery-Tabelle benutzerdefinierte Aspektmetadaten zuordnen.
Benutzerdefinierte Datenquellen aufnehmen
Eintragstypen definieren und benutzerdefinierte Metadaten aus externen Datenbanken und Pipelines aufnehmen.
Geschäftsglossare verwalten
Erstellen Sie eine Geschäftstaxonomie und ordnen Sie Begriffe direkt physischen Tabellen und Spalten zu.
Assets suchen und erkennen
Ressourcen in Google Cloud und benutzerdefinierten Quellen mithilfe von Suchprädikaten erkennen.
Kontext für KI-Agents abrufen
LLM-fähige Metadaten und Active Context abrufen, um generative KI-Agents zu fundieren.
Von Data Catalog umstellen
Tag-Vorlagen, benutzerdefinierte Einträge und Workflows zu Knowledge Catalog migrieren.