Die Auswahl der richtigen Tabellenarchitektur ist entscheidend, um die Leistung zu maximieren, Kosten zu senken und den Datenzugriff über Ihre Analysetools hinweg zu ermöglichen. Auf dieser Seite werden die verschiedenen Tabellentypen und Serving-Endpunkte erläutert, die in einem grenzenlosen Lakehouse verfügbar sind. So können Sie die beste Option basierend auf Ihren Schreib-Engines, Leseanforderungen und Verwaltungsanforderungen auswählen.
Tabellenformate nach Katalog oder Engine
Wählen Sie einen Katalog oder eine Engine aus, um Informationen zu den unterstützten Tabellenformaten, der Metastore-Konfiguration, den Funktionen zur Speicheroptimierung und der Interoperabilität der Engine zu erhalten.
Lakehouse-Laufzeitkatalog
Der Lakehouse-Laufzeitkatalog verwaltet Apache Iceberg-Tabellen über den Iceberg-REST-Katalogendpunkt und bietet nahtlose Lese-/Schreibinteroperabilität zwischen Iceberg-kompatiblen Engines (Spark, Flink, Trino) und BigQuery. Er basiert auf der Iceberg-REST-Katalogoberfläche, die in der Branche als Standard gilt.
Unterstützte Tabellenformate
Apache Iceberg-Tabellen der Version 2 (allgemein verfügbar) und Version 3 (Vorschau) werden unterstützt. Iceberg V1-Tabellen werden nicht unterstützt. Bevor Sie vorhandene V1-Tabellen mit Lakehouse verwenden können, müssen Sie sie auf eine unterstützte Version aktualisieren. Weitere Informationen finden Sie unter Iceberg-Tabellen der Version 1 auf Version 2 aktualisieren.
Besondere Merkmale:
- Metastore: Lakehouse-Laufzeitkatalog.
- Speicher: Cloud Storage
- Speicheroptimierung: Wird von Ihnen oder optional von Google verwaltet (Vorabversion).
- Lese- und Schreibzugriff:
- Open-Source-Engines: Lesen und Schreiben (GA)
- BigQuery: Lesen/Schreiben (Vorschau)
- Anwendungsfälle: Offenes Lakehouse mit leistungsstarkem Speicher auf Unternehmensniveau für erweiterte Analysen, Streaming und KI.
Hive-Metastore
Im Lakehouse-Laufzeitkatalog werden Apache Hive-Tabellen über einen für die ExternalCatalog-Kompatibilität mit Apache Spark optimierten Apache Hive-Metastore-Endpunkt (HMS) verwaltet. So können Sie Daten nahtlos für Apache Spark, Apache Hive und BigQuery freigeben. Sie erstellen diese Tabellen mit Open-Source-Engines und speichern sie in Cloud Storage. Diese Option ist am besten geeignet, wenn Ihr ETL-Workflow von Open-Source-Engines verwaltet werden soll, ohne dass ein separater selbst gehosteter Hive-Metastore erforderlich ist, und nur Lesezugriff von BigQuery benötigt wird.
Tabellen, die vom Hive-Metastore-Endpunkt verwaltet werden, sind Standardtabellen von Apache Hive und Spark (mit Hive SerDes oder Spark-Datenquellen), keine Apache Iceberg-Tabellen. Verwenden Sie stattdessen den Iceberg REST-Katalogendpunkt, um Apache Iceberg-Tabellen im Lakehouse-Laufzeitkatalog zu erstellen und zu verwalten.
Besondere Merkmale:
- Metastore: Lakehouse-Laufzeitkatalog (über benutzerdefiniertes
IMetastoreClient). - Speicher: Cloud Storage (mit Unterstützung für Formate wie Parquet, ORC und Avro).
- Speicheroptimierung: Wird von Ihnen oder einem Drittanbieter verwaltet.
- Lese- und Schreibzugriff:
- Open-Source-Engines (Spark und Hive): Lesen und Schreiben.
- BigQuery: schreibgeschützt.
- Anwendungsfälle: Migrieren vorhandener Spark- und Hive-Arbeitslasten zu einem vollständig verwalteten, serverlosen Metastore auf Google Cloud.
Tabellenformate nach Produkt
Im folgenden Diagramm können Sie die Tabellentypen im Lakehouse-Laufzeitkatalog vergleichen.
Lakehouse
| Apache Iceberg (GA) | Cloudübergreifender Datenzugriff (Vorschau) | Apache Hive (Vorschau) | |
|---|---|---|---|
| Metastore | Lakehouse-Laufzeitkatalog | Lakehouse-Laufzeitkatalog | Lakehouse-Laufzeitkatalog |
| Speicher | Cloud Storage | Cloud Storage / Amazon S3 | Cloud Storage |
| Speicheroptimierung | Vom Kunden, von einem Drittanbieter oder von Google verwaltet (Vorschau) | Verwaltung durch Kunden oder Drittanbieter | Verwaltung durch Kunden oder Drittanbieter |
| Lesen/Schreiben |
Open-Source-Engines (Lesen/Schreiben) BigQuery (Lesen/Schreiben [Vorschau]) |
Open-Source-Engines (Lesen) BigQuery (Lesen) |
Open-Source-Engines (Lese-/Schreibzugriff) BigQuery (nur Lesezugriff) |
| Erweiterte Vorgänge | Keine | EUR | Keine |
| Zugriffskontrolle | Sicherheit auf Tabellenebene mit IAM | Sicherheit auf Tabellenebene mit IAM | Sicherheit auf Tabellenebene mit IAM |
| Anwendungsfälle | Offenes Lakehouse | Daten bei anderen Cloud-Anbietern abfragen, ohne Dateien migrieren oder komplexe ETL-Pipelines erstellen zu müssen. | Vorhandene Spark- und Hive-Arbeitslasten zu einem vollständig verwalteten, serverlosen Metastore migrieren |
Funktionen von Iceberg-Tabellen
In der folgenden Tabelle finden Sie weitere Informationen zu den Funktionen, die in Apache Iceberg-Tabellen im Lakehouse-Laufzeitkatalog verfügbar sind.
| Funktion | Support |
|---|---|
| Katalog | Lakehouse-Laufzeitkatalog (kompatibel mit Iceberg-REST-Katalog) |
| Speicher | Cloud Storage |
| Über den Iceberg-REST-Katalogendpunkt zugänglich | Ja |
| Lese-/Schreib-Interoperabilität | |
| BigQuery-Leseabfragen (SELECT, BQML, KI-Funktionen) | Unterstützt (GA) |
| BigQuery-DML (INSERT, UPDATE, DELETE, MERGE) | Unterstützt (Vorabversion) |
| OSS-Engine-Lesevorgänge | Unterstützt (GA) |
| OSS-Engine-Schreibvorgänge | Unterstützt (GA) |
| Streaming-Schreibvorgänge für OSS-Engines (Kafka, Spark, Dataflow mit Iceberg-E/A-Senke) | Unterstützt (GA) |
| Verwaltete und erweiterte Funktionen | |
| Tabellenverwaltung (Kompaktierung, automatische Speicherbereinigung) | Unterstützt (Vorabversion) |
| Zeitreise | |
| Zeitreisen (mit OSS-Engines) | Flexibel (über Tabelleneigenschaften konfiguriert) |
| Zeitreisen (mit BigQuery) | Beschränkt auf 7 Tage |
| Snapshot-Verlauf und Rollback zu einem vorherigen Snapshot | Unterstützt (GA) |
| Funktionen des Knowledge Catalog | |
| Metadatenkatalogisierung, Suche und Ermittlung | Unterstützt (GA) |
| Lineage | Unterstützt (GA) |
| Datenqualität/Profilerstellung | Unterstützt (GA) |
| Statistiken | Unterstützt (GA) |
| KI-basierte Generierung von Spalten- und Tabellenbeschreibungen | Unterstützt (GA) |