Tabellentypen vergleichen

Die Auswahl der richtigen Tabellenarchitektur ist entscheidend, um die Leistung zu maximieren, Kosten zu senken und den Datenzugriff über Ihre Analysetools hinweg zu ermöglichen. Auf dieser Seite werden die verschiedenen Tabellentypen und Serving-Endpunkte erläutert, die in einem grenzenlosen Lakehouse verfügbar sind. So können Sie die beste Option basierend auf Ihren Schreib-Engines, Leseanforderungen und Verwaltungsanforderungen auswählen.

Tabellenformate nach Katalog oder Engine

Wählen Sie einen Katalog oder eine Engine aus, um Informationen zu den unterstützten Tabellenformaten, der Metastore-Konfiguration, den Funktionen zur Speicheroptimierung und der Interoperabilität der Engine zu erhalten.

Lakehouse-Laufzeitkatalog

Der Lakehouse-Laufzeitkatalog verwaltet Apache Iceberg-Tabellen über den Iceberg-REST-Katalogendpunkt und bietet nahtlose Lese-/Schreibinteroperabilität zwischen Iceberg-kompatiblen Engines (Spark, Flink, Trino) und BigQuery. Er basiert auf der Iceberg-REST-Katalogoberfläche, die in der Branche als Standard gilt.

Unterstützte Tabellenformate

Apache Iceberg-Tabellen der Version 2 (allgemein verfügbar) und Version 3 (Vorschau) werden unterstützt. Iceberg V1-Tabellen werden nicht unterstützt. Bevor Sie vorhandene V1-Tabellen mit Lakehouse verwenden können, müssen Sie sie auf eine unterstützte Version aktualisieren. Weitere Informationen finden Sie unter Iceberg-Tabellen der Version 1 auf Version 2 aktualisieren.

Besondere Merkmale:

  • Metastore: Lakehouse-Laufzeitkatalog.
  • Speicher: Cloud Storage
  • Speicheroptimierung: Wird von Ihnen oder optional von Google verwaltet (Vorabversion).
  • Lese- und Schreibzugriff:
    • Open-Source-Engines: Lesen und Schreiben (GA)
    • BigQuery: Lesen/Schreiben (Vorschau)
  • Anwendungsfälle: Offenes Lakehouse mit leistungsstarkem Speicher auf Unternehmensniveau für erweiterte Analysen, Streaming und KI.

Hive-Metastore

Im Lakehouse-Laufzeitkatalog werden Apache Hive-Tabellen über einen für die ExternalCatalog-Kompatibilität mit Apache Spark optimierten Apache Hive-Metastore-Endpunkt (HMS) verwaltet. So können Sie Daten nahtlos für Apache Spark, Apache Hive und BigQuery freigeben. Sie erstellen diese Tabellen mit Open-Source-Engines und speichern sie in Cloud Storage. Diese Option ist am besten geeignet, wenn Ihr ETL-Workflow von Open-Source-Engines verwaltet werden soll, ohne dass ein separater selbst gehosteter Hive-Metastore erforderlich ist, und nur Lesezugriff von BigQuery benötigt wird.

Tabellen, die vom Hive-Metastore-Endpunkt verwaltet werden, sind Standardtabellen von Apache Hive und Spark (mit Hive SerDes oder Spark-Datenquellen), keine Apache Iceberg-Tabellen. Verwenden Sie stattdessen den Iceberg REST-Katalogendpunkt, um Apache Iceberg-Tabellen im Lakehouse-Laufzeitkatalog zu erstellen und zu verwalten.

Besondere Merkmale:

  • Metastore: Lakehouse-Laufzeitkatalog (über benutzerdefiniertes IMetastoreClient).
  • Speicher: Cloud Storage (mit Unterstützung für Formate wie Parquet, ORC und Avro).
  • Speicheroptimierung: Wird von Ihnen oder einem Drittanbieter verwaltet.
  • Lese- und Schreibzugriff:
    • Open-Source-Engines (Spark und Hive): Lesen und Schreiben.
    • BigQuery: schreibgeschützt.
  • Anwendungsfälle: Migrieren vorhandener Spark- und Hive-Arbeitslasten zu einem vollständig verwalteten, serverlosen Metastore auf Google Cloud.

Tabellenformate nach Produkt

Im folgenden Diagramm können Sie die Tabellentypen im Lakehouse-Laufzeitkatalog vergleichen.

Lakehouse

Apache Iceberg (GA) Cloudübergreifender Datenzugriff (Vorschau) Apache Hive (Vorschau)
Metastore Lakehouse-Laufzeitkatalog Lakehouse-Laufzeitkatalog Lakehouse-Laufzeitkatalog
Speicher Cloud Storage Cloud Storage / Amazon S3 Cloud Storage
Speicheroptimierung Vom Kunden, von einem Drittanbieter oder von Google verwaltet (Vorschau) Verwaltung durch Kunden oder Drittanbieter Verwaltung durch Kunden oder Drittanbieter
Lesen/Schreiben Open-Source-Engines (Lesen/Schreiben)

BigQuery (Lesen/Schreiben [Vorschau])
Open-Source-Engines (Lesen)

BigQuery (Lesen)
Open-Source-Engines (Lese-/Schreibzugriff)

BigQuery (nur Lesezugriff)
Erweiterte Vorgänge Keine EUR Keine
Zugriffskontrolle Sicherheit auf Tabellenebene mit IAM Sicherheit auf Tabellenebene mit IAM Sicherheit auf Tabellenebene mit IAM
Anwendungsfälle Offenes Lakehouse Daten bei anderen Cloud-Anbietern abfragen, ohne Dateien migrieren oder komplexe ETL-Pipelines erstellen zu müssen. Vorhandene Spark- und Hive-Arbeitslasten zu einem vollständig verwalteten, serverlosen Metastore migrieren

Funktionen von Iceberg-Tabellen

In der folgenden Tabelle finden Sie weitere Informationen zu den Funktionen, die in Apache Iceberg-Tabellen im Lakehouse-Laufzeitkatalog verfügbar sind.

Funktion Support
Katalog Lakehouse-Laufzeitkatalog (kompatibel mit Iceberg-REST-Katalog)
Speicher Cloud Storage
Über den Iceberg-REST-Katalogendpunkt zugänglich Ja
Lese-/Schreib-Interoperabilität
BigQuery-Leseabfragen (SELECT, BQML, KI-Funktionen) Unterstützt (GA)
BigQuery-DML (INSERT, UPDATE, DELETE, MERGE) Unterstützt (Vorabversion)
OSS-Engine-Lesevorgänge Unterstützt (GA)
OSS-Engine-Schreibvorgänge Unterstützt (GA)
Streaming-Schreibvorgänge für OSS-Engines (Kafka, Spark, Dataflow mit Iceberg-E/A-Senke) Unterstützt (GA)
Verwaltete und erweiterte Funktionen
Tabellenverwaltung (Kompaktierung, automatische Speicherbereinigung) Unterstützt (Vorabversion)
Zeitreise
Zeitreisen (mit OSS-Engines) Flexibel (über Tabelleneigenschaften konfiguriert)
Zeitreisen (mit BigQuery) Beschränkt auf 7 Tage
Snapshot-Verlauf und Rollback zu einem vorherigen Snapshot Unterstützt (GA)
Funktionen des Knowledge Catalog
Metadatenkatalogisierung, Suche und Ermittlung Unterstützt (GA)
Lineage Unterstützt (GA)
Datenqualität/Profilerstellung Unterstützt (GA)
Statistiken Unterstützt (GA)
KI-basierte Generierung von Spalten- und Tabellenbeschreibungen Unterstützt (GA)

Nächste Schritte