Confrontare i tipi di tabella

Scegliere l'architettura di tabella giusta è fondamentale per massimizzare le prestazioni, ridurre i costi e garantire l'accesso ai dati in tutti gli strumenti di analisi. Questa pagina spiega i diversi tipi di tabelle e gli endpoint di pubblicazione disponibili in Lakehouse for Apache Iceberg, aiutandoti a scegliere l'opzione migliore in base ai motori di scrittura, ai requisiti di lettura e alle esigenze di controllo della gestione.

Formati delle tabelle per catalogo o motore

Seleziona un catalogo o un motore per scoprire i formati di tabella supportati, la configurazione del metastore, le funzionalità di ottimizzazione dell'archiviazione e l'interoperabilità del motore.

Catalogo runtime Lakehouse

Il catalogo runtime Lakehouse gestisce le tabelle Apache Iceberg tramite l'endpoint del catalogo REST Iceberg e fornisce un'interoperabilità di lettura/scrittura senza interruzioni tra i motori compatibili con Iceberg (Spark, Flink, Trino) e BigQuery, il tutto supportato dall'interfaccia del catalogo REST Iceberg standard del settore.

Formati di tabella supportati

Sono supportate le tabelle Apache Iceberg V2 (GA) e V3 (anteprima). Le tabelle Iceberg V1 non sono supportate. Prima di utilizzare le tabelle V1 esistenti con Lakehouse for Apache Iceberg, devi eseguire l'upgrade a una versione supportata. Per ulteriori informazioni, vedi Eseguire l'upgrade delle tabelle Iceberg V1 alla versione V2.

Alcuni esempi delle principali funzionalità:

  • Metastore: catalogo runtime Lakehouse.
  • Archiviazione: Cloud Storage.
  • Ottimizzazione archiviazione: gestita da te o, facoltativamente, da Google (anteprima).
  • Accesso in lettura e scrittura:
    • Motori open source: lettura e scrittura (GA)
    • BigQuery: lettura/scrittura (anteprima)
  • Casi d'uso: lakehouse aperto con spazio di archiviazione ad alte prestazioni di livello aziendale per analisi avanzata, streaming e AI.

Metastore Hive

Il catalogo runtime Lakehouse gestisce le tabelle Apache Hive tramite un endpoint Apache Hive Metastore (HMS) ottimizzato per la compatibilità con Apache Spark ExternalCatalog, consentendoti di condividere facilmente i dati tra Apache Spark, Apache Hive e BigQuery. Crea queste tabelle dai motori open source e archiviale in Cloud Storage. Questa opzione è la migliore se vuoi che il flusso di lavoro ETL sia gestito da motori open source senza la necessità di un metastore Hive autogestito separato e richiedi solo l'accesso in lettura da BigQuery.

Le tabelle gestite dall'endpoint del metastore Hive sono tabelle Apache Hive e Spark standard (che utilizzano SerDe Hive o origini dati Spark), non tabelle Apache Iceberg. Per creare e gestire le tabelle Apache Iceberg nel catalogo del runtime Lakehouse, utilizza invece l'endpoint del catalogo REST Iceberg.

Alcuni esempi delle principali funzionalità:

  • Metastore: catalogo runtime Lakehouse (tramite IMetastoreClient personalizzato).
  • Spazio di archiviazione: Cloud Storage (che supporta formati come Parquet, ORC e Avro).
  • Ottimizzazione dello spazio di archiviazione: gestita da te o da una terza parte.
  • Accesso in lettura e scrittura:
    • Motori open source (Spark e Hive): lettura e scrittura.
    • BigQuery: sola lettura.
  • Casi d'uso: migrazione di carichi di lavoro Spark e Hive esistenti a un metastore serverless completamente gestito su Google Cloud.

BigQuery

BigQuery supporta tabelle gestite Apache Iceberg, tabelle native e tabelle esterne.

  • Tabelle gestite Apache Iceberg: si tratta di tabelle Apache Iceberg che crei e gestisci da BigQuery e che vengono archiviate in Cloud Storage. Sebbene possano essere letti da motori open source, BigQuery è il motore che gestisce i metadati e scrive al loro interno. Questa opzione è la migliore se vuoi che il tuo flusso di lavoro sia completamente gestito da BigQuery.

  • Tabelle native: si tratta di tabelle BigQuery native. Sono completamente gestiti e offrono le funzionalità di analisi e gestione più avanzate. Questa opzione è ideale per i carichi di lavoro non Iceberg.

  • Tabelle esterne: queste tabelle sono costrutti specifici di BigQuery per i dati archiviati in Cloud Storage, Amazon S3 o Azure Blob Storage. I dati e i metadati sono autogestiti e BigQuery ha solo accesso in lettura. Scegli questa opzione per i dati che vuoi gestire direttamente in un catalogo o in uno spazio di archiviazione di terze parti.

Formati delle tabelle per prodotto

Utilizza il seguente grafico per confrontare i tipi di tabelle tra il catalogo del runtime Lakehouse e BigQuery.

Lakehouse

Apache Iceberg (GA) Cross-cloud Lakehouse (anteprima) Apache Hive (anteprima)
Metastore Catalogo runtime Lakehouse Catalogo runtime Lakehouse Catalogo runtime Lakehouse
Spazio di archiviazione Cloud Storage Cloud Storage / Amazon S3 Cloud Storage
Ottimizzazione dello spazio di archiviazione Gestito dal cliente, da terze parti o da Google (anteprima) Gestito dal cliente o da terze parti Gestito dal cliente o da terze parti
Lettura/scrittura Motori open source (lettura/scrittura)

BigQuery (lettura/scrittura [anteprima])
Motori open source (lettura)

BigQuery (lettura)
Motori open source (lettura/scrittura)

BigQuery (sola lettura)
Operazioni avanzate Nessuno Nessuno Nessuno
Casi d'uso Open lakehouse Esegui query sui dati di altri provider cloud senza eseguire la migrazione dei file o creare pipeline ETL complesse. Esegui la migrazione dei carichi di lavoro Spark e Hive esistenti a un metastore serverless completamente gestito

BigQuery

Tabelle gestite Apache Iceberg Tabelle esterne Tabelle standard
Metastore BigQuery Metastore esterno o self-hosting BigQuery
Spazio di archiviazione Cloud Storage Cloud Storage / Amazon S3 / Azure BigQuery
Ottimizzazione dello spazio di archiviazione Gestita da Google Gestito dal cliente o da terze parti Gestita da Google
Lettura/scrittura Motori open source (sola lettura con librerie Iceberg, interoperabilità di lettura/scrittura con l'API BigQuery Storage)

BigQuery (lettura/scrittura)

Motori open source (lettura/scrittura)

BigQuery (sola lettura)
Motori open source (interoperabilità di lettura/scrittura con l'API BigQuery Storage)

BigQuery (lettura/scrittura)

Operazioni avanzate Streaming a velocità effettiva elevata con l'API BigQuery Storage Write, Change Data Capture (CDC) e transazioni multi-istruzione Nessuno Streaming a velocità effettiva elevata con l'API BigQuery Storage Write, Change Data Capture (CDC) e transazioni multi-istruzione
Casi d'uso Lakehouse aperto con spazio di archiviazione ad alte prestazioni di livello enterprise per analisi avanzata, streaming e AI Tabelle di gestione temporanea per i caricamenti BigQuery, tabelle legacy di sola query Spazio di archiviazione di livello enterprise per analisi avanzate, streaming e AI

Passaggi successivi