Confrontare i tipi di tabella

La scelta dell'architettura di tabella giusta è fondamentale per massimizzare le prestazioni, ridurre i costi e garantire l'accesso ai dati in tutti gli strumenti di analisi. Questa pagina spiega i diversi tipi di tabelle e gli endpoint di pubblicazione disponibili in Lakehouse senza bordi, aiutandoti a scegliere l'opzione migliore in base ai tuoi motori di scrittura, ai requisiti di lettura e alle esigenze di controllo della gestione.

Formati delle tabelle per catalogo o motore

Seleziona un catalogo o un motore per scoprire i formati di tabella supportati, la configurazione del metastore, le funzionalità di ottimizzazione dell'archiviazione e l'interoperabilità del motore.

Catalogo runtime Lakehouse

Il catalogo runtime Lakehouse gestisce le tabelle Apache Iceberg tramite l'endpoint del catalogo REST Iceberg e fornisce un'interoperabilità di lettura/scrittura senza interruzioni tra i motori compatibili con Iceberg (Spark, Flink, Trino) e BigQuery, il tutto supportato dall'interfaccia del catalogo REST Iceberg standard di settore.

Formati di tabella supportati

Sono supportate le tabelle Apache Iceberg V2 (GA) e V3 (anteprima). Le tabelle Iceberg V1 non sono supportate. Prima di utilizzare le tabelle V1 esistenti con Lakehouse, devi eseguire l'upgrade a una versione supportata. Per ulteriori informazioni, vedi Eseguire l'upgrade delle tabelle Iceberg V1 alla versione V2.

Alcuni esempi delle principali funzionalità:

  • Metastore: catalogo runtime Lakehouse.
  • Archiviazione: Cloud Storage.
  • Ottimizzazione dello spazio di archiviazione: gestita da te o, facoltativamente, da Google (anteprima).
  • Accesso in lettura e scrittura:
    • Motori open source: lettura e scrittura (GA)
    • BigQuery: lettura/scrittura (anteprima)
  • Casi d'uso: open lakehouse con spazio di archiviazione ad alte prestazioni di livello aziendale per analisi avanzate, streaming e AI.

Metastore Hive

Il catalogo runtime Lakehouse gestisce le tabelle Apache Hive tramite un endpoint Apache Hive Metastore (HMS) ottimizzato per la compatibilità con Apache Spark ExternalCatalog, consentendoti di condividere facilmente i dati tra Apache Spark, Apache Hive e BigQuery. Crea queste tabelle da motori open source e archiviale in Cloud Storage. Questa opzione è la migliore se vuoi che il flusso di lavoro ETL venga gestito da motori open source senza la necessità di un metastore Hive self-hosted separato e richiedi solo l'accesso in lettura da BigQuery.

Le tabelle gestite dall'endpoint del metastore Hive sono tabelle Apache Hive e Spark standard (che utilizzano SerDe Hive o origini dati Spark), non tabelle Apache Iceberg. Per creare e gestire le tabelle Apache Iceberg nel catalogo del runtime Lakehouse, utilizza invece l'endpoint del catalogo REST Iceberg.

Alcuni esempi delle principali funzionalità:

  • Metastore: catalogo runtime Lakehouse (tramite IMetastoreClient personalizzato).
  • Spazio di archiviazione: Cloud Storage (che supporta formati come Parquet, ORC e Avro).
  • Ottimizzazione dello spazio di archiviazione: gestita da te o da una terza parte.
  • Accesso in lettura e scrittura:
    • Motori open source (Spark e Hive): lettura e scrittura.
    • BigQuery: sola lettura.
  • Casi d'uso: migrazione di carichi di lavoro Spark e Hive esistenti a un metastore serverless completamente gestito su Google Cloud.

Formati delle tabelle per prodotto

Utilizza il seguente grafico per confrontare i tipi di tabelle nel catalogo del runtime Lakehouse.

Lakehouse

Apache Iceberg (GA) Accesso ai dati cross-cloud (anteprima) Apache Hive (anteprima)
Metastore Catalogo runtime Lakehouse Catalogo runtime Lakehouse Catalogo runtime Lakehouse
Spazio di archiviazione Cloud Storage Cloud Storage / Amazon S3 Cloud Storage
Ottimizzazione dello spazio di archiviazione Gestito dal cliente, da terze parti o da Google (anteprima) Gestito dal cliente o da terze parti Gestito dal cliente o da terze parti
Lettura/scrittura Motori open source (lettura/scrittura)

BigQuery (lettura/scrittura [anteprima])
Motori open source (lettura)

BigQuery (lettura)
Motori open source (lettura/scrittura)

BigQuery (sola lettura)
Operazioni avanzate Nessuno Nessuno Nessuno
Controllo degli accessi Sicurezza a livello di tabella con IAM Sicurezza a livello di tabella con IAM Sicurezza a livello di tabella con IAM
Casi d'uso Open lakehouse Esegui query sui dati in altri provider cloud senza eseguire la migrazione dei file o creare pipeline ETL complesse. Esegui la migrazione dei carichi di lavoro Spark e Hive esistenti a un metastore serverless completamente gestito

Funzionalità delle tabelle Iceberg

Utilizza la tabella seguente per scoprire di più sulle funzionalità offerte nelle tabelle Apache Iceberg nel catalogo runtime Lakehouse.

Capacità Assistenza
Catalogo Catalogo runtime Lakehouse (compatibile con il catalogo REST Iceberg)
Spazio di archiviazione Cloud Storage
Accessibile tramite l'endpoint del catalogo REST Iceberg Sì
Interoperabilità di lettura/scrittura
Query di lettura BigQuery (SELECT, BQML, funzioni AI) Supportato (GA)
BigQuery DML (INSERT, UPDATE, DELETE, MERGE) Supportato (anteprima)
Letture del motore OSS Supportato (GA)
Scritture del motore OSS Supportato (GA)
Scritture di streaming del motore OSS (Kafka, Spark, Dataflow con sink I/O Iceberg) Supportato (GA)
Funzionalità gestite e avanzate
Gestione delle tabelle (compattazione, garbage collection) Supportato (anteprima)
Change Data Capture (CDC) di BigQuery Supportato (anteprima)
Viaggio nel tempo
Viaggi nel tempo (utilizzando motori OSS) Flessibile (configurato tramite le proprietà della tabella)
Time travel (utilizzo di BigQuery) Limitato a 7 giorni
Cronologia istantanee e rollback all'istantanea precedente Supportato (GA)
Funzionalità di Knowledge Catalog
Catalogazione, ricerca e scoperta dei metadati Supportato (GA)
Derivazione Supportato (GA)
Qualità/profilazione dei dati Supportato (GA)
Insight Supportato (GA)
Generazione di descrizioni di colonne e tabelle basate sull'AI Supportato (GA)

Passaggi successivi