Scegliere l'architettura di tabella giusta è fondamentale per massimizzare le prestazioni, ridurre i costi e garantire l'accesso ai dati in tutti gli strumenti di analisi. Questa pagina spiega i diversi tipi di tabelle e gli endpoint di pubblicazione disponibili in Lakehouse for Apache Iceberg, aiutandoti a scegliere l'opzione migliore in base ai motori di scrittura, ai requisiti di lettura e alle esigenze di controllo della gestione.
Formati delle tabelle per catalogo o motore
Seleziona un catalogo o un motore per scoprire i formati di tabella supportati, la configurazione del metastore, le funzionalità di ottimizzazione dell'archiviazione e l'interoperabilità del motore.
Catalogo runtime Lakehouse
Il catalogo runtime Lakehouse gestisce le tabelle Apache Iceberg tramite l'endpoint del catalogo REST Iceberg e fornisce un'interoperabilità di lettura/scrittura senza interruzioni tra i motori compatibili con Iceberg (Spark, Flink, Trino) e BigQuery, il tutto supportato dall'interfaccia del catalogo REST Iceberg standard del settore.
Formati di tabella supportati
Sono supportate le tabelle Apache Iceberg V2 (GA) e V3 (anteprima). Le tabelle Iceberg V1 non sono supportate. Prima di utilizzare le tabelle V1 esistenti con Lakehouse for Apache Iceberg, devi eseguire l'upgrade a una versione supportata. Per ulteriori informazioni, vedi Eseguire l'upgrade delle tabelle Iceberg V1 alla versione V2.
Alcuni esempi delle principali funzionalità:
- Metastore: catalogo runtime Lakehouse.
- Archiviazione: Cloud Storage.
- Ottimizzazione archiviazione: gestita da te o, facoltativamente, da Google (anteprima).
- Accesso in lettura e scrittura:
- Motori open source: lettura e scrittura (GA)
- BigQuery: lettura/scrittura (anteprima)
- Casi d'uso: lakehouse aperto con spazio di archiviazione ad alte prestazioni di livello aziendale per analisi avanzata, streaming e AI.
Metastore Hive
Il catalogo runtime Lakehouse gestisce le tabelle Apache Hive tramite
un endpoint Apache Hive Metastore (HMS) ottimizzato per la compatibilità con Apache Spark
ExternalCatalog, consentendoti di condividere facilmente i dati tra
Apache Spark, Apache Hive e BigQuery. Crea queste tabelle
dai motori open source e archiviale in Cloud Storage. Questa opzione è la migliore
se vuoi che il flusso di lavoro ETL sia gestito da motori open source senza
la necessità di un metastore Hive autogestito separato e richiedi solo l'accesso in lettura
da BigQuery.
Le tabelle gestite dall'endpoint del metastore Hive sono tabelle Apache Hive e Spark standard (che utilizzano SerDe Hive o origini dati Spark), non tabelle Apache Iceberg. Per creare e gestire le tabelle Apache Iceberg nel catalogo del runtime Lakehouse, utilizza invece l'endpoint del catalogo REST Iceberg.
Alcuni esempi delle principali funzionalità:
- Metastore: catalogo runtime Lakehouse (tramite
IMetastoreClientpersonalizzato). - Spazio di archiviazione: Cloud Storage (che supporta formati come Parquet, ORC e Avro).
- Ottimizzazione dello spazio di archiviazione: gestita da te o da una terza parte.
- Accesso in lettura e scrittura:
- Motori open source (Spark e Hive): lettura e scrittura.
- BigQuery: sola lettura.
- Casi d'uso: migrazione di carichi di lavoro Spark e Hive esistenti a un metastore serverless completamente gestito su Google Cloud.
BigQuery
BigQuery supporta tabelle gestite Apache Iceberg, tabelle native e tabelle esterne.
Tabelle gestite Apache Iceberg: si tratta di tabelle Apache Iceberg che crei e gestisci da BigQuery e che vengono archiviate in Cloud Storage. Sebbene possano essere letti da motori open source, BigQuery è il motore che gestisce i metadati e scrive al loro interno. Questa opzione è la migliore se vuoi che il tuo flusso di lavoro sia completamente gestito da BigQuery.
Tabelle native: si tratta di tabelle BigQuery native. Sono completamente gestiti e offrono le funzionalità di analisi e gestione più avanzate. Questa opzione è ideale per i carichi di lavoro non Iceberg.
Tabelle esterne: queste tabelle sono costrutti specifici di BigQuery per i dati archiviati in Cloud Storage, Amazon S3 o Azure Blob Storage. I dati e i metadati sono autogestiti e BigQuery ha solo accesso in lettura. Scegli questa opzione per i dati che vuoi gestire direttamente in un catalogo o in uno spazio di archiviazione di terze parti.
Formati delle tabelle per prodotto
Utilizza il seguente grafico per confrontare i tipi di tabelle tra il catalogo del runtime Lakehouse e BigQuery.
Lakehouse
| Apache Iceberg (GA) | Cross-cloud Lakehouse (anteprima) |
Apache Hive (anteprima) | |
|---|---|---|---|
| Metastore | Catalogo runtime Lakehouse | Catalogo runtime Lakehouse | Catalogo runtime Lakehouse |
| Spazio di archiviazione | Cloud Storage | Cloud Storage / Amazon S3 | Cloud Storage |
| Ottimizzazione dello spazio di archiviazione | Gestito dal cliente, da terze parti o da Google (anteprima) | Gestito dal cliente o da terze parti | Gestito dal cliente o da terze parti |
| Lettura/scrittura |
Motori open source (lettura/scrittura) BigQuery (lettura/scrittura [anteprima]) |
Motori open source (lettura) BigQuery (lettura) |
Motori open source (lettura/scrittura) BigQuery (sola lettura) |
| Operazioni avanzate | Nessuno | Nessuno | Nessuno |
| Casi d'uso | Open lakehouse | Esegui query sui dati di altri provider cloud senza eseguire la migrazione dei file o creare pipeline ETL complesse. | Esegui la migrazione dei carichi di lavoro Spark e Hive esistenti a un metastore serverless completamente gestito |
BigQuery
| Tabelle gestite Apache Iceberg | Tabelle esterne | Tabelle standard | |
|---|---|---|---|
| Metastore | BigQuery | Metastore esterno o self-hosting | BigQuery |
| Spazio di archiviazione | Cloud Storage | Cloud Storage / Amazon S3 / Azure | BigQuery |
| Ottimizzazione dello spazio di archiviazione | Gestita da Google | Gestito dal cliente o da terze parti | Gestita da Google |
| Lettura/scrittura |
Motori open source (sola lettura con librerie Iceberg, interoperabilità di lettura/scrittura con l'API BigQuery Storage)
BigQuery (lettura/scrittura) |
Motori open source (lettura/scrittura) BigQuery (sola lettura) |
Motori open source (interoperabilità di lettura/scrittura con
l'API BigQuery Storage) BigQuery (lettura/scrittura) |
| Operazioni avanzate | Streaming a velocità effettiva elevata con l'API BigQuery Storage Write, Change Data Capture (CDC) e transazioni multi-istruzione | Nessuno | Streaming a velocità effettiva elevata con l'API BigQuery Storage Write, Change Data Capture (CDC) e transazioni multi-istruzione |
| Casi d'uso | Lakehouse aperto con spazio di archiviazione ad alte prestazioni di livello enterprise per analisi avanzata, streaming e AI | Tabelle di gestione temporanea per i caricamenti BigQuery, tabelle legacy di sola query | Spazio di archiviazione di livello enterprise per analisi avanzate, streaming e AI |
Passaggi successivi
Scopri come gestire le tabelle Apache Iceberg.
Scopri come importare tabelle Iceberg esterne utilizzando Dataflow.