Scegliere l'architettura di tabella giusta è fondamentale per massimizzare il rendimento, ridurre i costi e garantire l'accesso ai dati tramite gli strumenti di analisi. Questa pagina illustra i diversi tipi di tabelle e gli endpoint di pubblicazione disponibili in Lakehouse senza limiti, aiutandoti a scegliere l'opzione migliore in base ai motori di scrittura, ai requisiti di lettura e alle esigenze di controllo della gestione.
Formati di tabella per catalogo o motore
Seleziona un catalogo o un motore per scoprire i formati di tabella supportati, la configurazione del metastore, le funzionalità di ottimizzazione dello spazio di archiviazione e l'interoperabilità del motore.
Catalogo runtime Lakehouse
Il catalogo runtime Lakehouse gestisce le tabelle Apache Iceberg tramite l'endpoint del catalogo REST Iceberg e fornisce un'interoperabilità di lettura/scrittura senza interruzioni tra i motori compatibili con Iceberg (Spark, Flink, Trino) e BigQuery, il tutto supportato dall'interfaccia del catalogo REST Iceberg standard del settore.
Formati di tabella supportati
Sono supportate le tabelle Apache Iceberg V2 (GA) e V3 (anteprima). Le tabelle Iceberg V1 non sono supportate. Prima di utilizzare le tabelle V1 esistenti con Lakehouse, devi eseguire l'upgrade a una versione supportata. Per ulteriori informazioni, vedi Eseguire l'upgrade delle tabelle Iceberg V1 a V2.
Alcuni esempi delle principali funzionalità:
- Metastore: catalogo runtime Lakehouse.
- Spazio di archiviazione: Cloud Storage.
- Ottimizzazione dello spazio di archiviazione: gestita da te o, facoltativamente, da Google (anteprima).
- Accesso in lettura e scrittura:
- Motori open source: lettura e scrittura (GA)
- BigQuery: lettura/scrittura (anteprima)
- Casi d'uso: lakehouse open con spazio di archiviazione di livello aziendale e a elevate prestazioni per analisi avanzate, streaming e AI.
Metastore Hive
Il catalogo runtime Lakehouse gestisce le tabelle Apache Hive tramite un endpoint del metastore Apache Hive (HMS) ottimizzato per la compatibilità con ExternalCatalog di Apache Spark, consentendoti di condividere senza problemi i dati tra Apache Spark, Apache Hive e BigQuery. Crea queste tabelle dai motori open source e le archivia in Cloud Storage. Questa opzione è ideale se vuoi che il flusso di lavoro ETL sia gestito da motori open source senza la necessità di un metastore Hive self-hosted separato e richiedi l'accesso in lettura solo da BigQuery.
Le tabelle gestite dall'endpoint del metastore Hive sono tabelle Apache Hive e Spark standard (che utilizzano SerDe Hive o origini dati Spark), non tabelle Apache Iceberg. Per creare e gestire le tabelle Apache Iceberg nel catalogo runtime Lakehouse, utilizza invece l'endpoint del catalogo REST Iceberg.
Alcuni esempi delle principali funzionalità:
- Metastore: catalogo runtime Lakehouse (tramite
IMetastoreClient). - Spazio di archiviazione: Cloud Storage (con formati supportati come Parquet, ORC e Avro).
- Ottimizzazione dello spazio di archiviazione: gestita da te o da una terza parte.
- Accesso in lettura e scrittura:
- Motori open source (Spark e Hive): lettura e scrittura.
- BigQuery: sola lettura.
- Casi d'uso: migrazione dei carichi di lavoro Spark e Hive esistenti a un metastore serverless completamente gestito su Google Cloud.
Formati di tabella per prodotto
Utilizza il seguente grafico per confrontare i tipi di tabelle nel catalogo runtime Lakehouse.
Lakehouse
| Apache Iceberg (GA) | Accesso ai dati cross-cloud (anteprima) | Apache Hive (anteprima) | |
|---|---|---|---|
| Metastore | Catalogo runtime Lakehouse | Catalogo runtime Lakehouse | Catalogo runtime Lakehouse |
| Spazio di archiviazione | Cloud Storage | Cloud Storage / Amazon S3 | Cloud Storage |
| Ottimizzazione dello spazio di archiviazione | Gestita dal cliente, da terze parti o da Google (anteprima) | Gestita dal cliente o da terze parti | Gestita dal cliente o da terze parti |
| Lettura/scrittura |
Motori open source (lettura/scrittura) BigQuery (lettura/scrittura [anteprima]) |
Motori open source (lettura) BigQuery (lettura) |
Motori open source (lettura/scrittura) BigQuery (sola lettura) |
| Operazioni avanzate | Nessuna | Nessuno | Nessuna |
| Controllo degli accessi | Sicurezza a livello di tabella con IAM | Sicurezza a livello di tabella con IAM | Sicurezza a livello di tabella con IAM |
| Casi d'uso | Lakehouse open | Esegui query sui dati di altri fornitori di servizi cloud senza eseguire la migrazione dei file o creare pipeline ETL complesse. | Esegui la migrazione dei carichi di lavoro Spark e Hive esistenti a un metastore serverless completamente gestito, |
Funzionalità delle tabelle Iceberg
Utilizza la tabella seguente per scoprire di più sulle funzionalità offerte nelle tabelle Apache Iceberg nel catalogo runtime Lakehouse.
| Capacità | Assistenza |
|---|---|
| Catalogo | Catalogo runtime Lakehouse (compatibile con il catalogo REST Iceberg) |
| Spazio di archiviazione | Cloud Storage |
| Accessibile tramite l'endpoint del catalogo REST Iceberg | Sì |
| Interoperabilità di lettura/scrittura | |
| Query di lettura BigQuery (SELECT, BQML, funzioni AI) | Supportato (GA) |
| DML BigQuery (INSERT, UPDATE, DELETE, MERGE) | Supportato (anteprima) |
| Letture del motore OSS | Supportato (GA) |
| Scritture del motore OSS | Supportato (GA) |
| Scritture di streaming del motore OSS (Kafka, Spark, Dataflow con sink I/O Iceberg) | Supportato (GA) |
| Funzionalità avanzate e gestite | |
| Gestione delle tabelle (compattazione, garbage collection) | Supportato (anteprima) |
| Viaggio nel tempo | |
| Viaggio nel tempo (utilizzo di motori OSS) | Flessibile (configurato tramite le proprietà della tabella) |
| Viaggio nel tempo (utilizzo di BigQuery) | Limitato a 7 giorni |
| Cronologia delle istantanee e rollback all'istantanea precedente | Supportato (GA) |
| Funzionalità di Knowledge Catalog | |
| Catalogazione, ricerca e scoperta dei metadati | Supportato (GA) |
| Tracciabilità | Supportato (GA) |
| Qualità/profilazione dei dati | Supportato (GA) |
| Insight | Supportato (GA) |
| Generazione di descrizioni di colonne e tabelle basate sull'AI | Supportato (GA) |
Passaggi successivi
Scopri come gestire le tabelle Apache Iceberg.
Scopri come importare tabelle Iceberg esterne utilizzando Dataflow.