La scelta dell'architettura di tabella giusta è fondamentale per massimizzare le prestazioni, ridurre i costi e garantire l'accesso ai dati in tutti gli strumenti di analisi. Questa pagina spiega i diversi tipi di tabelle e gli endpoint di pubblicazione disponibili in Lakehouse senza bordi, aiutandoti a scegliere l'opzione migliore in base ai tuoi motori di scrittura, ai requisiti di lettura e alle esigenze di controllo della gestione.
Formati delle tabelle per catalogo o motore
Seleziona un catalogo o un motore per scoprire i formati di tabella supportati, la configurazione del metastore, le funzionalità di ottimizzazione dell'archiviazione e l'interoperabilità del motore.
Catalogo runtime Lakehouse
Il catalogo runtime Lakehouse gestisce le tabelle Apache Iceberg tramite l'endpoint del catalogo REST Iceberg e fornisce un'interoperabilità di lettura/scrittura senza interruzioni tra i motori compatibili con Iceberg (Spark, Flink, Trino) e BigQuery, il tutto supportato dall'interfaccia del catalogo REST Iceberg standard di settore.
Formati di tabella supportati
Sono supportate le tabelle Apache Iceberg V2 (GA) e V3 (anteprima). Le tabelle Iceberg V1 non sono supportate. Prima di utilizzare le tabelle V1 esistenti con Lakehouse, devi eseguire l'upgrade a una versione supportata. Per ulteriori informazioni, vedi Eseguire l'upgrade delle tabelle Iceberg V1 alla versione V2.
Alcuni esempi delle principali funzionalità:
- Metastore: catalogo runtime Lakehouse.
- Archiviazione: Cloud Storage.
- Ottimizzazione dello spazio di archiviazione: gestita da te o, facoltativamente, da Google (anteprima).
- Accesso in lettura e scrittura:
- Motori open source: lettura e scrittura (GA)
- BigQuery: lettura/scrittura (anteprima)
- Casi d'uso: open lakehouse con spazio di archiviazione ad alte prestazioni di livello aziendale per analisi avanzate, streaming e AI.
Metastore Hive
Il catalogo runtime Lakehouse gestisce le tabelle Apache Hive tramite
un endpoint Apache Hive Metastore (HMS) ottimizzato per la compatibilità con Apache Spark
ExternalCatalog, consentendoti di condividere facilmente i dati tra
Apache Spark, Apache Hive e BigQuery. Crea queste tabelle
da motori open source e archiviale in Cloud Storage. Questa opzione è la migliore
se vuoi che il flusso di lavoro ETL venga gestito da motori open source senza
la necessità di un metastore Hive self-hosted separato e richiedi solo l'accesso in lettura
da BigQuery.
Le tabelle gestite dall'endpoint del metastore Hive sono tabelle Apache Hive e Spark standard (che utilizzano SerDe Hive o origini dati Spark), non tabelle Apache Iceberg. Per creare e gestire le tabelle Apache Iceberg nel catalogo del runtime Lakehouse, utilizza invece l'endpoint del catalogo REST Iceberg.
Alcuni esempi delle principali funzionalità:
- Metastore: catalogo runtime Lakehouse (tramite
IMetastoreClientpersonalizzato). - Spazio di archiviazione: Cloud Storage (che supporta formati come Parquet, ORC e Avro).
- Ottimizzazione dello spazio di archiviazione: gestita da te o da una terza parte.
- Accesso in lettura e scrittura:
- Motori open source (Spark e Hive): lettura e scrittura.
- BigQuery: sola lettura.
- Casi d'uso: migrazione di carichi di lavoro Spark e Hive esistenti a un metastore serverless completamente gestito su Google Cloud.
Formati delle tabelle per prodotto
Utilizza il seguente grafico per confrontare i tipi di tabelle nel catalogo del runtime Lakehouse.
Lakehouse
| Apache Iceberg (GA) | Accesso ai dati cross-cloud (anteprima) | Apache Hive (anteprima) | |
|---|---|---|---|
| Metastore | Catalogo runtime Lakehouse | Catalogo runtime Lakehouse | Catalogo runtime Lakehouse |
| Spazio di archiviazione | Cloud Storage | Cloud Storage / Amazon S3 | Cloud Storage |
| Ottimizzazione dello spazio di archiviazione | Gestito dal cliente, da terze parti o da Google (anteprima) | Gestito dal cliente o da terze parti | Gestito dal cliente o da terze parti |
| Lettura/scrittura |
Motori open source (lettura/scrittura) BigQuery (lettura/scrittura [anteprima]) |
Motori open source (lettura) BigQuery (lettura) |
Motori open source (lettura/scrittura) BigQuery (sola lettura) |
| Operazioni avanzate | Nessuno | Nessuno | Nessuno |
| Controllo degli accessi | Sicurezza a livello di tabella con IAM | Sicurezza a livello di tabella con IAM | Sicurezza a livello di tabella con IAM |
| Casi d'uso | Open lakehouse | Esegui query sui dati in altri provider cloud senza eseguire la migrazione dei file o creare pipeline ETL complesse. | Esegui la migrazione dei carichi di lavoro Spark e Hive esistenti a un metastore serverless completamente gestito |
Funzionalità delle tabelle Iceberg
Utilizza la tabella seguente per scoprire di più sulle funzionalità offerte nelle tabelle Apache Iceberg nel catalogo runtime Lakehouse.
| Capacità | Assistenza |
|---|---|
| Catalogo | Catalogo runtime Lakehouse (compatibile con il catalogo REST Iceberg) |
| Spazio di archiviazione | Cloud Storage |
| Accessibile tramite l'endpoint del catalogo REST Iceberg | Sì |
| Interoperabilità di lettura/scrittura | |
| Query di lettura BigQuery (SELECT, BQML, funzioni AI) | Supportato (GA) |
| BigQuery DML (INSERT, UPDATE, DELETE, MERGE) | Supportato (anteprima) |
| Letture del motore OSS | Supportato (GA) |
| Scritture del motore OSS | Supportato (GA) |
| Scritture di streaming del motore OSS (Kafka, Spark, Dataflow con sink I/O Iceberg) | Supportato (GA) |
| Funzionalità gestite e avanzate | |
| Gestione delle tabelle (compattazione, garbage collection) | Supportato (anteprima) |
| Change Data Capture (CDC) di BigQuery | Supportato (anteprima) |
| Viaggio nel tempo | |
| Viaggi nel tempo (utilizzando motori OSS) | Flessibile (configurato tramite le proprietà della tabella) |
| Time travel (utilizzo di BigQuery) | Limitato a 7 giorni |
| Cronologia istantanee e rollback all'istantanea precedente | Supportato (GA) |
| Funzionalità di Knowledge Catalog | |
| Catalogazione, ricerca e scoperta dei metadati | Supportato (GA) |
| Derivazione | Supportato (GA) |
| Qualità/profilazione dei dati | Supportato (GA) |
| Insight | Supportato (GA) |
| Generazione di descrizioni di colonne e tabelle basate sull'AI | Supportato (GA) |
Passaggi successivi
Scopri come gestire le tabelle Apache Iceberg.
Scopri come importare tabelle Iceberg esterne utilizzando Dataflow.