Interagisci con i dati di Lakehouse senza confini in BigQuery

Lakehouse senza confini è un motore di archiviazione che unisce Google Cloud servizi open source per creare un'interfatta unificata per analisi avanzate e AI. Fornisce le basi per creare una lakehouse aperta, gestita e ad alte prestazioni con gestione dei dati automatizzata e governance integrata utilizzando Apache Iceberg.

Quando crei una tabella in Lakehouse, è possibile eseguire automaticamente query da BigQuery ed è visibile nella pagina BigQuery della Google Cloud console. Anche gli spazi dei nomi e gli schemi di Lakehouse vengono mappati automaticamente ai set di dati BigQuery.

Differenze tra le risorse Lakehouse e le altre risorse BigQuery

Di seguito sono riportate le principali differenze tra le risorse Lakehouse e le risorse BigQuery standard:

  • I set di dati Lakehouse vengono visualizzati nella pagina BigQuery della Google Cloud console accanto all' acqua icona.
  • Non puoi modificare le risorse Lakehouse da BigQuery.
  • Le risorse Lakehouse hanno metadati aggiuntivi nella rispettiva sezione Dettagli.

Confronto delle funzionalità delle tabelle Iceberg

Utilizza la seguente tabella per confrontare le funzionalità tra le tabelle Apache Iceberg gestite dal catalogo runtime Lakehouse e le tabelle Apache Iceberg gestite da BigQuery.

Capacità Tabelle Apache Iceberg gestite dal catalogo runtime Lakehouse Tabelle Apache Iceberg gestite da BigQuery
Catalogo Catalogo runtime Lakehouse (compatibile con il catalogo REST Iceberg) BigQuery
Spazio di archiviazione Cloud Storage Cloud Storage
Accessibile tramite l'endpoint del catalogo REST Iceberg Sì, utilizzando la federazione del catalogo BigQuery
Interoperabilità di lettura/scrittura
Query di lettura BigQuery (SELECT, BQML, funzioni AI) Supportato Supportato
DML BigQuery (INSERT, UPDATE, DELETE, MERGE) Supportato (anteprima) Supportato (GA)
Letture del motore OSS Supportato (GA) Supportato (GA) (utilizzando la federazione del catalogo BigQuery)
Scritture del motore OSS Supportato (GA) Non supportata
Scritture di streaming del motore OSS (Kafka, Spark, Dataflow con sink I/O Iceberg) Supportato (GA) Non supportata
Funzionalità gestite e avanzate
Gestione delle tabelle (compattazione, garbage collection) Supportato (anteprima) Supportato (GA)
Scritture di streaming BigQuery (API Storage Write) Non supportata Supportato (GA)
Streaming/sottoscrizione Pub/Sub, streaming Dataflow con sink I/O BigQuery Non supportata Supportato (GA)
Change Data Capture (CDC) di BigQuery Non supportata Supportato (anteprima privata)
Transazioni multi-istruzione BigQuery Non supportata Supportato (anteprima)
Ripristino di emergenza gestito Non supportata Non supportata
Indice della Ricerca Non supportata Non supportata
Indice vettoriale (inclusa la generazione automatica di embedding) Non supportata Non supportata
Viaggio nel tempo
Viaggio nel tempo (utilizzo dei motori OSS) Flessibile (configurato tramite le proprietà della tabella) Non supportata
Viaggio nel tempo (utilizzo di BigQuery) Limitato a 7 giorni Limitato a 7 giorni
Cronologia delle istantanee e rollback all'istantanea precedente Supportato Non supportata
Governance, sicurezza e condivisione
Viste autorizzate BigQuery Non supportata Non supportata
Sicurezza a livello di colonna di BigQuery Non supportata Supportato (GA)
Mascheramento dei dati e tag di policy di BigQuery Non supportata Supportato (GA)
Sicurezza a livello di riga di BigQuery Non supportata Non supportata
Integrazione di Analytics Hub Non supportata Supportato
Funzionalità di Knowledge Catalog
Catalogazione, ricerca e scoperta dei metadati Supportato Supportato
Tracciabilità Supportato Supportato
Qualità/profilazione dei dati Supportato Supportato
Insight Supportato Supportato
Generazione di descrizioni di colonne e tabelle basate sull'AI Supportato Supportato

Accedi ai dati cross-cloud

La funzionalità di accesso ai dati cross-cloud di Lakehouse ti consente di eseguire query sui dati archiviati con altri fornitori di servizi cloud direttamente da BigQuery, senza eseguire la migrazione dei file o creare pipeline ETL complesse. Per informazioni sulla configurazione, vedi Eseguire query sui dati remoti.

Passaggi successivi