Informazioni sui cataloghi Hive nel catalogo runtime Lakehouse

Il catalogo runtime Lakehouse è un metastore serverless e unificato che semplifica la gestione dei metastore Hive autogestiti. Questo singolo livello di metadati completamente gestito elimina la necessità di archivi di metadati separati per i carichi di lavoro open source. Ti consente di condividere facilmente i dati tra Apache Spark, Apache Hive e BigQuery.

Ottimizzata per la compatibilità con ExternalCatalog di Apache Spark, questa integrazione supporta un sottoinsieme dell'interfaccia Hive Metastore. Per verificare se i tuoi carichi di lavoro dipendono da funzionalità non supportate come transazioni, compattazioni o Kerberos, consulta il confronto delle funzionalità e le limitazioni.

In che modo Hive si integra con il catalogo runtime Lakehouse

L'endpoint del metastore Hive gestisce le tabelle standard di Apache Hive e Spark (utilizzando le origini dati Hive SerDes o Spark) anziché le tabelle Apache Iceberg. Per semplificare la connessione dei job Spark a questo endpoint, le immagini di Managed Service for Apache Spark sono preconfigurate con le librerie client e le dipendenze necessarie.

La seguente sequenza descrive in che modo Spark si connette al metastore:

  1. Apache Spark si connette ai cataloghi di metadati esterni utilizzando l'interfaccia IMetastoreClient standard di Apache Hive.
  2. Il catalogo runtime Lakehouse implementa un IMetastoreClient personalizzato per fornire un servizio di metastore completamente gestito per i metadati di Spark e Hive.
  3. I runtime preconfigurati di Managed Service for Apache Spark utilizzano automaticamente questo client personalizzato per indirizzare le operazioni sui metadati direttamente al metastore.

Dopo la configurazione, puoi eseguire query sulle tabelle create da Spark direttamente in BigQuery. Questa integrazione supporta vari formati di archiviazione, come Parquet, ORC e Avro, insieme a mappature di tipi di dati specifici tra Spark e BigQuery.

In che modo il catalogo Hive si integra con Google Cloud i servizi

Per capire in che modo Lakehouse senza confini gestisce i tuoi dati, scopri come l'architettura del catalogo Hive si integra con i Google Cloud servizi. Anziché gestire i metastore autogestiti, i carichi di lavoro open source si connettono al catalogo runtime Lakehouse per gestire le definizioni di database e tabelle Hive, mentre i file di dati sottostanti vengono archiviati direttamente nelle directory del warehouse di Cloud Storage.

Il seguente diagramma illustra in che modo i motori di calcolo come Managed Service for Apache Spark utilizzano il catalogo runtime Lakehouse per gestire i metadati delle tabelle durante la lettura e la scrittura dei file di dati sottostanti direttamente in Hive.

Componenti di un'architettura Lakehouse, tra cui Managed Service for Apache Spark, Cloud Storage e il catalogo Apache Hive.
Diagramma dell'architettura del catalogo Hive Lakehouse.

Confronto delle funzionalità con Hive Metastore

La seguente tabella mette a confronto le entità e le operazioni in Hive Metastore e Lakehouse:

Entità o operazione Hive Metastore Catalogo runtime Lakehouse
Catalogo
Database (crea, elimina, aggiorna)
Tabella (crea, elimina, aggiorna)
Partizione (aggiungi, elimina, aggiorna)
Privilegi delle tabelle ✅ (tramite Identity and Access Management (IAM))
Privilegi delle partizioni ✅ (tramite IAM)
Funzioni definite dall'utente Non supportata
Colonne di bucket / skewing Non supportata
Statistiche delle colonne di tabelle e partizioni Non supportata
Limitazioni principali Non supportata
Token di delega (Kerberos) Non supportata
Privilegi delle colonne Non supportata
Ruoli Non supportata
Piani di risorse di Workload Manager Non supportata
Transazioni e compattazioni Non supportata

Passaggi successivi