Comparar tipos de tabelas

Escolher a arquitetura de tabela certa é fundamental para maximizar o desempenho, reduzir custos e garantir o acesso aos dados em todas as suas ferramentas de análise. Nesta página, explicamos os diferentes tipos de tabelas e endpoints de serviço disponíveis no Lakehouse sem bordas, ajudando você a escolher a melhor opção com base nos seus mecanismos de gravação, requisitos de leitura e necessidades de controle de gerenciamento.

Formatos de tabela por catálogo ou mecanismo

Selecione um catálogo ou mecanismo para saber mais sobre os formatos de tabela compatíveis, a configuração do metastore, os recursos de otimização de armazenamento e a interoperabilidade do mecanismo.

Catálogo de ambientes de execução do Lakehouse

O catálogo de ambientes de execução do Lakehouse gerencia tabelas do Apache Iceberg pelo endpoint do catálogo REST do Iceberg e oferece interoperabilidade de leitura e gravação perfeita em mecanismos compatíveis com o Iceberg (Spark, Flink, Trino) e o BigQuery, com suporte da interface do catálogo REST do Iceberg, padrão do setor.

Formatos de tabela compatíveis

As tabelas do Apache Iceberg V2 (GA) e V3 (prévia) são compatíveis. Não há suporte para tabelas Iceberg V1. Antes de usar tabelas V1 com o Lakehouse, faça upgrade para uma versão compatível. Para mais informações, consulte Fazer upgrade de tabelas do Iceberg V1 para V2.

Os principais recursos incluem:

  • Metastore: catálogo de ambientes de execução do Lakehouse.
  • Armazenamento: Cloud Storage.
  • Otimização de armazenamento: gerenciada por você ou, opcionalmente, pelo Google (prévia).
  • Acesso de leitura e gravação:
    • Mecanismos de código aberto: leitura e gravação (GA)
    • BigQuery: leitura/gravação (pré-lançamento)
  • Casos de uso: lakehouse aberto com armazenamento de alto desempenho e nível empresarial para análise avançada, streaming e IA.

Metastore Hive

O catálogo de ambientes de execução do Lakehouse gerencia tabelas do Apache Hive usando um endpoint do metastore do Apache Hive (HMS) otimizado para compatibilidade com o Apache Spark ExternalCatalog, permitindo que você compartilhe dados de maneira integrada entre o Apache Spark, o Apache Hive e o BigQuery. Você cria essas tabelas com mecanismos de código aberto e as armazena no Cloud Storage. Essa opção é ideal se você quiser que seu fluxo de trabalho de ETL seja gerenciado por mecanismos de código aberto sem precisar de um metastore do Hive autohospedado separado e exigir apenas acesso de leitura do BigQuery.

As tabelas gerenciadas pelo endpoint do metastore do Hive são tabelas padrão do Apache Hive e do Spark (usando Hive SerDes ou fontes de dados do Spark), não tabelas do Apache Iceberg. Para criar e gerenciar tabelas do Apache Iceberg no catálogo de tempo de execução do Lakehouse, use o endpoint do catálogo REST do Iceberg.

Os principais recursos incluem:

  • Metastore: catálogo de ambientes de execução do Lakehouse (por IMetastoreClient personalizado).
  • Armazenamento: Cloud Storage (compatível com formatos como Parquet, ORC e Avro).
  • Otimização de armazenamento: gerenciada por você ou por terceiros.
  • Acesso de leitura e gravação:
    • Mecanismos de código aberto (Spark e Hive): leitura e gravação.
    • BigQuery: somente leitura.
  • Casos de uso: migrar cargas de trabalho atuais do Spark e do Hive para um metastore sem servidor totalmente gerenciado no Google Cloud.

Formatos de tabela por produto

Use o gráfico a seguir para comparar os tipos de tabela no catálogo de tempo de execução do Lakehouse.

Lakehouse

Apache Iceberg (GA) Acesso aos dados entre nuvens (prévia) Apache Hive (pré-lançamento)
Metastore Catálogo de ambientes de execução do Lakehouse Catálogo de ambientes de execução do Lakehouse Catálogo de ambientes de execução do Lakehouse
Armazenamento Cloud Storage Cloud Storage / Amazon S3 Cloud Storage
Otimização do armazenamento Gerenciamento pelo cliente, por terceiros ou pelo Google (prévia) Gerenciada pelo cliente ou por terceiros Gerenciada pelo cliente ou por terceiros
Leitura/gravação Mecanismos de código aberto (leitura/gravação)

BigQuery (leitura/gravação [pré-lançamento])
Mecanismos de código aberto (leitura)

BigQuery (leitura)
Mecanismos de código aberto (leitura/gravação)

BigQuery (somente leitura)
Operações avançadas Nenhum Nenhum Nenhum
Controle de acesso Segurança no nível da tabela com o IAM Segurança no nível da tabela com o IAM Segurança no nível da tabela com o IAM
Casos de uso Lakehouse aberto Consulte dados em outros provedores de nuvem sem migrar arquivos ou criar pipelines de ETL complexos. Migrar cargas de trabalho atuais do Spark e do Hive para um metastore sem servidor totalmente gerenciado

Recursos da tabela Iceberg

Use a tabela a seguir para saber mais sobre os recursos oferecidos nas tabelas do Apache Iceberg no catálogo de ambientes de execução do Lakehouse.

Capacidade Suporte
Catálogo Catálogo de ambientes de execução do Lakehouse (compatível com o catálogo REST do Iceberg)
Armazenamento Cloud Storage
Acessível pelo endpoint do catálogo REST do Iceberg Sim
Interoperabilidade de leitura/gravação
Consultas de leitura do BigQuery (SELECT, BQML, funções de IA) Compatível (GA)
DML do BigQuery (INSERT, UPDATE, DELETE, MERGE) Compatível (pré-lançamento)
Leituras do mecanismo de OSS Compatível (GA)
Gravações do mecanismo OSS Compatível (GA)
Gravações de streaming do mecanismo OSS (Kafka, Spark, Dataflow com coletor de E/S do Iceberg) Compatível (GA)
Recursos gerenciados e avançados
Gerenciamento de tabelas (compactação, coleta de lixo) Compatível (pré-lançamento)
Captura de dados alterados (CDC) do BigQuery Compatível (pré-lançamento)
Viagem no tempo
Viagem no tempo (usando mecanismos de OSS) Flexível (configurado pelas propriedades da tabela)
Viagem no tempo (usando o BigQuery) Máximo de 7 dias
Histórico de snapshots e reversão para um snapshot anterior Compatível (GA)
Recursos do Knowledge Catalog
Catalogação, pesquisa e descoberta de metadados Compatível (GA)
Linhagem Compatível (GA)
Qualidade/criação de perfis de dados Compatível (GA)
Insights Compatível (GA)
Geração de descrições de colunas e tabelas com base em IA Compatível (GA)

A seguir