Escolher a arquitetura de tabela certa é fundamental para maximizar o desempenho, reduzir custos e garantir o acesso aos dados em todas as suas ferramentas de análise. Nesta página, explicamos os diferentes tipos de tabelas e endpoints de serviço disponíveis no Lakehouse sem bordas, ajudando você a escolher a melhor opção com base nos seus mecanismos de gravação, requisitos de leitura e necessidades de controle de gerenciamento.
Formatos de tabela por catálogo ou mecanismo
Selecione um catálogo ou mecanismo para saber mais sobre os formatos de tabela compatíveis, a configuração do metastore, os recursos de otimização de armazenamento e a interoperabilidade do mecanismo.
Catálogo de ambientes de execução do Lakehouse
O catálogo de ambientes de execução do Lakehouse gerencia tabelas do Apache Iceberg pelo endpoint do catálogo REST do Iceberg e oferece interoperabilidade de leitura e gravação perfeita em mecanismos compatíveis com o Iceberg (Spark, Flink, Trino) e o BigQuery, com suporte da interface do catálogo REST do Iceberg, padrão do setor.
Formatos de tabela compatíveis
As tabelas do Apache Iceberg V2 (GA) e V3 (prévia) são compatíveis. Não há suporte para tabelas Iceberg V1. Antes de usar tabelas V1 com o Lakehouse, faça upgrade para uma versão compatível. Para mais informações, consulte Fazer upgrade de tabelas do Iceberg V1 para V2.
Os principais recursos incluem:
- Metastore: catálogo de ambientes de execução do Lakehouse.
- Armazenamento: Cloud Storage.
- Otimização de armazenamento: gerenciada por você ou, opcionalmente, pelo Google (prévia).
- Acesso de leitura e gravação:
- Mecanismos de código aberto: leitura e gravação (GA)
- BigQuery: leitura/gravação (pré-lançamento)
- Casos de uso: lakehouse aberto com armazenamento de alto desempenho e nível empresarial para análise avançada, streaming e IA.
Metastore Hive
O catálogo de ambientes de execução do Lakehouse gerencia tabelas do Apache Hive usando um endpoint do metastore do Apache Hive (HMS) otimizado para compatibilidade com o Apache Spark ExternalCatalog, permitindo que você compartilhe dados de maneira integrada entre o Apache Spark, o Apache Hive e o BigQuery. Você cria essas tabelas com mecanismos de código aberto e as armazena no Cloud Storage. Essa opção é ideal
se você quiser que seu fluxo de trabalho de ETL seja gerenciado por mecanismos de código aberto sem
precisar de um metastore do Hive autohospedado separado e exigir apenas acesso de leitura
do BigQuery.
As tabelas gerenciadas pelo endpoint do metastore do Hive são tabelas padrão do Apache Hive e do Spark (usando Hive SerDes ou fontes de dados do Spark), não tabelas do Apache Iceberg. Para criar e gerenciar tabelas do Apache Iceberg no catálogo de tempo de execução do Lakehouse, use o endpoint do catálogo REST do Iceberg.
Os principais recursos incluem:
- Metastore: catálogo de ambientes de execução do Lakehouse (por
IMetastoreClientpersonalizado). - Armazenamento: Cloud Storage (compatível com formatos como Parquet, ORC e Avro).
- Otimização de armazenamento: gerenciada por você ou por terceiros.
- Acesso de leitura e gravação:
- Mecanismos de código aberto (Spark e Hive): leitura e gravação.
- BigQuery: somente leitura.
- Casos de uso: migrar cargas de trabalho atuais do Spark e do Hive para um metastore sem servidor totalmente gerenciado no Google Cloud.
Formatos de tabela por produto
Use o gráfico a seguir para comparar os tipos de tabela no catálogo de tempo de execução do Lakehouse.
Lakehouse
| Apache Iceberg (GA) | Acesso aos dados entre nuvens (prévia) | Apache Hive (pré-lançamento) | |
|---|---|---|---|
| Metastore | Catálogo de ambientes de execução do Lakehouse | Catálogo de ambientes de execução do Lakehouse | Catálogo de ambientes de execução do Lakehouse |
| Armazenamento | Cloud Storage | Cloud Storage / Amazon S3 | Cloud Storage |
| Otimização do armazenamento | Gerenciamento pelo cliente, por terceiros ou pelo Google (prévia) | Gerenciada pelo cliente ou por terceiros | Gerenciada pelo cliente ou por terceiros |
| Leitura/gravação |
Mecanismos de código aberto (leitura/gravação) BigQuery (leitura/gravação [pré-lançamento]) |
Mecanismos de código aberto (leitura) BigQuery (leitura) |
Mecanismos de código aberto (leitura/gravação) BigQuery (somente leitura) |
| Operações avançadas | Nenhum | Nenhum | Nenhum |
| Controle de acesso | Segurança no nível da tabela com o IAM | Segurança no nível da tabela com o IAM | Segurança no nível da tabela com o IAM |
| Casos de uso | Lakehouse aberto | Consulte dados em outros provedores de nuvem sem migrar arquivos ou criar pipelines de ETL complexos. | Migrar cargas de trabalho atuais do Spark e do Hive para um metastore sem servidor totalmente gerenciado |
Recursos da tabela Iceberg
Use a tabela a seguir para saber mais sobre os recursos oferecidos nas tabelas do Apache Iceberg no catálogo de ambientes de execução do Lakehouse.
| Capacidade | Suporte |
|---|---|
| Catálogo | Catálogo de ambientes de execução do Lakehouse (compatível com o catálogo REST do Iceberg) |
| Armazenamento | Cloud Storage |
| Acessível pelo endpoint do catálogo REST do Iceberg | Sim |
| Interoperabilidade de leitura/gravação | |
| Consultas de leitura do BigQuery (SELECT, BQML, funções de IA) | Compatível (GA) |
| DML do BigQuery (INSERT, UPDATE, DELETE, MERGE) | Compatível (pré-lançamento) |
| Leituras do mecanismo de OSS | Compatível (GA) |
| Gravações do mecanismo OSS | Compatível (GA) |
| Gravações de streaming do mecanismo OSS (Kafka, Spark, Dataflow com coletor de E/S do Iceberg) | Compatível (GA) |
| Recursos gerenciados e avançados | |
| Gerenciamento de tabelas (compactação, coleta de lixo) | Compatível (pré-lançamento) |
| Captura de dados alterados (CDC) do BigQuery | Compatível (pré-lançamento) |
| Viagem no tempo | |
| Viagem no tempo (usando mecanismos de OSS) | Flexível (configurado pelas propriedades da tabela) |
| Viagem no tempo (usando o BigQuery) | Máximo de 7 dias |
| Histórico de snapshots e reversão para um snapshot anterior | Compatível (GA) |
| Recursos do Knowledge Catalog | |
| Catalogação, pesquisa e descoberta de metadados | Compatível (GA) |
| Linhagem | Compatível (GA) |
| Qualidade/criação de perfis de dados | Compatível (GA) |
| Insights | Compatível (GA) |
| Geração de descrições de colunas e tabelas com base em IA | Compatível (GA) |
A seguir
Saiba como gerenciar tabelas do Apache Iceberg.
Saiba como importar tabelas externas do Iceberg usando o Dataflow.