Interagir com dados do Lakehouse sem fronteiras no BigQuery

O Lakehouse sem fronteiras é um mecanismo de armazenamento que une Google Cloud serviços de código aberto para criar uma interface unificada para análises avançadas e IA. Ele fornece a base para criar um lakehouse aberto, gerenciado e de alto desempenho com gerenciamento de dados automatizado e governança integrada usando o Apache Iceberg.

Quando você cria uma tabela no Lakehouse, ela pode ser consultada automaticamente no BigQuery e fica visível na página do BigQuery do Google Cloud console. Os namespaces e esquemas do Lakehouse também são mapeados automaticamente para conjuntos de dados do BigQuery.

Diferenças entre os recursos do Lakehouse e outros recursos do BigQuery

Confira a seguir as principais diferenças entre o Lakehouse e os recursos padrão do BigQuery:

  • Os conjuntos de dados do Lakehouse aparecem na página do BigQuery do Google Cloud console ao lado do ícone de água.
  • Não é possível modificar os recursos do Lakehouse no BigQuery.
  • Os recursos do Lakehouse têm metadados adicionais na seção Detalhes.

Comparação de recursos da tabela Iceberg

Use a tabela a seguir para comparar os recursos entre as tabelas do Apache Iceberg gerenciadas pelo catálogo de ambiente de execução do Lakehouse e as tabelas do Apache Iceberg gerenciadas pelo BigQuery.

Capacidade Tabelas do Apache Iceberg gerenciadas pelo catálogo de ambiente de execução do Lakehouse Tabelas do Apache Iceberg gerenciadas pelo BigQuery
Catálogo Catálogo de ambiente de execução do Lakehouse (compatível com o catálogo REST do Iceberg) BigQuery
Armazenamento Cloud Storage Cloud Storage
Acessível pelo endpoint do catálogo REST do Iceberg Sim Sim, usando a federação de catálogo do BigQuery
Interoperabilidade de leitura/gravação
Consultas de leitura do BigQuery (SELECT, BQML, funções de IA) Com suporte Com suporte
DML do BigQuery (INSERT, UPDATE, DELETE, MERGE) Com suporte (pré-lançamento) Com suporte (GA)
Leituras do mecanismo OSS Com suporte (GA) Com suporte (GA) (usando a federação de catálogo do BigQuery)
Gravações do mecanismo OSS Com suporte (GA) Indisponível
Gravações de streaming do mecanismo OSS (Kafka, Spark, Dataflow com coletor de E/S do Iceberg) Com suporte (GA) Indisponível
Recursos gerenciados e avançados
Gerenciamento de tabelas (compactação, coleta de lixo) Com suporte (pré-lançamento) Com suporte (GA)
Gravações de streaming do BigQuery (API Storage Write) Indisponível Com suporte (GA)
Streaming/assinatura do Pub/Sub, streaming do Dataflow com coletor de E/S do BigQuery Indisponível Com suporte (GA)
Captura de dados alterados (CDC) do BigQuery Indisponível Com suporte (pré-lançamento particular)
Transações de várias instruções do BigQuery Indisponível Com suporte (pré-lançamento)
Recuperação de desastres gerenciada Indisponível Indisponível
Índice da Pesquisa Indisponível Indisponível
Índice de vetor (incluindo a geração automática de incorporação) Indisponível Indisponível
Viagem no tempo
Viagem no tempo (usando mecanismos OSS) Flexível (configurado pelas propriedades da tabela) Indisponível
Viagem no tempo (usando o BigQuery) Limitado a 7 dias Limitado a 7 dias
Histórico de snapshots e reversão para o snapshot anterior Com suporte Indisponível
Governança, segurança e compartilhamento
Visualizações autorizadas pelo BigQuery Indisponível Indisponível
Segurança no nível da coluna do BigQuery Indisponível Com suporte (GA)
Mascaramento de dados e tags de política do BigQuery Indisponível Com suporte (GA)
Segurança no nível da linha do BigQuery Indisponível Indisponível
Integração do Analytics Hub Indisponível Com suporte
Recursos do Knowledge Catalog
Catalogação, pesquisa e descoberta de metadados Com suporte Com suporte
Linhagem Com suporte Com suporte
Qualidade/criação de perfis de dados Com suporte Com suporte
Insights Com suporte Com suporte
Geração de descrições de colunas e tabelas com base em IA Com suporte Com suporte

Acessar dados entre nuvens

O recurso de acesso aos dados entre nuvens do Lakehouse permite consultar dados armazenados com outros provedores de nuvem diretamente do BigQuery, sem migrar arquivos ou criar pipelines ETL complexos. Para informações de configuração, consulte Consultar dados remotos.

A seguir