Sobre a criação de perfil de dados

O Knowledge Catalog (antigo Dataplex Universal Catalog) facilita a compreensão e a análise dos dados, criando automaticamente o perfil das tabelas do BigQuery e do Iceberg REST Catalog.

A criação de perfil é como receber um relatório de integridade detalhado dos seus dados. Ela fornece estatísticas importantes, como valores comuns, como os dados são distribuídos (distribuição) e quantas entradas estão ausentes (contagens nulas). Essas informações aceleram a análise.

A criação de perfil de dados recomenda regras de verificação de qualidade de dados para garantir que os dados permaneçam confiáveis.

Modelo conceitual

O Knowledge Catalog permite entender melhor o perfil dos dados criando uma verificação de perfil de dados. Uma verificação de perfil de dados é um tipo de verificação de dados do Knowledge Catalog que analisa uma tabela do BigQuery ou do Iceberg REST Catalog para gerar insights estatísticos.

O diagrama a seguir mostra como o Knowledge Catalog verifica os dados para gerar relatórios sobre características estatísticas.

Uma verificação de perfil de dados analisa os dados da tabela para gerar um relatório sobre as características estatísticas.

Uma verificação do perfil dos dados está associada a uma tabela do BigQuery ou do Iceberg REST Catalog e verifica a tabela para gerar os resultados da criação de perfil de dados. Uma verificação de perfil de dados oferece suporte a várias opções de configuração.

Opções de configuração

Esta seção descreve as opções de configuração disponíveis para executar verificações de perfil de dados.

Modos de criação de perfil

É possível escolher entre os seguintes modos de criação de perfil:

  • Padrão: esse é o modo padrão. Ele fornece um perfil abrangente e personalizável, verificando os dados com base na amostragem e nos filtros especificados. O modo padrão é adequado para análises detalhadas e monitoramento de longo prazo das características dos dados.

  • Leve (visualização): esse modo fornece verificações de perfil de baixa latência que retornam resultados em segundos. Ele é otimizado para velocidade e custo-benefício para oferecer suporte a casos de uso como os seguintes:

    • Basear as respostas do agente de IA em características de dados imediatas
    • Pré-gerar perfis de maneira econômica em escala para descoberta global de dados
    • Fornecer relatórios de integridade rápidos durante a exploração interativa de dados

    O modo leve tem as seguintes limitações:

    • Ao contrário do modo de criação de perfil padrão, não é possível modificar o escopo, os filtros ou o tamanho da amostragem em verificações leves.
    • Ele não oferece suporte a visualizações e tabelas externas do BigQuery.
  • Não estruturado (visualização): esse modo usa uma verificação de perfil de dados independente para dados não estruturados (UnstructuredDataProfileSpec) com tecnologia dos modelos Gemini da Vertex AI para analisar o conteúdo qualitativo real de arquivos não estruturados (como PDFs no Cloud Storage) usando tabelas de objetos do BigQuery. Ao contrário dos modos de criação de perfil estruturados (padrão e leve), que calculam métricas estatísticas, como contagens nulas e distribuições de valores, as verificações de perfil de dados para dados não estruturados realizam inferência semântica para extrair entidades de negócios (NodeType) e relacionamentos (EdgeType), anexar um aspecto de Graph Profile (dataplex-types.global.graph-profile) à entrada do catálogo e permitir a materialização programática de dados em tabelas ou visualizações físicas do BigQuery.

    Observação: as verificações de perfil de dados para dados não estruturados estão disponíveis na visualização pública usando apenas a API REST do Dataplex. Os fluxos de trabalho do Google Cloud console e da Google Cloud CLI não são compatíveis.

    Para mais informações, consulte Sobre insights de dados não estruturados, Usar a verificação de descoberta para dados não estruturados (para verificações de descoberta do Cloud Storage) e Usar o perfil dos dados para dados não estruturados (para criação de perfil de tabela de objetos independente).

Opções de programação

É possível programar uma verificação de perfil de dados com uma frequência definida ou executar a verificação sob demanda. Se um job de verificação estiver em execução por mais tempo do que o esperado, você pode cancelar o job.

Identidade de execução

Por padrão, o Knowledge Catalog usa um agente de serviço centralizado (service-PROJECT_NUMBER@gcp-sa-dataplex.iam.gserviceaccount.com) para executar verificações de perfil de dados.

Também é possível substituir essa identidade de execução padrão especificando uma conta de serviço personalizada (traga sua própria conta de serviço) ou usando suas próprias credenciais de usuário final (EUC, na sigla em inglês). Isso oferece vários benefícios:

  • Princípio do privilégio mínimo privilégio:conceda apenas as permissões exatas do Identity and Access Management (IAM) necessárias para tarefas específicas de criação de perfil de dados a uma conta de serviço dedicada, minimizando o acesso superprovisionado.
  • Controle de acesso refinado:escopo de permissões para recursos específicos, permitindo a integração com políticas de acesso no nível da linha e da coluna no BigQuery.
  • Auditoria aprimorada:atribua contas de serviço personalizadas ou credenciais de usuário a verificações específicas, tornando o rastreamento e o registro de atividades muito mais claros nos registros de auditoria.
  • Unificação de faturamento:ao usar uma identidade de execução personalizada, os custos de processamento e armazenamento são centralizados diretamente no BigQuery (ignorando as SKUs Premium do Knowledge Catalog). Isso permite aproveitar os descontos empresariais e os compromissos de slot do BigQuery.

Para instruções sobre como configurar uma identidade de execução personalizada, consulte Configurar a identidade de execução.

Requisitos de rede

Para executar uma verificação, ative o Acesso privado do Google na sub-rede VPC usada para a verificação. Se você não especificar uma sub-rede, verifique se o Acesso privado do Google está ativado na sub-rede padrão.

Escopo

Para verificações de criação de perfil padrão, é possível especificar o escopo dos dados a serem verificados:

  • Tabela completa: toda a tabela é verificada na verificação de perfil de dados. A amostragem, os filtros de linha e os filtros de coluna são aplicados a toda a tabela antes de calcular as estatísticas de criação de perfil.

  • Incremental: os dados incrementais especificados são verificados na verificação de perfil de dados. Especifique uma coluna Date ou Timestamp na tabela a ser usada como um incremento. Normalmente, essa é a coluna em que a tabela está particionada. A amostragem, os filtros de linha e os filtros de coluna são aplicados aos dados incrementais antes de calcular as estatísticas de criação de perfil.

Filtrar dados

Para verificações de criação de perfil padrão, é possível filtrar os dados a serem verificados para criação de perfil usando filtros de linha e de coluna. O uso de filtros ajuda a reduzir o tempo de execução e o custo, além de excluir dados sensíveis e desnecessários. As verificações de criação de perfil leves não oferecem suporte a filtros de coluna e de linha.

  • Filtros de linha: os filtros de linha permitem focar nos dados dentro de um período específico ou de um segmento específico, como uma região. Por exemplo, é possível filtrar dados com um carimbo de data/hora anterior a uma determinada data.

  • Filtros de coluna: os filtros de coluna permitem incluir e excluir colunas específicas da tabela para executar a verificação de perfil de dados.

Dados de amostra

Para verificações de criação de perfil padrão, é possível especificar uma porcentagem de registros dos dados para amostragem na execução de uma verificação do perfil de dados. A criação de verificações de perfil de dados em uma amostra menor de dados pode reduzir o tempo de execução e o custo da consulta de todo o conjunto de dados.

Várias verificações de perfil de dados

É possível criar várias verificações de perfil de dados de uma só vez usando o Google Cloud console. É possível selecionar até 100 tabelas de um conjunto de dados e criar uma verificação de perfil de dados para cada conjunto. Para mais informações, consulte Criar várias verificações de perfil de dados.

Exportar resultados da verificação para uma tabela do BigQuery

É possível exportar os resultados da verificação de perfil de dados para uma tabela do BigQuery para análise mais detalhada. Para personalizar os relatórios, conecte os dados da tabela do BigQuery a um painel do Looker. É possível criar um relatório agregado usando a mesma tabela de resultados em várias verificações.

Resultados da criação de perfil de dados

Os resultados da criação de perfil de dados incluem os seguintes valores:

Tipo de coluna Resultados da criação de perfil de dados
Coluna numérica
  • Porcentagem de valores nulos.
  • Porcentagem de valores únicos (distintos) aproximados.
  • Os 10 valores mais comuns na coluna. Pode ser menor que 10 se o número de valores únicos na coluna for menor que 10 (valores nulos não estão incluídos). Para cada um desses valores mais comuns, a porcentagem de ocorrência nos dados verificados na verificação atual é exibida.
  • Valores médios, desvio padrão, mínimo, quartil inferior aproximado, mediana aproximada, quartil superior aproximado e máximo.
Coluna de string
  • Porcentagem de valores nulos.
  • Porcentagem de valores únicos (distintos) aproximados.
  • Os 10 valores mais comuns na coluna, que podem ser menores que 10 se o número de valores únicos na coluna for menor que 10.
  • Comprimento médio, mínimo e máximo da string.
Outras colunas não aninhadas (data, hora, carimbo de data/hora, binário etc.)
  • Porcentagem de valores nulos.
  • Porcentagem de valores únicos (distintos) aproximados.
  • Os 10 valores mais comuns na coluna, que podem ser menores que 10 se o número de valores únicos na coluna for menor que 10.
Todas as outras colunas de tipo de dados aninhadas ou complexas (como registro, matriz, JSON) ou qualquer coluna com repetido modo.
  • Porcentagem de valores nulos.

Os resultados incluem o número de registros verificados em cada job.

Relatórios e monitoramento

É possível monitorar e analisar os resultados da criação de perfil de dados usando os seguintes relatórios e métodos:

  • Relatórios publicados com a tabela de origem nas páginas do BigQuery e do Knowledge Catalog

    Se você configurar uma verificação de perfil de dados para publicar os resultados no BigQuery e no Knowledge Catalog, poderá conferir os resultados mais recentes da verificação de perfil de dados na guia Perfil de dados da tabela de origem no BigQuery e no Knowledge Catalog. Esses resultados podem ser acessados de qualquer projeto.

    Relatórios publicados.

  • Relatório histórico por job

    Na página Criação de perfil e qualidade de dados > Verificação do perfil dos dados no Knowledge Catalog e no BigQuery, é possível conferir os relatórios detalhados dos jobs mais recentes e históricos. Isso inclui informações de perfil no nível da coluna e a configuração usada.

    Relatório histórico por job.

  • Guia "Análise"

    Na página Criação de perfil e qualidade de dados > Verificação de perfil de dados no Knowledge Catalog e no BigQuery, use a guia Análise para conferir as tendências de uma determinada estatística de uma coluna em vários jobs de perfil. Por exemplo, se você tiver uma verificação incremental, poderá conferir como a média de um valor tem evoluído ao longo do tempo.

    Guia "Análise".

  • Crie seu próprio painel ou análise

    Se você configurou uma verificação de perfil de dados para exportar resultados para uma tabela do BigQuery, poderá criar seus próprios painéis usando ferramentas como o Data Studio.

Limitações

  • É possível executar verificações de perfil de dados apenas em tabelas do BigQuery e do Iceberg REST Catalog.
  • A criação de perfil de dados é compatível com tabelas do BigQuery com todos os tipos de coluna, exceto BIGNUMERIC. Uma verificação criada para uma tabela com uma coluna BIGNUMERIC resulta em um erro de validação e não é criada.

Preços

Para mais informações sobre preços, consulte Preços do Knowledge Catalog.

A seguir