Sobre o contexto de dados no Knowledge Catalog

Em um patrimônio de dados distribuído, os dados brutos sem contexto raramente são suficientes para resolver um problema de negócios. Quando bancos de dados estruturados, registros não estruturados e métricas analíticas não têm significado comercial, os usuários e sistemas autônomos enfrentam um teto de contexto. Os analistas humanos precisam fazer a validação manual para verificar as fontes de dados, enquanto os agentes de IA geralmente geram respostas imprecisas (alucinações) ou não executam ações.

O Knowledge Catalog resolve esse problema ao fazer a transição da gestão de metadados de um catálogo passivo para um plano de controle dinâmico de contexto ativo. Ao agregar estruturas técnicas, regras de negócios e padrões de uso do mundo real, o Knowledge Catalog oferece uma camada de contexto unificada que ajuda você e seus aplicativos de IA a descobrir, avaliar e interpretar recursos de dados com precisão e segurança.

O que é contexto?

O contexto é a estrutura rica de detalhes estruturais, operacionais e semânticos que descreve um recurso de dados. Em vez de representar uma tabela como um esquema independente de nomes e tipos de dados, o contexto fornece a história completa dos seus dados.

O Knowledge Catalog organiza o contexto nas seguintes camadas:

  • Metadados técnicos. Os detalhes estruturais ingeridos diretamente dos sistemas de origem, incluindo esquemas de banco de dados, tipos de campos, chaves de particionamento e tags de segurança (como políticas do Identity and Access Management (IAM)).

  • Metadados semânticos. O significado comercial dos dados, que inclui glossários de negócios, relações de métricas, classificações, terminologia de domínio e consultas de ouro (perguntas verificadas em linguagem natural mapeadas para instruções de código SQL corretas).

  • Metadados operacionais. O comportamento e a integridade dos dados ao longo do tempo, incluindo linhagem de dados no nível da coluna, perfis de execução, estatísticas de criação de perfil e pontuações de qualidade de dados.

  • Relacionamentos. Os links inferidos ou definidos entre tabelas de armazenamento físico e indicadores comerciais conceituais.

  • Indicadores de confiança. Indicadores de verificação, como selos de propriedade e certificação, que verificam se um recurso é uma fonte confiável.

  • Orientação do agente. Descrições não estruturadas (como arquivos README, observações de uso e registros de execução) que orientam as ferramentas autônomas sobre como e quando consultar um recurso.

Ao unificar essas camadas, o Knowledge Catalog ajuda a garantir que seus dados sejam totalmente compreendidos, evitando gargalos operacionais e incertezas associadas a dados isolados e sem documentação.

Como o contexto de dados difere dos metadados

Embora os metadados forneçam os blocos de construção fundamentais, metadados e contexto não são intercambiáveis:

  • Metadados. Atributos descritivos que definem a estrutura física, a localização e as propriedades técnicas de um recurso de dados isolado (por exemplo, nomes de colunas, tipos de dados, chaves de partição e tamanhos de tabelas).
  • Context. O grafo de conhecimento multidimensional sintetizado que combina esquemas técnicos, semântica de negócios, relacionamentos de dados, comportamento operacional e indicadores de confiança para dar significado aos dados e orientar o raciocínio.

A tabela a seguir destaca as principais diferenças entre metadados passivos e contexto de dados ativos:

Dimensão Metadados técnicos Contexto de dados ativo
Foco principal Especificações físicas e formato de armazenamento. Significado comercial, comportamento operacional e relacionamentos.
Estado Passivo: armazenado em registros de catálogo para pesquisa manual por engenheiros. Ativo: enriquecido continuamente pela IA, extraído de históricos de consultas e montado dinamicamente para comandos do LLM.
Consumidores principais Mecanismos de banco de dados, engenheiros de dados e auditores de compliance. Agentes de IA, modelos de linguagem grandes (LLMs), analistas de negócios e interfaces de conversa.
Finalidade principal Gerenciamento de armazenamento, indexação e verificação de compliance. Embasamento do raciocínio do agente, resolução de junções e prevenção de alucinações.

Exemplo: metadados comparados ao contexto

Para entender como o contexto amplia os metadados técnicos, considere como o Knowledge Catalog representa uma coluna de transação:

1. Somente metadados técnicos

Os metadados técnicos fornecem informações estruturais, mas não têm lógica de negócios nem diretrizes operacionais:

  • Tabela: fact_orders
  • Coluna: disc_val
  • Tipo de dado: NUMERIC
  • Propriedades de armazenamento: particionadas por order_date

Um agente de IA que usa apenas esses metadados técnicos pode adivinhar que disc_val representa o total de descontos para clientes, mas não pode determinar se esse valor inclui tributos, reembolsos do fabricante ou cupons promocionais.

2. Contexto de dados enriquecido

O Knowledge Catalog enriquece os metadados técnicos com camadas semânticas, relacionais e operacionais em uma carga útil de contexto unificada:

  • Esquema técnico: fact_orders.disc_val (NUMERIC).
  • Definição semântica: mapeada para o termo do glossário empresarial "Desconto promocional", definido como descontos para clientes aplicados no checkout, excluindo reembolsos do fabricante e subsídios de frete.
  • Relações descobertas: vincula automaticamente fact_orders.customer_id a dim_customers.id e fact_orders.promo_id a dim_promotions.id.
  • Uso operacional: o histórico de consultas revela que 90% das consultas comerciais filtram essa tabela por status = 'COMPLETED' e a combinam com dim_promotions.
  • Confiança e qualidade: pontuação de 99,8% de validade por verificações automatizadas de qualidade de dados, com atualização de dados verificada nas últimas duas horas.
  • Consulta de ouro: inclui um modelo SQL verificado que demonstra como calcular a receita líquida reconhecida usando disc_val.

Com esse contexto completo, um agente de IA ou analista de dados pode gerar consultas e interpretar dados com precisão sem validação humana manual ou alucinações.

Os desafios de usar dados sem contexto

A maioria dos dados corporativos não tem os metadados necessários, o que dificulta a descoberta, a confiança ou a operacionalização para IA. Sem um contexto estruturado, as organizações enfrentam vários gargalos operacionais:

  • Tarefas repetitivas de colaboração. A falta de definições comerciais claras força as equipes de análise e IA a ciclos contínuos e manuais de coordenação com especialistas no assunto (SMEs, na sigla em inglês) para criar uma compreensão básica das tabelas.

  • Desvio de contexto. A documentação padrão permanece estática e decai com o tempo. Sem monitoramento contínuo, metadados desatualizados levam a pressupostos incorretos e fluxos de trabalho de agentes de IA interrompidos.

  • Falhas de raciocínio. Os agentes de IA e os modelos de linguagem grandes podem gerar consultas SQL sintaticamente corretas, mas não respeitar a lógica empresarial subjacente, resultando em cálculos incorretos do ponto de vista comercial.

  • Informações em silos. O conhecimento interno sobre como filtrar ou combinar conjuntos de dados corretamente fica preso em scripts não documentados ou configurações de painel, em vez de ser registrado em um inventário centralizado.

Para superar esses gargalos operacionais e tornar os dados úteis, as organizações precisam de um mecanismo de contexto confiável em todo o patrimônio de dados.

Principais pilares do gerenciamento de contexto

Para manter esse mecanismo de contexto confiável em toda a propriedade de dados, o Knowledge Catalog opera em três pilares:

Agregação

O Knowledge Catalog coleta automaticamente metadados de todos os seus bancos de dados integrados, catálogos REST do Iceberg e plataformas de terceiros. Ele consolida essas entradas fragmentadas em uma única zona unificada de governança, ajudando a garantir que as políticas de segurança e as definições de classificação sejam herdadas de forma consistente.

Aprimoramento

O Knowledge Catalog atualiza e organiza continuamente seu grafo de contexto usando a ingestão baseada em IA. Ao extrair registros de transações, esquemas de banco de dados e modelos de business intelligence, o Knowledge Catalog descobre automaticamente descrições de colunas e relações de tabelas. Esse aprendizado contínuo captura o conhecimento institucional dos proprietários de dados e o aplica aos seus recursos de forma dinâmica.

Pesquisa e recuperação

O Knowledge Catalog oferece uma pesquisa semântica de alta precisão que permite consultar sua propriedade de dados em linguagem natural. Como o Knowledge Catalog entende grupos de permissões (ACLs) e terminologia comercial, usuários e agentes autônomos podem localizar o contexto de dados relevante com baixa latência.

Como os metadados e o contexto são inseridos no Knowledge Catalog

Para criar um mecanismo de contexto confiável, o Knowledge Catalog ingere e organiza informações usando conectores de plataforma automatizados, enriquecimento contínuo de IA e interfaces personalizadas extensíveis.

Fontes de dados próprios e coleta automatizada

O Knowledge Catalog coleta automaticamente metadados estruturais e operacionais dos principais serviços do Google Cloud sem exigir configuração manual:

  • Bancos de dados e data warehouses analíticos. Serviços como BigQuery, Spanner, Cloud SQL e AlloyDB para PostgreSQL sincronizam continuamente metadados técnicos, incluindo esquemas de tabelas, tipos de dados de campos, chaves de particionamento, especificações de clustering e limites de conjuntos de dados.
  • Insights de dados não estruturados. Para arquivos não estruturados armazenados no Cloud Storage (como documentação em PDF ou manuais de políticas), o Knowledge Catalog executa verificações de descoberta e criação de perfil que extraem conceitos-chave e relações de entidades, gerando um perfil de gráfico e registrando tabelas de objetos estruturados no BigQuery. Para mais informações, consulte Sobre insights de dados não estruturados.
  • Sincronização semântica e de linhagem de BI pronta para uso. Para o Looker (Google Cloud core), o Knowledge Catalog sincroniza automaticamente os recursos de Business Intelligence:
    • Definições semânticas da LookML. Modelos, Análises, visualizações, dimensões e medidas.
    • Recursos do painel de BI. Dashboards, elementos de dashboards e Looks.
    • Linhagem de dados de ponta a ponta. Rastreamento de relacionamentos do fluxo de dados das tabelas do BigQuery até os painéis do Looker downstream. Para mais informações, consulte Gerenciar recursos do Looker (Google Cloud Core) com o Knowledge Catalog.
  • Integração de dados e transformações. Serviços como o Datastream capturam metadados e linhagem de stream de captura de dados alterados (CDC), o Dataform envia definições de tabelas e transformações de SQL, e o Cortex Framework publica produtos de dados registrados.

Curadoria contínua de contexto com tecnologia de IA

Além dos esquemas técnicos estáticos, o Knowledge Catalog atualiza dinamicamente o gráfico de contexto usando mecanismos de inteligência integrados:

  • Insights de dados: Com tecnologia do Gemini no BigQuery, os insights de dados extraem registros de consultas históricas, transações de usuários e padrões de esquemas para gerar descrições de colunas em linguagem natural, descobrir relações de tabelas (como chaves de junção) e propor consultas de exemplo verificadas ("consultas de ouro") que capturam a lógica empresarial. Para mais informações, consulte Sobre insights de dados para dados estruturados.
  • Criação de perfis e qualidade de dados automatizadas. As verificações calculam distribuições estatísticas (como contagens distintas, proporções de nulos e valores de amostra) e avaliam os dados em relação a verificações de qualidade de dados baseadas em regras, anexando pontuações de integridade em tempo real às entradas do catálogo. Para mais informações, consulte Sobre a qualidade de dados automática.
  • Linhagem de dados automatizada. Agrega fluxos de transformação no nível da coluna e históricos de execução de jobs em todos os seus pipelines de dados. Para mais informações, consulte Sobre a linhagem de dados.

Ingestão de metadados personalizados e sistemas de terceiros

Para organizações com bases de conhecimento personalizadas, ferramentas de governança de terceiros ou sistemas locais, o Knowledge Catalog oferece mecanismos de ingestão flexíveis:

  • APIs do Knowledge Catalog (operações CRUD). Use os métodos de API CreateEntry, UpdateEntry, CreateAspectType e SetAspect para registrar programaticamente recursos externos e anexar aspectos de metadados personalizados, como classificações de compliance ou documentação do sistema.
  • Agentes de enriquecimento personalizados. Use frameworks de agentes, como o Kit de Desenvolvimento de Agente (ADK) ou o LangChain, para criar agentes de enriquecimento personalizados. Por exemplo, um agente do ADK pode ingerir documentação técnica de wikis internos ou repositórios Git, usar um LLM para analisar e transformar em termos padronizados do glossário empresarial e anexar a entradas do catálogo. Para mais informações, consulte Criar um agente de IA para enriquecer metadados.
  • Operações de exportação e importação. Use fluxos de trabalho de exportação e importação em massa baseados em arquivos (JSON ou CSV) para analisar definições de negócios geradas por IA, colaborar com administradores de dados e atualizar metadados em lote. Para mais informações, consulte Exportar metadados.

Como o contexto é consumido em serviços próprios e de terceiros

Os serviços e aplicativos interagem com o Knowledge Catalog em duas funções distintas:

  • Provedores de metadados. Serviços que enviam metadados técnicos, esquemas, definições de LookML e linhagem para o Knowledge Catalog (por exemplo, Looker, Cloud SQL e Spanner). Os provedores de metadados inserem metadados no catálogo, mas não necessariamente consomem definições do glossário empresarial nas próprias interfaces de usuário.
  • Consumidores de contexto. Serviços, ferramentas para desenvolvedores e agentes de IA que recuperam definições de negócios, perfis operacionais e regras de governança do Knowledge Catalog para fundamentar o raciocínio e a execução.

Antes que aplicativos e agentes possam consumir contexto, é necessário estabelecer termos comerciais básicos e regras de qualidade. Para mais informações, consulte Estabelecer um contexto de dados fundamental e Criar um fluxo de trabalho de qualidade de dados de política como código.

Os aplicativos e serviços de IA consomem contexto do Knowledge Catalog pelos seguintes mecanismos:

Integrações próprias (1P) nativas

Vários serviços do Google Cloud consultam nativamente o catálogo de dados para fornecer experiências de IA contextualizadas:

  • Gemini no BigQuery (agente de conversa). Quando você insere comandos em linguagem natural no BigQuery Studio, o Gemini consulta automaticamente definições do glossário empresarial do Knowledge Catalog, descrições de colunas e relações históricas de consultas em segundo plano. Isso embasa o Gemini na terminologia de negócios empresariais, garantindo que as consultas SQL geradas usem as junções de tabela e as definições de métricas corretas.
  • Agente de engenharia de dados no BigQuery. Descobre e consulta tabelas do Apache Iceberg e do BigQuery, invoca automaticamente pesquisas semânticas no catálogo para resolver dependências de recursos e gera metadados do catálogo durante a execução do pipeline.
  • Vertex AI e Agent Builder. Os agentes personalizados de GenAI e os aplicativos de pesquisa criados na Vertex AI usam metadados do catálogo e regras de negócios para embasar o raciocínio do modelo em fatos empresariais verificados.
  • Google Cloud console e interface do usuário do Business. Os usuários finais e os administradores de dados analisam recursos usando a pesquisa semântica em linguagem natural, visualizam gráficos interativos de relacionamento de dados e gerenciam glossários de negócios.

Aplicativos de terceiros e ecossistemas de agentes de IA

Serviços e sistemas autônomos sem integrações integradas consomem contexto por protocolos abertos e APIs de recuperação dedicadas:

Protocolo de Contexto de Modelo (MCP)

O Protocolo de Contexto de Modelo (MCP) é um padrão aberto que permite que agentes de IA, ferramentas de desenvolvedor e IDEs se conectem diretamente às ferramentas do Knowledge Catalog. O MCP oferece uma interface padronizada para inspecionar esquemas de tabelas, pesquisar definições de glossário, verificar pontuações de qualidade de dados e rastrear a linhagem de dados.

O Knowledge Catalog oferece suporte a duas opções de implantação do MCP:

Recuperar contexto pré-formatado com a API LookupContext

Para pipelines de IA personalizados e aplicativos de LLM, o Knowledge Catalog oferece o método LookupContext da API (projects/<var>PROJECT_ID</var>/locations/<var>LOCATION</var>:lookupContext).

Em vez de exigir que um agente faça várias chamadas sequenciais para inspecionar esquemas, pesquisar termos do glossário, buscar pontuações de qualidade de dados e inspecionar registros de consultas, o método LookupContext recupera um pacote unificado e pré-formatado de metadados avançados em uma única solicitação.

As principais capacidades do método LookupContext incluem:

  • Formatos prontos para LLM. Retorna o contexto formatado como yaml (padrão), json ou xml, projetado para inserção direta em comandos do sistema LLM.
  • Orçamento de tokens (context_budget): permite especificar um orçamento de caracteres de destino. A API trunca e prioriza de maneira inteligente os metadados para se ajustar à janela de contexto do seu modelo.
  • Visualizações de contexto configuráveis.
    • BASIC. Retorna metadados de entrada fundamentais, esquemas, descrições de colunas, texto de visão geral e diretrizes do agente.
    • PADRÃO. Além dos metadados básicos, percorre o gráfico de contexto para incluir relações de junção de várias tabelas, termos e sinônimos anexados do glossário de negócios, padrões de uso de tempo de execução e consultas de exemplo verificadas.
  • Indicadores operacionais e de uso avançados. Retorna estatísticas detalhadas de uso extraídas do histórico de consultas, como partitionBy, clusterBy, topReadFields, topFilterFields, topGroupByFields, topSortFields e topAggregations.
  • Junções descobertas e consultas de ouro. Inclui condições de junção de tabelas inferidas (por exemplo, orders.customer_id = customers.id) e exemplos verificados de consultas SQL.

Para mais informações, consulte Recuperar contexto para recursos de dados e a referência REST de lookupContext.

Como o contexto ajuda usuários finais e agentes de IA

O Knowledge Catalog fornece contexto universal na nuvem de dados agêntica, unificando esquemas técnicos, semântica de negócios, linhagem de dados e métricas de qualidade em uma camada de contexto ativa. Ao expor esses metadados por interfaces abertas, como o Protocolo de Contexto de Modelo (MCP), APIs de recuperação de contexto e pesquisa semântica, o Knowledge Catalog auxilia usuários e sistemas autônomos.

Eliminar o trabalho manual de confiança para os usuários

Sem uma camada semântica centralizada, é necessário investigar a linhagem do banco de dados e os históricos de consultas para responder a perguntas básicas de negócios. Os catálogos padrão funcionam como inventários passivos de esquemas, o que exige que você procure manualmente as definições de métricas ou verifique a limpeza da tabela.

O Knowledge Catalog transforma essa governança passiva em inteligência ativa. Ao apresentar pontuações de qualidade, descrições semânticas e avisos de uso diretamente ao lado dos recursos de dados, o Knowledge Catalog permite que você confie e use os dados sem esperar por revisões de engenharia.

Fundamentar agentes autônomos e ativar a governança dinâmica

Os agentes de IA e os modelos de linguagem grandes (LLMs) exigem regras estritas e deterministas para interagir com bancos de dados. Sem um contexto semântico explícito, os agentes fazem suposições incorretas sobre nomes de colunas ou geram consultas SQL com falhas.

Além disso, as transições de contexto ativo transformam o gerenciamento de metadados de um registro passivo em uma camada de governança ativa. Ao definir regras de negócios, métricas e instruções do agente verificadas diretamente no Knowledge Catalog, as organizações podem governar como os agentes recuperam, avaliam e agem com base nos dados corporativos.

O Knowledge Catalog resolve essa lacuna. Ele exporta perfis de contexto ativos unificados para seus aplicativos de IA usando interfaces padrão, como o Protocolo de Contexto de Modelo (MCP) ou a API LookupContext. Ao fundamentar seus modelos nesses metadados, você minimiza alucinações, aplica regras de governança e ajuda a garantir que as ações autônomas sejam baseadas em informações organizacionais verificadas.

Coordenar fluxos de trabalho multiagente com contexto compartilhado

Em um framework multiagente (ou enxame), agentes especializados separados colaboram para executar fluxos de trabalho complexos. Quando esses agentes operam em ambientes isolados sem um plano de contexto compartilhado, eles enfrentam um limite de contexto. Eles podem usar regras de negócios conflitantes, não localizar dependências relevantes ou duplicar o esforço de recuperação.

Usar o Knowledge Catalog como um registro de contexto centralizado ajuda a coordenar e dimensionar enxames multiagente. O embasamento do seu enxame no Knowledge Catalog oferece os seguintes benefícios:

  • Semântica de negócios compartilhada. Todos os agentes fazem referência aos mesmos significados e definições de negócios. Por exemplo, se um agente de análise de dados e um agente de relatórios recuperarem uma tabela com números de vendas, eles usarão a mesma definição de glossário de uma métrica como Gross Merchandise Value (GMV) para garantir a consistência.

  • Resolução dinâmica de dependências. Os agentes podem usar a linhagem de dados para descobrir recursos upstream e downstream de maneira programática. Isso permite que um agente de solução de problemas de pipeline rastreie uma falha de dados até a tabela de origem e transfira a tarefa para um agente de reparo sem codificar regras de dependência.

  • Interface de conexão unificada. Ao usar o Protocolo de Contexto de Modelo (MCP), você expõe um único endpoint semântico para todo o enxame. Isso elimina a necessidade de configurar integrações de API personalizadas para cada agente.

  • Governança de segurança no nível do perímetro. O Knowledge Catalog verifica as consultas do agente em relação a papéis do IAM pré-configurados. Isso ajuda a garantir que os agentes recuperem apenas o contexto de recursos que estão explicitamente autorizados a acessar, evitando a exposição acidental de dados em todo o enxame.

Casos de uso para contexto de dados

Para entender como o contexto de dados resolve consultas complexas, considere como o Knowledge Catalog aplica camadas técnicas, semânticas e operacionais na prática:

E-commerce: personalizar recomendações de pesquisa

Para alinhar as campanhas de marketing sazonais com os inventários de produtos, os agentes de pesquisa precisam entender como os e-mails promocionais não estruturados se relacionam com os catálogos de produtos estruturados e as tabelas de transações do usuário. O Knowledge Catalog mapeia essas entidades, permitindo que os modelos de recomendação sugiram produtos relevantes em tempo real.

Manufatura: otimizar a manutenção de máquinas

Os modelos de manutenção preditiva exigem a integração de registros de peças estruturadas com guias de reparo de técnicos não estruturados e feeds de sensores em tempo real. Ao mapear relações entre números de peças e capítulos de manuais, o Knowledge Catalog permite que os sistemas analíticos prevejam o desgaste dos equipamentos e agendem reparos antes que ocorram falhas.

Saúde: validar dados de ensaios clínicos

Os centros de pesquisa clínica precisam verificar se as estatísticas de pacientes estão de acordo com as regras estritas do estudo e se os registros de consentimento dos pacientes são mapeados diretamente para os conjuntos de dados de resultados do ensaio. O Knowledge Catalog rastreia a linhagem de dados no nível da coluna para auditar pipelines de consentimento e alerta os pesquisadores sobre anomalias no perfil dos dados, ajudando a preservar a integridade do teste.

Serviços financeiros: avaliar o risco de crédito

Os modelos de análise de crédito para empréstimos usam pontuações de crédito, históricos de transações e saldos de dívidas ativas de clientes em sistemas de origem separados. O Knowledge Catalog oferece um gráfico unificado de métricas de empréstimo e mapeia a linhagem de dados, permitindo que as ferramentas de subscrição confirmem que as avaliações de risco usam ativos certificados e em conformidade.

Telecomunicações: diagnosticar operações de rede

Os sistemas e agentes autônomos de gerenciamento de rede analisam comportamentos de sinal em tempo real, detectam degradações de desempenho e aplicam ações corretivas de autocorreção. Ao fundamentar esses agentes no contexto do Knowledge Catalog, os sistemas podem rastrear com segurança os componentes de rede usando grafos de linhagem e mapear as relações entre registros técnicos e áreas de serviços comerciais.

A seguir

Tutorial

Crie um glossário empresarial, defina tipos de aspectos personalizados e enriqueça os recursos no BigQuery.

Integração com IA

Saiba como o Protocolo de Contexto de Modelo conecta agentes a ferramentas e recursos do Knowledge Catalog.

API

Extraia contexto YAML ou JSON pré-formatado e com orçamento de tokens para injeção direta de comandos do LLM.

Agente de IA

Automatizar a curadoria de metadados e o mapeamento de glossários usando o Kit de Desenvolvimento de Agente.

Conceito

Saiba mais sobre o metamodelo flexível, os tipos de entrada, os tipos de aspecto e os grupos de entrada.

Governança

Visualize transformações de dados no nível da coluna para entender a origem dos dados e o impacto downstream.