Knowledge Catalog es una capa de contexto potenciada por Gemini que proporciona contexto empresarial universal y capacidades de fundamentación activa en todo tu acervo de datos. Al compilar un gráfico de contexto dinámico a partir de datos estructurados y no estructurados, ayuda a los equipos de datos y a los desarrolladores a descubrir recursos, verificar la calidad de los datos y fundamentar de forma segura las aplicaciones de IA generativa para reducir las alucinaciones.
Para obtener una explicación detallada de Knowledge Catalog, mira el siguiente video:
Público y requisitos previos
Esta descripción general está diseñada para ingenieros de datos y contexto, científicos de datos, administradores de datos y desarrolladores de IA. Antes de usar Knowledge Catalog, debes tener lo siguiente:
Conocimiento de los sistemas de almacenamiento y bases de datos, como BigQuery o Cloud Storage
Conocimientos básicos de los conceptos de IA generativa, como la generación aumentada por recuperación (RAG) o el Protocolo de contexto del modelo (MCP)
Resuelve la complejidad de los datos específicos de la industria
En las empresas modernas, los datos son complejos, están muy distribuidos y existen en formatos estructurados y no estructurados. Las solicitudes comerciales rara vez se asignan a un solo esquema de base de datos o almacén de documentos. Alinear estos silos de forma segura y, al mismo tiempo, brindar respuestas inmediatas y confiables a preguntas de varios dominios es un gran desafío operativo.
Knowledge Catalog actúa como la base semántica que une esta brecha, lo que permite que los agentes de IA y las herramientas de análisis recuperen contexto fundamentado y pertinente.
Roles clave del usuario
Ingenieros de contexto (ingenieros de datos). Automatiza la agregación de metadatos en bases de datos y Cloud Storage, rastrea las transformaciones con el linaje y crea flujos de trabajo de enriquecimiento y evaluación.
Administradores de datos (equipos de administración) Supervisar la calidad de los metadatos proporcionando revisiones humanas de las descripciones generadas por IA, estandarizar los vocabularios empresariales con glosarios y definir aspectos personalizados para adjuntar contexto específico del dominio a las entradas del catálogo
Desarrolladores de IA. Fundamenta los LLM y las aplicaciones de IA con esquemas de datos empresariales confiables a través de servidores de MCP o APIs de recuperación de contexto.
Casos prácticos del sector
En la siguiente tabla, se ilustran las preguntas complejas que surgen en la práctica, cómo cruzan los límites técnicos y cómo el Catálogo de conocimiento ayuda a las organizaciones a abordarlas:
| Sector | Desafíos operativos y de datos | Problema empresarial que se debe resolver | Cómo lo aborda Knowledge Catalog |
|---|---|---|---|
| Comercio electrónico |
|
"Busca productos electrónicos con altas tasas de devoluciones y fotos de clientes que muestren signos de daños al llegar". | Fundamentación semántica en todos los formatos de datos: Descubre automáticamente los metadatos de las bases de datos transaccionales y los vincula a las imágenes no estructuradas en los buckets de almacenamiento de Cloud Storage, lo que permite que las herramientas de IA resuelvan la búsqueda en sistemas de almacenamiento dispares. |
| Manufactura |
|
"Genera resúmenes de todos los informes de inspección relacionados con las máquinas de la región occidental que no pasaron las verificaciones de seguridad el trimestre pasado". | Indexación regional y no estructurada: Indexa y cataloga informes de inspección en PDF no estructurados junto con metadatos de activos, lo que permite que los agentes de IA generativa ubiquen, compilen y resuman informes por región. |
| Salud |
|
"¿Qué pacientes tienen el mayor riesgo de reingreso en un plazo de 30 días si se tienen en cuenta los signos vitales recientes y la frecuencia de las citas?". | Calidad y linaje de los datos: Calcula el perfil de calidad de los datos a nivel de la línea y los mapas de linaje en los feeds de registros de salud electrónicos, lo que ayuda a garantizar que los modelos predictivos clínicos se basen solo en datos vitales verificados y de alta calidad de los pacientes. |
| Servicios financieros |
|
"¿Cuáles son los 10 clientes principales que generaron ingresos y se quejaron de "problemas de rendimiento"? ¿Cómo afecta esto a las proyecciones del tercer trimestre?" | Gráfico de contexto unificado: Unifica los registros de clientes, los comentarios de asistencia y las tablas financieras, lo que permite que las consultas en lenguaje natural unan las estadísticas de ingresos de los clientes con los archivos de comentarios no estructurados para predecir el impacto financiero. |
Para abordar estos desafíos operativos, Knowledge Catalog proporciona capacidades clave que ayudan a los ingenieros de datos, los científicos de datos y los desarrolladores de IA a compilar sistemas de datos administrados:
Fundamenta los agentes de IA con el Protocolo de contexto del modelo (MCP). Expón metadatos, esquemas, linaje y reglas comerciales directamente a los agentes de IA con servidores MCP locales o remotos. Estos servidores permiten que los modelos verifiquen las expectativas operativas antes de proponer acciones.
Acelera el descubrimiento para la IA y las estadísticas. Encuentra recursos de datos relevantes con la búsqueda semántica en lenguaje natural. Los resúmenes y las recomendaciones generativos ayudan a los usuarios a ubicar datos sin tener que esperar las revisiones manuales de la documentación.
Extrae contexto de datos no estructurados. Analiza automáticamente archivos no estructurados, como los PDFs en Cloud Storage, para extraer entidades y relaciones, y convertirlos en recursos consultables en BigQuery para admitir agentes conversacionales.
Administra productos de datos a gran escala. Empaqueta colecciones de recursos con acuerdos de nivel de servicio (ANS), contratos, detalles de propiedad y notas de uso en unidades únicas y controladas para la búsqueda y la suscripción.
Cómo funciona Knowledge Catalog
Knowledge Catalog unifica la administración de datos y el contexto a través de un ciclo de vida de tres pilares. En el siguiente diagrama, se ilustra cómo el servicio asigna recursos de datos físicos a la semántica empresarial para la fundamentación de agentes de IA:
Para obtener más información sobre estos conceptos de metadatos, consulta Acerca de los metadatos.
En las siguientes secciones, se describen los tres pilares del ciclo de vida de los metadatos y se ilustra cómo una empresa minorista los aplica a las tablas de bases de datos, los archivos y las entradas de catálogos externos:
Agregación (Descubre y procesa). Knowledge Catalog rastrea e indexa automáticamente los metadatos técnicos en todo tu patrimonio de datos sin mover los datos subyacentes:
- Bases de datos integradas. El catalogado automatizado captura esquemas y atributos en plataformas como BigQuery, AlloyDB para PostgreSQL y Spanner.
- Conectividad administrada. Ingiere definiciones de sistemas externos, como Oracle o PostgreSQL, o registros de socios, como Collibra, sin escribir canalizaciones personalizadas.
- Linaje de datos. Haz un seguimiento de las transformaciones a nivel de la columna en todas las canalizaciones para saber de dónde provienen tus datos y cómo cambiaron.
- Ejemplo: Una empresa de venta minorista ingiere automáticamente metadatos de bases de datos transaccionales, como las tablas
ordersyorder_items, y, luego, indexa archivos de productos no estructurados almacenados en buckets de Cloud Storage. Vinculan bases de datos externas para establecer un índice de metadatos unificado en un directorio detectable.
Más información sobre la agregación de metadatos y la transferencia de datos (haz clic para expandir)
- Fuentes de datos compatibles: Enumera todas las fuentes externas y de Google Cloud compatibles para la transferencia automática.
- Descripción general de la conectividad administrada: Explica cómo transferir esquemas técnicos desde sistemas externos.
- Hacer un seguimiento del linaje de datos: Describe cómo visualizar las transformaciones de la canalización a nivel de la columna y el flujo de datos.
Enriquecimiento (selecciona el contexto y verifica la confianza). Knowledge Catalog adjunta significado comercial a las estructuras técnicas y establece indicadores de confianza:
- Estadísticas generadas por IA Gemini analiza los registros de consultas para generar descripciones de columnas, resúmenes de tablas y uniones recomendadas.
- Indexación no estructurada Explorar directorios de archivos para extraer entidades y conexiones de recursos no estructurados, como PDFs o imágenes
- Glosarios y aspectos Asigna los nombres de las métricas internas a un vocabulario compartido con términos comerciales y plantillas lógicas.
- Calidad de los datos y detección de anomalías. Aplicamos los lineamientos de limpieza y ejecutamos análisis de aprendizaje automático para detectar valores atípicos estadísticos o problemas de actualización de datos, lo que genera indicadores clave de confianza.
- Revisiones de administración. Administra el riesgo con procesos de revisión de flujos de trabajo para verificar las actualizaciones de metadatos antes de la publicación.
- Ejemplo: El equipo de venta minorista enriquece los recursos activando estadísticas de datos para recomendar descripciones de columnas y ejecutar reglas de calidad de los datos. Asignan definiciones comerciales a pedidos activos creando glosarios y aspectos.
Más información sobre la verificación de la confianza y el enriquecimiento de metadatos (haz clic para expandir)
- Configura las estadísticas de datos: Explica cómo generar descripciones y resúmenes automatizados de conjuntos de datos.
- Administrar glosarios de la empresa: Describe cómo personalizar los términos estándar y los vocabularios empresariales.
- Enrich metadata with aspects: Muestra cómo adjuntar propiedades de metadatos estructurados a recursos lógicos.
- Cómo reutilizar reglas de calidad de los datos: Muestra cómo establecer y reutilizar reglas de validación de bases de datos.
- Descripción general de la generación de perfiles de datos: Describe cómo configurar análisis para detectar anomalías en el esquema y la desviación estadística.
Búsqueda y recuperación (acceso y fundamentación). Las aplicaciones de IA y los usuarios empresariales consultan el gráfico de contexto unificado para acceder a los datos de forma segura:
- Agentes de fundamentación. Conecta tus apps y agentes basados en LLMs al catálogo.
- API de Context Realiza solicitudes de carga útil de fundamentación de baja latencia.
- Búsqueda semántica. Encuentra los recursos adecuados con consultas en lenguaje natural.
- Empaquetado de datos Agrupa colecciones de tablas, detalles de licencias y ANS en paquetes de datos seguros de autoservicio.
- Ejemplo: Los analistas realizan búsquedas semánticas en lenguaje natural para ubicar recursos. Las aplicaciones de IA consumen este índice de forma segura con servidores de MCP o la API de recuperación de contexto, y los recursos de alta calidad se empaquetan en una vista segura.
Más información sobre la recuperación de contexto y la fundamentación del agente (haz clic para expandir)
- Descripción general del Protocolo de contexto del modelo (MCP): Explica cómo conectar agentes de IA generativa y capas de aplicaciones al contexto de Knowledge Catalog.
- Cómo recuperar contexto con LookupContext: Muestra cómo extraer cargas útiles operativas clave para las instrucciones del agente.
- Buscar recursos: Describe las capacidades de búsqueda de recursos con sintaxis de consultas semánticas en lenguaje natural.
Knowledge Catalog en Google Cloud y el ecosistema de IA
Comprender cómo se integra Knowledge Catalog con los servicios relacionados es fundamental para crear una base de datos.
Bases de datos y modelosGoogle Cloud
- BigQuery. Knowledge Catalog rastrea e indexa automáticamente los conjuntos de datos, las tablas y las vistas de BigQuery. Activa las estadísticas de datos potenciadas por Gemini para analizar los historiales de búsqueda, publicar descripciones y sugerir ejemplos de búsquedas verificadas.
- Looker (Google Cloud Core) Knowledge Catalog ingiere paneles, vistas y estructuras de LookML de Looker, como vistas, exploraciones, dimensiones y medidas. Esta transferencia crea asignaciones de linaje para rastrear cómo los valores operativos se asignan a la semántica empresarial.
- Catálogo de entorno de ejecución de Lighthouse Knowledge Catalog se integra en Lighthouse, el metastore de tiempo de ejecución para cargas de trabajo de Iceberg de código abierto. Indexa automáticamente los metadatos técnicos sobre las cargas de trabajo de Lighthouse para proporcionar un contexto activo unificado.
Plataformas y asistentes de agentes de IA
- Análisis conversacional Las interfaces de análisis usan términos del catálogo y herramientas de búsqueda para permitir que los usuarios consulten métricas comerciales en lenguaje natural con fundamentación verificada.
- Gemini para agentes de IA Los asistentes de alta precisión usan metadatos del catálogo para ejecutar búsquedas en la base de datos, lo que reduce las alucinaciones.
- Gemini Enterprise Agent Platform. Knowledge Catalog funciona como el estándar central de administración de datos en los entornos de la plataforma de destino. Se vincula de forma cruzada con Gemini Enterprise Agent Platform para proporcionar herramientas y contexto al registro de agentes de la plataforma.
Google Cloud Integración de servicios de IA y bases de datos
Knowledge Catalog funciona junto con otros productos deGoogle Cloud para formar tu base de datos. En la siguiente tabla, se destaca cómo Knowledge Catalog se integra con los servicios relacionados y los complementa:
| Servicio | Rol principal | Cómo se integra con Knowledge Catalog |
|---|---|---|
| Knowledge Catalog | Administración y contexto de agentes | Sirve como el gráfico de contexto semántico unificado, ejecuta análisis de verificación de calidad de los datos y expone esquemas fundamentados a los modelos y las aplicaciones de IA. |
| BigQuery | Almacenamiento de datos empresariales | Almacena, consulta y procesa conjuntos de datos; rastrea, indexa y enriquece automáticamente estas tablas con aspectos de clasificación empresarial. |
| Vertex AI | Desarrollo de modelos de IA | Crea, implementa y aloja modelos de base. Los agentes personalizados recuperan el contexto de los metadatos para fundamentar el razonamiento lógico. |
| Cloud Storage | Almacenamiento de archivos no estructurados | Almacena archivos sin procesar y no estructurados, y ejecuta automáticamente análisis de descubrimiento no estructurados para analizar archivos PDF e imágenes y crear mapas de relaciones. |
Semántica y formatos de datos
Para instruir y fundamentar sistemas basados en agentes de manera eficaz, debes distinguir entre la estructura de datos física y el significado semántico:
- Semántica. El significado, la intención y las relaciones comerciales asociadas con tus datos. Si bien los esquemas técnicos definen especificaciones de almacenamiento estructurales, como un tipo de base de datos, la longitud de caracteres o una restricción de números enteros, la semántica describe lo que el conjunto de datos representa en realidad. Por ejemplo, puedes asignar una columna llamada
txn_qtya la definición comercial de "cantidad comprada". - Datos estructurados Información almacenada en esquemas definidos y formatos relacionales. Entre los ejemplos, se incluyen las tablas de BigQuery, las bases de datos de Spanner y las tablas operativas de Postgres. Knowledge Catalog rastrea automáticamente estos metadatos y registra las columnas y las restricciones.
- Datos no estructurados: Información sin formato que contiene texto sin procesar o archivos multimedia que carecen de un esquema estructural. Entre los ejemplos, se incluyen hojas de datos en PDF, correos electrónicos de asistencia al cliente e imágenes almacenadas en Cloud Storage. Knowledge Catalog ejecuta análisis de descubrimiento con estadísticas de datos no estructurados para extraer las relaciones subyacentes entre entidades y registrarlas en un perfil de grafo, que es un aspecto especializado que contiene nodos y aristas de relaciones entre entidades extraídos por IA.
Orquestación del contexto de la Nube de datos con agentes
Dentro del framework de nube de datos con agentes de Google, Knowledge Catalog funciona como el plano de orquestación semántica. En lugar de requerir que los desarrolladores codifiquen de forma manual esquemas y reglas de bases de datos en las instrucciones, el motor de contexto proporciona de forma dinámica el contexto semántico preciso que un agente necesita para tomar decisiones inteligentes.
En la siguiente figura, se muestra cómo Knowledge Catalog organiza y entrega el contexto de los datos:
El flujo de trabajo de orquestación del contexto consta de las siguientes fases:
- Transferencia y descubrimiento. Las bases de datos operativas, los almacenes como Spanner y BigQuery, los almacenes de objetos no estructurados como Cloud Storage y los metastores de tiempo de ejecución como Lighthouse envían esquemas técnicos, mapas de linaje y definiciones de metadatos directamente a Knowledge Catalog.
- Mapa de contexto Dentro del Catálogo de conocimiento, estas propiedades de metadatos se vinculan a elementos semánticos, incluidos aspectos técnicos, glosarios empresariales y consultas verificadas, para ensamblar el gráfico de contexto activo.
- Interfaces de entrega. Las aplicaciones y los orquestadores de IA recuperan este gráfico de contexto consolidado de forma programática con conectores estándar, como MCP o extremos de API de
LookupContextdirectos. - Fundamentación del agente. Los frameworks de organización, como el Kit de desarrollo de agentes (ADK) o LangChain, insertan este contexto de metadatos directamente en las instrucciones de LLM. Esta inyección fundamenta el razonamiento del agente en reglas organizacionales verificadas, lo que le permite consultar bases de datos o ejecutar acciones automatizadas sin alucinaciones.
Perfiles de agentes de IA
Según los flujos de trabajo que desees automatizar, puedes crear diferentes clases de agentes potenciados por Knowledge Catalog:
- Agentes de detección de datos. Estos asistentes ayudan a los usuarios a buscar y navegar por el patrimonio de datos. En lugar de usar la coincidencia de palabras clave, analizan la intención y las restricciones de formato largo en lenguaje natural para recuperar los recursos físicos más relevantes.
- Agentes de enriquecimiento de metadatos Estos agentes en segundo plano incorporan texto no estructurado de wikis, archivos README o registros de chat, analizan el texto para convertirlo en metadatos formales y escriben los metadatos como aspectos en Knowledge Catalog para mantenerlos actualizados.
- Calidad de los datos y agentes de canalización. Estos agentes autónomos evalúan las reglas de calidad, detectan la desviación del esquema y compilan o reparan canalizaciones de transformación de datos consultando el linaje de los datos y las estadísticas del perfil.
Herramientas de organización
Para compilar e integrar estos agentes, puedes usar las siguientes herramientas:
- Protocolo de contexto del modelo (MCP) Un protocolo abierto y estandarizado para vincular agentes a recursos externos. Puedes configurar los agentes para que se conecten al catálogo con el servidor MCP remoto o la caja de herramientas MCP local. Para obtener más información, consulta Acerca del Protocolo de contexto del modelo (MCP) en Knowledge Catalog.
- Kit de desarrollo de agentes (ADK) Un framework de Google que simplifica la compilación, la ejecución y las pruebas de agentes de IA generativa, y ofrece vinculaciones integradas a la API de Catalog Service. Para obtener más información, consulta la página principal del ADK.
- API de LookupContext. Es un extremo de API de REST y gRPC que extrae una carga útil de contexto unificada en formato YAML o JSON para los recursos de datos, lista para insertarse directamente en las instrucciones de LLM. Para obtener más información, consulta Cómo recuperar contexto con la API de LookupContext.
Contexto de acceso con MCP
El Protocolo de contexto del modelo (MCP) es un puente estandarizado que permite que los agentes y las herramientas de IA se conecten sin problemas a fuentes de datos, como Knowledge Catalog. Usa la siguiente tabla de comparación para determinar la mejor opción para tu integración:
| Implementación | Ideal para | Detalles clave | Extremo o configuración |
|---|---|---|---|
| Servidor de MCP remoto | Implementaciones centradas en la nube, entornos sin servidores como Cloud Run y servicios externos administrados. | Es un extremo alojado en Google que no requiere administración de servidores locales. | Extremo: https://dataplex.googleapis.com/mcpPara configurarlo, consulta Cómo usar un servidor de MCP remoto. |
| Caja de herramientas del MCP local | Desarrollo de agentes locales, creación rápida de prototipos e integraciones de IDE de escritorio, como VS Code o Cursor. | Herramienta de línea de comandos que actúa como proxy local entre tu entorno de espacio de trabajo y Knowledge Catalog. | Requiere la instalación binaria y la configuración de .mcp.json.Para configurar, consulta Usa un servidor MCP local. |
Prácticas recomendadas para el contexto de datos con agentes
Para crear experiencias de agentes confiables, ten en cuenta las siguientes prácticas recomendadas cuando organices y consultes metadatos en Knowledge Catalog:
- Agregar aspectos Los agentes de IA no pueden distinguir entre las tablas de producción oficiales y las simulaciones temporales de zona de pruebas solo por el nombre. Define y aplica un aspecto de indicador de confianza personalizado para certificar productos de datos autorizados, lo que ayuda a garantizar que los agentes prioricen o restrinjan las búsquedas a estos recursos.
- Optimiza las búsquedas con presupuestos de contexto. Cuando llames a la API de
LookupContext, especifica el parámetrocontext_budget. La API optimiza y ajusta primero los metadatos más importantes, como el linaje y las descripciones principales, dentro de las restricciones de tokens especificadas. - Proporciona recursos relacionados para exponer las rutas de unión. En tus consultas contextuales, enumera hasta 10 tablas o recursos relacionados. Proporcionar un grupo de recursos permite que el motor de contexto complete automáticamente las rutas de unión y las relaciones, lo que ayuda al agente a comprender cómo interactúan las tablas.
- Estructura glosarios semánticos. Estandarizar los términos y las abreviaturas en los glosarios empresariales Esta estandarización ayuda a las herramientas de conversación a resolver sinónimos y métricas específicos de la empresa con precisión.
- Publica consultas de referencia. Adjunta consultas verificadas en lenguaje natural y sus equivalentes correctos en SQL directamente a las entradas del Knowledge Catalog. Al fundamentar el razonamiento en estas plantillas verificadas, evitas errores de conversión de SQL en los agentes de texto a SQL.
Transición de Dataplex Universal Catalog a Knowledge Catalog
Dataplex Universal Catalog evolucionó a Knowledge Catalog. Para obtener más información sobre esta transición, consulta Transición de Dataplex Universal Catalog a Knowledge Catalog.
Limitaciones
Cuando planifiques tu implementación, ten en cuenta las siguientes limitaciones:
Integraciones admitidas. Si bien Knowledge Catalog admite los principales sistemas de terceros, es posible que algunas extracciones semánticas automatizadas se limiten a los servicios Google Cloud integrados.
Límites de cuota. Las cuotas de la API estándar Google Cloud se aplican a las operaciones de recuperación de contexto y extracción de metadatos.
¿Qué sigue?
Acerca del contexto de los datos
Comprende cómo el contexto activo transforma los metadatos pasivos para fundamentar los agentes de IA y evitar las alucinaciones.
Establece un contexto de datos fundamental
Crea un glosario empresarial, define tipos de aspectos personalizados y enriquece los activos en BigQuery.
Fundamenta los agentes con el MCP
Conecta agentes de IA y herramientas para desarrolladores a Knowledge Catalog con el Protocolo de contexto del modelo.
Buscar recursos
Encuentra y explora recursos del catálogo en Google Cloud y sistemas de terceros con lenguaje natural.
Automatizar los análisis de la calidad de los datos
Define reglas de validación y supervisa la limpieza de los datos en las tablas con análisis de calidad automatizados.
Explorar casos de uso interactivos
Analiza soluciones del mundo real para el enriquecimiento del contexto, el linaje de datos y los flujos de trabajo basados en agentes.