知识目录概览

Knowledge Catalog 是一个由 Gemini 提供支持的上下文层,可在整个数据资产中提供通用业务上下文和主动接地功能。通过从结构化和非结构化数据构建动态上下文图,它可帮助数据团队和开发者发现资源、验证数据质量,并安全地将生成式 AI 应用接地,从而减少幻觉。

如需详细了解 Knowledge Catalog,请观看以下视频:

受众群体和前提条件

本概览面向数据和情境工程师、数据科学家、数据管理员和 AI 开发者。在使用 Knowledge Catalog 之前,您必须具备以下条件:

  • 熟悉数据库和存储系统,例如 BigQuery 或 Cloud Storage。

  • 对生成式 AI 概念有基本的了解,例如检索增强生成 (RAG) 或 Model Context Protocol (MCP)。

解决行业特有的数据复杂性问题

在现代企业中,数据复杂且高度分散,既有结构化数据,也有非结构化数据。业务请求很少映射到单个数据库架构或文档存储区。如何安全地协调这些信息孤岛,同时针对跨领域问题提供即时可靠的答案,是一项重大的运营挑战。

Knowledge Catalog 充当弥合这一差距的语义基础,让 AI 智能体和分析工具能够检索到有依据的相关上下文。

关键用户角色

  • Context Engineers(数据工程师)。自动汇总数据库和 Cloud Storage 中的元数据,通过沿袭跟踪转换,并构建丰富和评估工作流。

  • 数据管理员(治理团队)。通过以下方式监督元数据质量:对 AI 生成的说明进行人机协同审核;使用术语库标准化业务词汇;定义自定义方面,以便将特定领域的背景信息附加到目录条目。

  • AI 开发者。使用 MCP 服务器或上下文检索 API,基于可信的企业数据架构来训练 LLM 和 AI 应用。

行业使用场景

下表展示了实践中出现的复杂问题、这些问题如何跨越技术界限,以及知识目录如何帮助组织解决这些问题:

行业 数据和运营方面的挑战 要解决的业务问题 Knowledge Catalog 如何解决此问题
电子商务
  • 事务型数据库和非结构化商品图片位于不同的存储环境中,因此很难将退货历史记录与实物状况相关联。
  • 将退货率与直观的客户反馈相关联需要复杂的手动数据流水线。
“查找退货率高的电子产品,以及显示到货时有损坏迹象的客户照片。” 跨数据格式的语义接地:自动从事务型数据库中发现元数据,并将其与 Cloud Storage 存储桶中的非结构化图片相关联,从而让 AI 工具能够跨不同的存储系统解析查询。
制造
  • 遥测日志和纸质检查 PDF 扫描件在各个地理部门之间是孤立的。
  • 以往,编译安全检查摘要和查找运营模式需要数周的跨团队协调。
“为上季度未通过安全检查的西部区域机器生成所有相关检查报告的摘要。” 区域性非结构化爬取:爬取非结构化 PDF 检查报告并将其编入目录,同时爬取资产元数据,让生成式 AI 智能体按区域查找、汇编和总结报告。
医疗保健
  • 电子健康记录中的临床数据必须保持安全,并符合 HIPAA 法规,同时支持实时预测模型。
  • 未检测到的数据质量异常可能会导致模型预测或患者护理提醒不正确。
“如果查看近期的实验室生命体征和预约频率,哪些患者的 30 天再入院风险最高?” 数据质量和沿袭:计算电子健康记录 Feed 的行级数据质量分析和沿袭图,有助于确保临床预测模型仅依赖经过验证的高质量患者生命体征数据。
金融服务
  • 客户反馈文本文件、CRM 账号和结算账簿在不同的系统中进行管理,无法进行统一分析。
  • 预测财务趋势需要将非结构化情感数据与历史收入数据库联接起来。
“哪些收入排名前 10 的客户曾抱怨‘效果问题’,这会对第三季度的预测产生什么影响?” 统一上下文图:统一客户记录、支持反馈和财务表格,让自然语言查询能够将客户收入统计信息与非结构化反馈文件联接起来,以预测财务影响。

为应对这些运营挑战,Knowledge Catalog 提供了关键功能,可帮助数据工程师、数据科学家和 AI 开发者构建受治理的数据系统:

  • 使用 Model Context Protocol (MCP) 为 AI 代理提供依据。使用本地或远程 MCP 服务器将元数据、架构、沿袭和业务规则直接公开给 AI 智能体。这些服务器可让模型在提出操作之前验证操作预期。

  • 加速 AI 和分析的探索。使用自然语言语义搜索功能查找相关数据资产。生成式摘要和建议可帮助用户找到数据,而无需等待人工审核文档。

  • 从非结构化数据中提取上下文。自动解析非结构化文件(例如 Cloud Storage 中的 PDF),以提取实体和关系,并将其转换为 BigQuery 中可查询的资产,从而支持对话式代理。

  • 大规模治理数据产品。将具有服务等级协议 (SLA)、合同、所有权详细信息和使用情况备注的资产集合打包成单个受监管的单元,以便进行搜索和订阅。

Knowledge Catalog 的工作原理

Knowledge Catalog 通过三支柱生命周期统一数据管理和上下文。下图展示了该服务如何将物理数据资产映射到业务语义,以用于 AI 代理接地:

Knowledge Catalog 的架构,展示了如何将元数据、业务逻辑和数据关系整理成 AI 代理的统一上下文图。 Knowledge Catalog 的架构,展示了如何将元数据、业务逻辑和数据关系整理成 AI 代理的统一上下文图。
图 1.Knowledge Catalog 的架构

如需详细了解这些元数据概念,请参阅元数据简介

以下部分介绍了元数据生命周期的三大支柱,并说明了一家零售公司如何将它们应用于数据库表、文件和外部目录条目:

  1. 汇总(发现和注入)。 Knowledge Catalog 会自动抓取并索引整个数据资产中的技术元数据,而无需移动底层数据:

    • 内置数据库。自动编目功能可捕获 BigQuery、AlloyDB for PostgreSQL 和 Spanner 等平台中的架构和属性。
    • 受管理的连接。从 Oracle 或 PostgreSQL 等外部系统或 Collibra 等合作伙伴注册表中提取定义,而无需编写自定义流水线。
    • 数据沿袭。跟踪整个流水线中的列级转换,以了解数据来源以及数据发生了哪些变化。
    • 示例:一家零售公司自动提取事务数据库元数据(例如 ordersorder_items 表),并为存储在 Cloud Storage 存储桶中的非结构化商品文件建立索引。它们会关联外部数据库,以在可发现的目录下建立统一的元数据索引。

    如需详细了解元数据聚合和数据注入,请点击展开

  2. 丰富化(精心策划背景信息并验证信任度)。 Knowledge Catalog 可为技术结构附加业务含义并建立信任信号:

    • AI 生成的数据分析。Gemini 会分析查询日志,以生成列说明、表摘要和建议的联接。
    • 非结构化索引。抓取文件目录,以从 PDF 或图片等非结构化资产中提取实体和关联。
    • 术语表和切面。使用业务术语和逻辑模板,将内部指标名称映射到共享词汇。
    • 数据质量和异常值检测。强制执行清洁度准则,并运行机器学习扫描来检测统计离群值或数据新鲜度问题,从而生成关键的信任信号。
    • 治理审核。通过使用工作流程审核流程在发布前验证元数据更新,从而管理风险。
    • 示例:零售团队通过触发数据洞见来推荐列说明并运行数据质量规则,从而丰富资产。他们通过创建术语表和方面,将业务定义与有效订单相关联。

    如需详细了解元数据丰富和信任验证,请点击展开

  3. 搜索和检索(访问和接地)。AI 应用和业务用户查询统一的上下文图表,以安全地访问数据:

    • 接地代理。将基于 LLM 的应用和代理连接到目录。
    • Context API。执行低延迟接地载荷请求。
    • 语义搜索。使用自然语言查询查找合适的素材资源。
    • 数据打包。将表、许可详细信息和 SLA 捆绑到安全的自助式数据包中。
    • 示例:分析师执行自然语言语义搜索来查找资源。AI 应用使用 MCP 服务器或上下文检索 API 安全地使用此索引,并将高质量的资源打包到安全视图中。

    如需详细了解上下文检索和代理接地,请点击展开

Google Cloud 和 AI 生态系统中的 Knowledge Catalog

在构建数据基础时,了解 Knowledge Catalog 如何与相关服务集成至关重要。

Google Cloud 数据库和模型

  • BigQuery。Knowledge Catalog 会自动抓取和索引 BigQuery 数据集、表和视图。它会触发由 Gemini 提供支持的数据分析功能,以分析查询历史记录、发布说明并建议经过验证的示例查询。
  • Looker (Google Cloud Core)。Knowledge Catalog 会提取 Looker 信息中心、Look 和 LookML 结构(例如视图、探索、维度和测量)。此提取过程会构建沿袭映射,以跟踪运营值如何映射到业务语义。
  • Lighthouse 运行时目录。Knowledge Catalog 与 Lighthouse(开源 Iceberg 工作负载的运行时 metastore)集成。它会自动为 Lighthouse 工作负载上的技术元数据编制索引,以提供统一的有效上下文。

AI 智能体平台和助理

  • 对话式分析。分析界面使用目录术语和查询工具,让用户能够以自然语言查询经过验证的业务指标。
  • Gemini for AI Agents。高精度助理智能体使用目录元数据运行数据库查找,从而减少幻觉。
  • Gemini Enterprise Agent Platform。 Knowledge Catalog 可作为目标平台环境中的中央数据治理标准。它与 Gemini Enterprise Agent Platform 交叉关联,可向该平台的 Agent Registry 提供工具和上下文。

Google Cloud 数据库和 AI 服务集成

Knowledge Catalog 可与其他Google Cloud 产品搭配使用,共同构建数据基础。下表重点介绍了 Knowledge Catalog 如何与相关服务集成并对其进行补充:

服务 主要角色 如何与 Knowledge Catalog 集成
Knowledge Catalog 治理和智能体上下文 充当统一的语义上下文图,执行数据质量检查扫描,并向 AI 模型和应用公开已确定的架构。
BigQuery 企业数据仓储 存储、查询和处理数据集;自动抓取、编入索引并使用业务分类方面的信息扩充这些表。
Vertex AI AI 模型开发 构建、部署和托管基础模型。自定义智能体检索元数据上下文,以提供逻辑推理依据。
Cloud Storage 非结构化文件存储 存储原始的非结构化文件;自动运行非结构化发现扫描,以解析 PDF 和图片来构建关系图。

语义和数据格式

为了有效地指导和接地代理系统,您必须区分物理数据结构和语义含义:

  • 语义。与数据相关的业务含义、意图和关系。虽然技术架构定义了结构化存储规范(例如数据库类型、字符长度或整数约束),但语义描述了数据集的实际含义。例如,您可以将名为 txn_qty 的列映射到“购买数量”的业务定义。
  • 结构化数据。以定义的架构和关系格式存储的信息。例如,BigQuery 表、Spanner 数据库和运行中的 Postgres 表。 Knowledge Catalog 会自动抓取此元数据,并记录列和限制。
  • 非结构化数据。包含原始文本或缺少结构化架构的媒体文件的未格式化信息。例如,PDF 数据表、客户支持电子邮件和存储在 Cloud Storage 中的图片。 Knowledge Catalog 通过使用非结构化数据分析洞见来运行发现扫描,以提取潜在的实体关系并将其记录在图谱配置文件中。图谱配置文件是一种特殊切面,包含 AI 提取的实体关系节点和边。

Agentic Data Cloud 上下文编排

在 Google 的 Agentic Data Cloud 框架中,Knowledge Catalog 充当语义编排平面。上下文引擎无需开发者在提示中手动将数据库架构和规则硬编码到提示中,而是动态提供智能体做出明智决策所需的精确语义上下文。

下图展示了 Knowledge Catalog 如何编排和提供数据上下文:

Agentic Data Cloud 上下文编排架构。
Agentic Data Cloud 中的上下文编排和交付路径。
Agentic Data Cloud 上下文编排架构。

上下文编排工作流包括以下阶段:

  1. 提取和发现。运营数据库、Spanner 和 BigQuery 等数据仓库、Cloud Storage 等非结构化对象存储区以及 Lighthouse 等运行时 metastore 会将技术架构、沿袭图和元数据定义直接馈送到 Knowledge Catalog。
  2. 上下文映射。在 Knowledge Catalog 中,这些元数据属性会关联到语义元素(包括技术方面、业务术语库和经过验证的查询),以组装有效的上下文图。
  3. 交付界面。AI 应用和编排器使用标准连接器(例如 MCP 或直接 LookupContext API 端点)以编程方式检索此整合的上下文图。
  4. 智能体接地。智能体开发套件 (ADK) 或 LangChain 等编排框架会将此元数据上下文直接注入 LLM 提示中。这种注入可让智能体的推理基于经过验证的组织规则,从而使其能够查询数据库或执行自动化操作,而不会产生幻觉。

AI 智能体个人资料

您可以根据要自动化的工作流,构建由 Knowledge Catalog 提供支持的不同类别的代理:

  • 数据发现代理。这些助理可帮助用户搜索和浏览数据资产。它们不会使用关键字匹配,而是会分析自然语言中的长篇意图和限制条件,以检索最相关的实物资产。
  • 元数据扩充代理。这些后台代理会从 Wiki、自述文件或聊天日志中注入非结构化文本,将文本解析为正式的元数据,并将元数据作为切面写入 Knowledge Catalog,以保持元数据的新鲜度。
  • 数据质量和流水线代理。这些自主代理会评估质量规则、检测架构漂移,并通过查询数据沿袭和配置文件统计信息来构建或修复数据转换流水线。

编排工具

如需构建和集成这些代理,您可以使用以下工具:

  • Model Context Protocol (MCP)。一种用于将智能体链接到外部资源的标准化开放协议。您可以配置代理,以使用远程 MCP 服务器本地 MCP 工具箱连接到目录。如需了解详情,请参阅知识目录中的 Model Context Protocol (MCP) 简介
  • 智能体开发套件 (ADK)。Google 提供的一个框架,可简化生成式 AI 智能体的构建、运行和测试,并提供与 Catalog Service API 的内置绑定。如需了解详情,请参阅 ADK 首页
  • LookupContext API。一个 REST 和 gRPC API 端点,用于提取数据资产的统一 YAML 或 JSON 上下文载荷,可直接注入 LLM 提示。如需了解详情,请参阅使用 LookupContext API 检索上下文

使用 MCP 访问上下文

Model Context Protocol (MCP) 是一种标准化桥梁,可让 AI 智能体和工具无缝连接到 Knowledge Catalog 等数据源。请使用下方的比较表格,确定最适合您集成的选项:

实现 适用场景 重要详细信息 端点或设置
远程 MCP 服务器 以云优先的部署、Cloud Run 等无服务器环境以及受管理的外部服务。 由 Google 托管的端点,无需进行本地服务器管理。 端点:https://dataplex.googleapis.com/mcp
如需进行设置,请参阅使用远程 MCP 服务器
本地 MCP 工具箱 本地智能体开发、快速原型设计以及 VS Code 或 Cursor 等桌面 IDE 集成。 充当工作区环境与 Knowledge Catalog 之间本地代理的命令行工具。 需要进行二进制安装和 .mcp.json 设置。
如需进行设置,请参阅使用本地 MCP 服务器

智能体数据上下文最佳实践

如需构建可靠的智能体体验,请在 Knowledge Catalog 中整理和查询元数据时,谨记以下最佳实践:

  • 添加切面。AI 代理无法仅凭名称区分正式版生产表和临时沙盒模拟表。定义并应用自定义信任信号方面,以认证权威数据产品,这有助于确保代理优先处理或限制对这些资源的查询。
  • 使用上下文预算优化查找。调用 LookupContext API 时,请指定 context_budget 参数。该 API 会在您指定的令牌限制范围内,优先优化并纳入最重要的元数据,例如沿袭和主要说明。
  • 提供相关资源以显示联接路径。在您的上下文查询中,最多列出 10 个相关表格或资产。提供一组资源可让上下文引擎自动填充联接路径和关系,从而帮助代理了解表之间的接口方式。
  • 构建语义词汇表。标准化业务术语表中的术语和缩写。这种标准化有助于对话工具准确解析特定于业务的同义词和指标。
  • 发布黄金查询。将经过验证的自然语言查询及其正确的 SQL 等效项直接附加到 Knowledge Catalog 条目。通过将推理过程基于这些经过验证的模板,您可以防止文本到 SQL 代理中出现 SQL 转换错误。

从 Dataplex Universal Catalog 转换到 Knowledge Catalog

Dataplex Universal Catalog 已演变为 Knowledge Catalog。如需详细了解此转换,请参阅从 Dataplex Universal Catalog 转换到 Knowledge Catalog

限制

规划部署时,请考虑以下限制:

  • 支持的集成。虽然 Knowledge Catalog 支持主要第三方系统,但某些自动语义提取可能仅限于内置 Google Cloud 服务。

  • 配额限制。标准 Google Cloud API 配额适用于上下文检索和元数据提取操作。

后续步骤

概念

了解有效情境如何将被动元数据转换为接地数据,从而让 AI 智能体以事实为依据并防止产生幻觉。

教程

构建业务术语库、定义自定义切面类型,以及丰富 BigQuery 中的资产。

AI 集成

使用 Model Context Protocol 将 AI 智能体和开发者工具连接到 Knowledge Catalog。

发现

使用自然语言查找和探索 Google Cloud 和第三方系统中的目录资源。

治理

定义验证规则,并通过自动质量扫描监控各个表中的数据清晰度。

使用场景

详细了解上下文丰富化、数据沿袭和智能体工作流的实际解决方案。