AI 代理程式的 Knowledge Catalog

隨著資料生態系統日益複雜,AI 應用程式不僅需要原始資料存取權,他們需要瞭解業務背景。 Knowledge Catalog 代表了 Dataplex 的演變,其重點轉向增強人工智慧和智慧體系統。

這個平台的核心是一個統一的映射,它將你的實體資料資產與業務語意、治理規則和使用關係連結起來。將 Knowledge Catalog 整合至 AI 工作流程,即可達成下列目標:

  • 為 AI 代理建立基準,提供可靠、最新且符合脈絡的中繼資料,引導代理進行推論。

  • 減少幻覺,並確保生成模型基於已建立的企業真理給出答案。

  • 為 AI 代理提供統一的環境 (單一受控的資料環境檢視畫面)。

用途

Knowledge Catalog 在資料和 AI 生命週期中扮演不同角色:

  • 人工智慧開發者和智能體建構者。 開發人員建構自訂機器人或代理 (例如使用 LangChain 或 Agent Development Kit (ADK)),且必須查詢及瞭解企業資料。

    • 用途:使用自然語言搜尋及擷取脈絡,讓代理程式處理企業資料;代理程式資料探索。
  • 資料分析師:使用 Gemini in BigQuery 或 Looker 等 AI 輔助工具尋找資料並瞭解其業務意義的使用者。

    • 用例:自然語言查詢和對話資料探索。
  • 資料監管員:負責監督 AI 輔助中繼資料擴充功能,並確保目錄脈絡品質的領域專家。

    • 用途:審查、策劃及宣傳 AI 生成的中繼資料和說明。

使用 MCP 存取 Knowledge Catalog 上下文

Model Context Protocol (MCP) 是標準化橋樑,可讓 AI 代理程式和工具順暢連結至 Knowledge Catalog 等資料來源。

為了適應不同的部署工作流程,Knowledge Catalog 提供了兩種類型的 MCP 實作方式。瞭解每種做法的適用時機,是設定環境的關鍵:

  • 遠端 MCP 伺服器: 在建置雲端原生應用程式、將代理程式部署到無伺服器環境(如 Cloud Run)或與外部託管服務整合時,您可以避免管理本機基礎架構。

  • 本機 MCP Toolbox:在本機開發代理程式、快速製作原型,或需要直接與本機桌面 IDE (例如 VS Code 或 Cursor) 整合時使用。

遠端 MCP 伺服器

由 Google 代管的端點,可直接存取 AI 應用程式和服務的 Knowledge Catalog 工具 (例如在 Cloud Run 上執行的代理程式,或 Claude 等外部服務)。

  • 端點:https://dataplex.googleapis.com/mcp
  • 優點:不需要執行本機 MCP 伺服器,適用於無伺服器環境。
  • 參考資料: 使用遠端 MCP 伺服器

本機 MCP Toolbox

指令列工具,可作為 IDE (例如 VS Code、Cursor) 或本機工具與 Knowledge Catalog 之間的本機 Proxy。

  • 安裝:可下載的二進位檔。
  • 設定:通常是指專案或 IDE 設定中的 .mcp.json 或設定檔。
  • 優點:非常適合本機安全開發環境,並可與各種 IDE 整合。
  • 參考資料: 使用本機 MCP 伺服器

豐富 Knowledge Catalog 的脈絡

為了最大限度地發揮 Knowledge Catalog 對 AI 的價值,底層圖必須包含豐富的業務情境。您可以透過現成的功能或自訂代理增強來實現這一點。

立即可用的資料洞察擴充功能

資料洞察 (由 Gemini in BigQuery 提供技術支援) 會自動擴充目錄,減少新資料平台「冷啟動」的問題。啟用後,它會自動產生以下內容:

  • 資料集和資料欄層級說明。
  • 資料表之間的關係圖。
  • 基於歷史使用模式的範例查詢。

這能立即為下游代理程式提供語意理解,不需要手動進行資料監管。

例如,對於名為 telco_churn 的表,資料洞察可以自動產生 TenureMonthlyCharges 等欄位的描述,推斷與客戶表的關係,並將按細分查找流失率等範例查詢發布到目錄中。

詳情請參閱「關於結構化資料的資料洞察」。

利用代理進行自訂上下文增強

如果貴機構有專屬知識庫,可以建構自訂的擴充代理,從內部 Wiki、程式碼存放區或專屬系統等來源擷取中繼資料。

  • Knowledge Catalog API (CRUD 作業):用於在目錄中新增或更新中繼資料。

    • 舉例來說,您可以呼叫 UpdateEntry API 方法,使用從內部系統擷取的說明文件,以程式輔助方式將總覽層面附加至資料表。
  • ADK 等工具:用來建構擴充代理。

    • 舉例來說,您可以建構以 Java 為基礎的 ADK 代理,使用內部工具擷取技術維基頁面,並使用 LLM 將這些頁面剖析為詞彙表字詞,然後將這些字詞同步至 Knowledge Catalog。
  • 匯出及匯入作業:用於大量更新中繼資料,並進行審查。

    • 舉例來說,您可以將 AI 生成的組織詞彙匯出至檔案,讓資料管理員共同審查及修正定義,然後將最終檔案匯回目錄。

後續步驟