在分散式資料資產中,如果沒有背景資訊,原始資料通常不足以解決業務問題。如果結構化資料庫、非結構化記錄和分析指標缺乏業務意義,使用者和自主系統就會遇到脈絡上限。人工分析師必須手動驗證資料來源,而 AI 代理程式經常會生成不準確的答案 (產生幻覺),或無法執行動作。
Knowledge Catalog 可將中繼資料管理從被動目錄轉變為主動脈絡的動態控制層,解決這個問題。Knowledge Catalog 會彙整技術結構、業務規則和實際使用模式,提供統一的脈絡層,確保您和 AI 應用程式都能準確安全地探索、評估及解讀資料資產。
什麼是脈絡?
背景資訊是結構、作業和語意細節的豐富架構,用於描述資料資產。情境會提供完整的資料故事,而不是以名稱和資料類型做為獨立的結構定義來呈現資料表。
Knowledge Catalog 會將脈絡資訊整理成下列層級:
技術中繼資料。直接從來源系統擷取的結構詳細資料,包括資料庫結構定義、欄位類型、分割鍵和安全標記 (例如身分與存取權管理 (IAM) 政策)。
語意中繼資料。資料的業務意義,包括業務詞彙表、指標關係、分類、網域術語和精確查詢 (已驗證的自然語言問題,對應至正確的 SQL 程式碼陳述式)。
作業中繼資料。資料的行為和健康狀態 (一段時間內),包括資料欄層級的資料歷程、執行設定檔、剖析統計資料和資料品質分數。
關係。實體儲存空間資料表和概念業務指標之間推斷或定義的連結。
信任信號:驗證指標,例如擁有權和認證的印章,可驗證資產是否為權威來源。
客服人員指引:非結構化說明 (例如 README 檔案、使用說明和執行記錄),可引導自主工具查詢資源的方式和時機。
Knowledge Catalog 統一這些層級,確保您充分瞭解資料,避免因資料孤立且未記錄而造成作業瓶頸和不確定性。
資料脈絡與中繼資料的差異
中繼資料提供基礎建構區塊,但中繼資料和脈絡不可互換:
- 中繼資料。描述性屬性,用於定義獨立資料資產的實體結構、位置和技術屬性 (例如資料欄名稱、資料類型、分割區鍵和資料表大小)。
- 背景資訊。這個多維度知識圖譜會整合技術結構定義、業務語意、資料關係、作業行為和信任信號,賦予資料意義並引導推理。
下表重點列出被動中繼資料和主動資料環境之間的差異:
| 維度 | 技術中繼資料 | 有效資料脈絡 |
|---|---|---|
| 核心重點 | 實體規格和儲存格式。 | 業務意義、運作行為和關係。 |
| 「State」 | 被動:儲存在目錄登錄中,供工程師手動查詢。 | 主動:由 AI 持續擴充,從查詢記錄中挖掘,並動態組合成 LLM 提示。 |
| 主要消費者 | 資料庫引擎、資料工程師和法規遵循稽核人員。 | AI 代理程式、大型語言模型 (LLM)、商業分析師和對話式介面。 |
| 主要目的 | 儲存空間管理、建立索引及法規遵循驗證。 | 建立代理推論結果的基準、解決聯結問題,以及防止幻覺。 |
範例:中繼資料與背景資訊的比較
如要瞭解情境如何擴充技術中繼資料,請考量 Knowledge Catalog 如何代表交易資料欄:
1. 僅技術中繼資料
技術中繼資料提供結構資訊,但缺乏業務邏輯和作業指南:
- 表格:
fact_orders - 欄:
disc_val - 資料類型:
NUMERIC - 儲存空間屬性:依據
order_date分區
如果 AI 代理程式只使用這項技術中繼資料,可能會猜測 disc_val 代表客戶折扣總額,但無法判斷該值是否包含稅金、製造商退款或促銷優待券。
2. 充實的資料脈絡
Knowledge Catalog 會在統一的脈絡酬載中,以語意、關聯和作業層充實技術中繼資料:
- 技術架構:
fact_orders.disc_val(NUMERIC)。 - 語意定義:對應至組織詞彙中的「促銷折扣」,定義為結帳時套用的顧客折扣,不含製造商退費折扣和運費補助。
- 發掘的關係:自動連結
fact_orders.customer_id至dim_customers.id,以及fact_orders.promo_id至dim_promotions.id。 - 作業用途:查詢記錄顯示,90% 的業務查詢會依
status = 'COMPLETED'篩選這個資料表,並與dim_promotions聯結。 - 信任度和品質:透過自動資料品質掃描,獲得 99.8% 的有效性評分,且資料更新間隔在過去 2 小時內經過驗證。
- 精確查詢:包含經過驗證的 SQL 範本,示範如何使用
disc_val計算已確認的淨收益。
有了完整脈絡,AI 代理程式或資料分析師就能準確產生查詢,並解讀資料,不必進行人工驗證或擔心出現錯覺。
在沒有脈絡的情況下使用資料的挑戰
大多數企業資料都缺少必要的中繼資料,因此難以發掘、信任或用於 AI 作業。如果沒有結構化脈絡,機構會面臨多項作業瓶頸:
協作手動作業。如果業務定義不夠明確,分析和 AI 團隊就必須與主題專家 (SME) 持續進行手動協調,才能建立表格的基本概念。
內容偏移。標準文件會維持靜態,並隨著時間經過而失效。如果沒有持續監控,過時的中繼資料會導致錯誤的假設,並中斷 AI 代理程式工作流程。
推論失敗。AI 代理程式和大型語言模型可能會生成語法正確的 SQL 查詢,但無法遵守基礎企業邏輯,導致從業務角度來看,計算結果不正確。
資訊分散。如何正確篩選或聯結資料集的內部知識,仍存在於未記錄的指令碼或資訊主頁設定中,而非註冊在集中式目錄中。
如要克服這些作業瓶頸並讓資料發揮作用,組織需要在資料資產中採用可靠的脈絡引擎。
脈絡管理的核心要素
為在整個資料資產中維持這個可靠的脈絡引擎,Knowledge Catalog 依據以下三大支柱運作:
匯總
Knowledge Catalog 會自動從內建資料庫、Iceberg REST 目錄和第三方平台收集中繼資料。將這些分散的輸入內容整合到單一統一的管理區域,有助於確保安全政策和分類定義一致地沿用。
擴充
Knowledge Catalog 會使用 AI 輔助的擷取功能,持續更新及管理脈絡圖。Knowledge Catalog 會挖掘交易記錄、資料庫結構定義和商業智慧模型,自動探索資料欄說明和資料表關係。這項持續學習功能會擷取資料擁有者的機構知識,並動態套用至您的資產。
搜尋與擷取
Knowledge Catalog 提供高精確度的語意搜尋功能,可讓您以自然語言查詢資料資產。由於 Knowledge Catalog 瞭解權限群組 (ACL) 和業務術語,因此使用者和自主代理程式都能以低延遲時間找到相關資料內容。
中繼資料和脈絡如何饋送至 Knowledge Catalog
為建構可靠的脈絡引擎,Knowledge Catalog 會透過自動化平台連接器、持續的 AI 擴充功能和可擴充的自訂介面,擷取及管理資訊。
第一方資料來源和自動收集
Knowledge Catalog 會自動從核心 Google Cloud 服務收集結構和作業中繼資料,不需手動設定:
- 資料庫和分析倉儲。BigQuery、Spanner、Cloud SQL 和 AlloyDB for PostgreSQL 等服務會持續同步處理技術中繼資料,包括資料表結構定義、欄位資料類型、分割鍵、叢集規格和資料集界線。
- 非結構化資料洞察。對於儲存在 Cloud Storage 中的非結構化檔案 (例如 PDF 文件或政策手冊),Knowledge Catalog 會執行探索和剖析掃描,擷取重要概念和實體關係,產生圖表剖析並在 BigQuery 中註冊結構化物件資料表。詳情請參閱「關於非結構化資料洞察」。
- 開箱即用的 BI 語意和歷程同步功能。對於 Looker (Google Cloud 核心),Knowledge Catalog 會自動同步處理商業智慧資產:
- LookML 語意定義。模型、探索、檢視區塊、維度和測量指標。
- BI 資訊主頁資產。資訊主頁、資訊主頁元素和 Look 圖表。
- 端對端資料歷程。追蹤從基礎 BigQuery 資料表到下游 Looker 資訊主頁的關係資料流程。詳情請參閱「使用 Knowledge Catalog 管理 Looker (Google Cloud Core) 資源」。
- 資料整合與轉換。Datastream 等服務會擷取變更資料擷取 (CDC) 串流中繼資料和歷程,Dataform 會推送資料表定義和 SQL 轉換,Cortex Framework 則會發布已註冊的資料產品。
持續透過 AI 技術策劃情境
除了靜態技術結構之外,Knowledge Catalog 還會使用內建智慧引擎,動態更新脈絡圖表:
- 資料洞察:資料洞察功能採用 Gemini in BigQuery 技術,會挖掘歷來查詢記錄、使用者交易和結構定義模式,生成自然語言的資料欄說明、探索資料表關係 (例如聯結鍵),並建議經過驗證的範例查詢 (「黃金查詢」),擷取企業邏輯。詳情請參閱關於結構化資料的資料洞察。
- 自動剖析資料並評估資料品質。掃描會計算統計分布 (例如不重複計數、空值比率和樣本值),並根據規則式資料品質檢查評估資料,將即時健康分數附加至目錄項目。詳情請參閱「關於自動分析資料品質」。
- 自動化資料歷程。匯總資料管道的資料欄層級轉換流程和工作執行記錄。詳情請參閱「關於資料歷程」。
自訂中繼資料擷取和第三方系統
對於擁有專屬知識庫、第三方治理工具或地端部署系統的機構,Knowledge Catalog 提供彈性的擷取機制:
- Knowledge Catalog API (CRUD 作業)。使用
CreateEntry、UpdateEntry、CreateAspectType和SetAspectAPI 方法,以程式輔助方式註冊外部資產,並附加自訂中繼資料層面 (例如法規遵循評等或系統文件)。 - 自訂擴充代理程式:使用 Agent Development Kit (ADK) 或 LangChain 等代理架構,建構自訂擴充代理。舉例來說,ADK 代理程式可以從內部維基或 Git 儲存庫擷取技術文件,使用 LLM 將這些文件剖析為標準化組織詞彙,然後附加至目錄項目。詳情請參閱「建立 AI 代理程式來擴充中繼資料」。
- 匯出及匯入作業。使用檔案型 (JSON 或 CSV) 批次匯出和匯入工作流程,即可查看 AI 生成的商家定義、與資料管理員協作,以及批次更新中繼資料。詳情請參閱「匯出中繼資料」。
如何在第一方和第三方服務中取用脈絡
服務和應用程式會以兩種不同的角色與 Knowledge Catalog 互動:
- 中繼資料供應商。將技術中繼資料、結構定義、LookML 定義和沿革傳送至 Knowledge Catalog 的服務 (例如 Looker、Cloud SQL 和 Spanner)。中繼資料供應商會將中繼資料推送至目錄,但不一定會在自己的使用者介面中採用組織詞彙定義。
- 脈絡消費者。服務、開發人員工具和 AI 代理,可從 Knowledge Catalog 擷取業務定義、營運設定檔和治理規則,做為推論和執行作業的依據。
應用程式和代理程式必須先建立基本業務字詞和品質規則,才能使用內容。詳情請參閱「建立基礎資料內容」和「建構以程式碼為基礎的資料品質政策工作流程」。
AI 應用程式和服務會透過下列機制,從 Knowledge Catalog 取用內容:
內建第一方 (1P) 整合功能
多項 Google Cloud 服務會以原生方式查詢 Knowledge Catalog,提供依據情境調整的 AI 體驗:
- Gemini in BigQuery (對話式代理程式)。在 BigQuery Studio 中輸入自然語言提示詞時,Gemini 會在背景自動查詢 Knowledge Catalog 組織詞彙定義、資料欄說明和歷來查詢關係。這可讓 Gemini 熟悉企業業務術語,確保生成的 SQL 查詢使用正確的資料表聯結和指標定義。
- BigQuery 中的資料工程代理。探索及查詢 Apache Iceberg 和 BigQuery 資料表,自動叫用語意目錄搜尋功能來解決資產依附元件,並在管道執行期間產生目錄中繼資料。
- Vertex AI 和 Agent Builder。以 Vertex AI 建構的自訂生成式 AI 代理程式和搜尋應用程式,會使用目錄中繼資料和業務規則,以經過驗證的企業事實做為模型推論的依據。
- Google Cloud 控制台和商家 UI。使用者和資料管理員可使用自然語言語意搜尋功能探索資產、查看互動式資料關係圖,以及管理業務詞彙。
第三方應用程式和 AI 代理生態系統
沒有內建整合功能的服務和自主系統會透過開放式通訊協定和專用擷取 API,使用情境:
Model Context Protocol (MCP)
Model Context Protocol (MCP) 是一項開放標準,可讓 AI 代理、開發人員工具和 IDE 直接連結至 Knowledge Catalog 工具。MCP 提供標準化介面,可檢查資料表結構定義、查詢術語定義、驗證資料品質分數,以及追蹤資料歷程。
Knowledge Catalog 支援兩種 MCP 部署選項:
- 遠端 MCP 伺服器。由 Google Cloud (或部署在 Cloud Run 上) 代管的端點,適用於雲端原生代理程式、無伺服器工作流程和多代理程式平台。詳情請參閱「使用 Knowledge Catalog 遠端 MCP 伺服器」。
- 當地 MCP Toolbox。與開發人員 IDE (例如 VS Code 和 Cursor) 和本機開發工作流程整合的本機 CLI Proxy。詳情請參閱「搭配本機 MCP Toolbox 伺服器使用 Knowledge Catalog」和「搭配本機 MCP Toolbox 伺服器使用資料歷程」。
使用 LookupContext API 擷取預先格式化的內容
對於自訂 AI 管道和 LLM 應用程式,Knowledge Catalog 提供 LookupContext API 方法 (projects/<var>PROJECT_ID</var>/locations/<var>LOCATION</var>:lookupContext)。
代理程式不必進行多項連續呼叫來檢查結構定義、查詢詞彙表字詞、擷取資料品質分數,以及檢查查詢記錄,LookupContext 方法只要提出單一要求,就能擷取預先格式化的豐富中繼資料套件。
LookupContext 方法的主要功能包括:
- LLM 適用格式:傳回格式為
yaml(預設)、json或xml的背景資訊,可直接插入 LLM 系統提示。 - 權杖預算 (
context_budget):可指定目標字元預算。API 會智慧截斷並優先處理中繼資料,以符合模型的脈絡窗口。 - 可設定的背景資訊檢視畫面。
- 基本。傳回基本項目中繼資料、結構定義、欄說明、總覽文字和代理商指南。
- 標準。除了基本中繼資料外,還會遍歷內容圖表,納入多個表格的聯結關係、附加的業務詞彙和同義詞、執行階段使用模式,以及經過驗證的範例查詢。
- 豐富的作業和使用信號。傳回從查詢記錄中擷取的詳細使用情況統計資料,例如
partitionBy、clusterBy、topReadFields、topFilterFields、topGroupByFields、topSortFields和topAggregations。 - 已探索到的聯結和黃金查詢。包括推斷的資料表聯結條件 (例如
orders.customer_id = customers.id) 和經過驗證的範例 SQL 查詢。
詳情請參閱「擷取資料資產的內容」和 lookupContext REST 參考資料。
背景資訊如何協助使用者和 AI 代理
Knowledge Catalog 會將技術結構定義、業務語意、資料歷程和品質指標整合至主動脈絡層,在代理資料雲端中提供通用脈絡。透過 Model Context Protocol (MCP) 等開放介面、內容擷取 API 和語意搜尋公開這項中繼資料,Knowledge Catalog 可協助使用者和自主系統。
免除使用者手動信任裝置的作業
如果沒有集中式語意層,您就必須調查資料庫歷程和查詢記錄,才能回答基本的業務問題。標準目錄是架構的被動式目錄,因此您必須手動查閱指標定義或驗證表格整潔度。
Knowledge Catalog 會將這項被動式治理轉換為主動式智慧。Knowledge Catalog 會直接在資料資產旁顯示品質分數、語意說明和使用警告,讓您信任及使用資料,不必等待工程審查。
為自主代理程式奠定基礎,並啟用動態管理
AI 代理和大型語言模型 (LLM) 必須遵守嚴格的確定性規則,才能與資料庫互動。如果沒有明確的語意脈絡,代理程式會對資料欄名稱做出錯誤假設,或產生錯誤的 SQL 查詢。
此外,有效內容會將中繼資料管理從被動登錄轉換為主動管理層。在 Knowledge Catalog 中直接定義經過驗證的業務規則、指標和代理程式指令,即可控管代理程式擷取、評估及處理公司資料的方式。
Knowledge Catalog 可解決這個問題。透過 Model Context Protocol (MCP) 或 LookupContext API 等標準介面,將統一的有效內容設定檔匯出至 AI 應用程式。以這類中繼資料為模型奠定基礎,可減少幻覺、強制執行管理規則,並確保自主行動是根據經過驗證的機構事實。
透過共用情境協調多代理工作流程
在多代理架構 (或多代理協作) 中,多個專門代理會協同運作,執行複雜的工作流程。如果這些代理程式在各自獨立的環境中運作,沒有共用的情境平面,就會遇到情境上限,可能使用衝突的業務規則、找不到相關依附元件,或重複擷取工作。
使用 Knowledge Catalog 做為集中式內容登錄檔,有助於協調及擴大多代理程式群組。在 Knowledge Catalog 中建立群組基準有下列好處:
共用業務語意。所有代理程式都參照相同的業務意義和定義。舉例來說,如果資料分析代理程式和報表代理程式都擷取包含銷售數據的資料表,他們會使用相同的指標詞彙定義 (例如
Gross Merchandise Value (GMV)),確保資料一致性。動態解決依附元件問題。代理程式可透過資料歷程,以程式輔助方式探索上游和下游資源。這讓管道疑難排解代理程式能將資料失敗追溯至來源資料表,並將工作交給修復代理程式,而不必硬式編碼依附項規則。
統一的連線介面。使用 Model Context Protocol (MCP),即可向整個群集公開單一語意端點。就不必為每個個別代理程式設定自訂 API 整合。
範圍層級的安全控管。 Knowledge Catalog 會根據預先設定的 IAM 角色檢查代理程式查詢。這有助於確保代理程式只會擷取明確授權存取的資源內容,防止蜂群中發生資料暴露。
使用資料內容的用途
如要瞭解資料環境如何解決複雜的查詢,請參考 Knowledge Catalog 實際應用技術、語意和作業層的方式:
電子商務:提供個人化搜尋建議
為使季節性行銷活動與產品庫存保持一致,搜尋代理程式必須瞭解非結構化促銷電子郵件與結構化產品目錄和使用者交易表格的關聯。Knowledge Catalog 會對應這些實體,讓推薦模型即時建議相關產品。
製造業:最佳化機械維護作業
預測性維護模型需要整合結構化零件記錄、非結構化技術人員維修指南和即時感應器動態饋給。透過對應零件編號和手冊章節之間的關係,Knowledge Catalog 可讓分析系統預測設備疲勞程度,並在發生故障前安排維修。
健康:驗證臨床試驗資料
臨床研究中心必須確認病患統計資料符合嚴格的研究規則,且病患同意記錄直接對應至試驗結果資料集。Knowledge Catalog 會追蹤資料的欄層級歷程,稽核同意聲明管道,並在資料剖析檔出現異常狀況時提醒研究人員,有助於維護試驗完整性。
金融服務:評估信用風險
貸款承銷模型會使用客戶信用評分、交易記錄,以及不同來源系統的未償債務餘額。Knowledge Catalog 提供貸款指標的統一圖表,並繪製資料歷程,讓核保工具確認風險評估使用經過認證且符合規範的資產。
電信:診斷網路作業
自主網路管理系統和代理程式會分析即時訊號行為、偵測效能下降情形,並套用自我修復的修正動作。以 Knowledge Catalog 脈絡為基礎,系統就能透過沿襲圖安全追蹤網路元件,並對應技術記錄和業務服務領域之間的關係。