本文說明 Knowledge Catalog (原稱 Dataplex Universal Catalog) 中資料產品的架構和重要概念。
資料產品是經過整理的資料資產邏輯集合,經過正式封裝,確保可探索、可信任及可存取。資料產品的主要功能包括:
- 將目錄資產整理成邏輯單元,解決特定業務問題,並加快取得洞察資訊的速度。
- 發布時附上說明、文件和相關層面等背景資訊。
- 透過合約建立信任關係,讓資料生產者能向資料消費者提供保證。
- 為資料消費者提供自助式工作流程,以便評估資料產品並取得資料存取權。
基本概念
本節說明與資料產品相關的重要概念和術語。
資料產品
經過精選的資料資產邏輯分組,正式包裝後可供探索、信任及存取,以解決特定業務問題。
資產
指向實體資料資源的指標,例如 BigQuery 資料集、資料表或檢視區塊。資料產品包含一或多項資產。
存取權群組
存取權群組可簡化資料產品的權限管理作業。這些角色會將易記的角色 (例如 Reader 或 Analyst) 對應至基礎 Google 群組或服務帳戶。這項抽象化功能可讓資料產品擁有者在概念層級管理存取權,並協助資料產品消費者要求適當的存取層級。
資料產品擁有者會設定存取群組,並可選擇指派預設 IAM 角色,這個角色會自動套用至資料產品中所有支援的資產。如果未指派預設角色,擁有者可以直接為資產指派特定 IAM 角色。
資料產品用戶會使用這些群組要求存取資料產品。
資料產品擁有者或資料生產者
負責建立及管理資料產品的個人或團隊。包括管理品質、存取權和說明文件。
資料產品消費者
使用資料產品產生洞察資訊的個人、團隊或 AI 代理程式。
合約
資料產品擁有者與消費者之間的協議。這份協議會定義資料的提供和使用方式 (例如更新時間表和品質標準),明確規範雙方期望。
用途範例
以分析電子商務業務的資料科學家為例,他們的目標是找出各流量來源的平均訂單價值 (AOV),並瞭解使用者年齡與訂單大小之間是否有關聯。為此,他們需要合併多個資料表 (例如 order_details、user_traffic 和 user_demographics) 的資料。
傳統做法會造成摩擦。如要產生洞察資料,資料科學家必須先在機構龐大的資料環境中找出正確的資料表,然後聯絡每位資料擁有者、說明存取要求,並等待核准。
資料產品可讓資料擁有者將相關資產包裝成名為「電子商務業務資料」的單一產品,簡化這項體驗。這個套件包含下列項目:
資產
- BigQuery 資料表
order_details和user_traffic(包含歷來訂單資料和流量來源) - BigQuery 檢視區塊
user_demographics(提供使用者詳細資料,但不含 PII)
- BigQuery 資料表
存取群組
- 預先定義
Reader和Writer群組,簡化存取要求
- 預先定義
合約
- 定義資料更新頻率的合約 (例如太平洋時間每週上午 8 點)
背景資訊
- 說明文件,內含範例查詢和其他詳細資料
- 描述資料敏感度的其他中繼資料
資料科學家現在可以將這個資料產品視為單一邏輯單元。 這樣一來,他們就能放心地產生洞察資料,回答「各個流量來源的平均訂單價值是多少?」等問題,最終找出能帶來最高價值顧客的來源。
資料產品使用者流程
在 Knowledge Catalog 中,資料產品生命週期涉及兩個主要使用者歷程:一個是資料產品擁有者 (或生產者) 建立及管理資料的歷程,另一個是資料產品消費者探索及使用資料的歷程。
資料產品擁有者歷程
這個歷程的重點是封裝、保護及管理資料產品,確保資料可信且容易存取。
建立:定義資料產品並納入資產。這項程序包含下列動作:
- 設定專屬名稱、專案、區域和說明。
- 新增資產,例如 BigQuery 資料表、資料集或檢視區塊。
- 設定存取權群組 (例如
Analyst或Reader),並將其對應至基礎 Google 群組或服務帳戶,簡化權限管理作業。 - 您也可以視需要為存取群組指派預設 IAM 角色,自動授予資料產品中所有支援資產的權限。
- 為特定資產的存取權群組指派必要的 IAM 角色。
- 新增合約 (系統層面),正式傳達雙方同意的資料重新整理頻率和門檻。
詳情請參閱「建立資料產品」。
管理:更新資料產品,確保可探索性。這項程序包含下列動作:
- 更新基本詳細資料、資產、權限、補充資訊 (中繼資料) 和 RTF 格式文件。
- 授予消費者存取權,讓他們發掘資料產品並要求存取權。
詳情請參閱「管理資料產品」。
資料產品消費者歷程
這項歷程的重點在於快速找到可信資料,並取得使用資料的必要權限。
探索:針對特定業務問題尋找相關且可信的資料。這包括下列動作:
- 使用Knowledge Catalog Search功能,以關鍵字或自然語言尋找封裝的資料產品。
- 查看資料產品的總覽、資產、合約和其他方面,判斷是否適合使用。
詳情請參閱「搜尋資料產品」。
要求存取權:向資料產品擁有者要求資料存取權。
詳情請參閱「要求存取資料產品」。
用途:存取基礎資產,產生洞察資料。這項作業包括下列動作:
獲得核准後,你就能存取產品和相關資產。舉例來說,如果資產是 BigQuery 資料表,您可以前往 BigQuery Studio 並直接查詢資料。
如果應用程式和開發工作流程在Google Cloud外部運作,您可以使用外部中繼資料閘道公開資料產品。詳情請參閱「使用 Knowledge Catalog 遠端 MCP 伺服器」。
詳情請參閱「使用資料產品」。
支援的素材資源
資料產品可由一或多項資料資產組成。系統支援下列資料資產:
- BigQuery 資料集
- BigQuery 資料表
- BigQuery 檢視區塊
- BigQuery 處理常式
- BigQuery 模型
- BigQuery 外部資料表
- Gemini Enterprise Agent Platform 資料集
- Gemini Enterprise Agent Platform 模型
- Cloud Storage 值區
- Iceberg REST 目錄
- Iceberg REST 目錄命名空間
- Iceberg REST 目錄資料表
- Looker (Google Cloud Core) 資訊主頁
- Looker (Google Cloud Core) 資訊主頁元素
- Looker (Google Cloud Core) Look
- Looker (Google Cloud Core) 探索
- Looker (Google Cloud Core) LookML 專案
- Looker (Google Cloud Core) LookML 模型
- Looker (Google Cloud Core) LookML 檢視畫面
限制
- 位置:資料產品及其基礎資產必須位於相同 Google Cloud 位置。
- BigQuery 模型:資料產品中的 BigQuery 模型存取權,是透過套用至父項資料集 IAM 政策的 IAM 條件管理。分享 BigQuery 模型時,須遵守 IAM 條件的限制。
Looker (Google Cloud Core) 資產:在資料產品中使用 Looker (Google Cloud Core) 資產時,有下列限制:
- 不支援服務帳戶: Google 群組鏡像 Looker (Google Cloud Core) 僅支援人類使用者身分。存取在 Looker (Google Cloud Core) 資產上設定的群組時,不得包含服務帳戶主體。
- 不支援預設存取群組 IAM 角色:系統不會將指派給存取群組層級的預設 IAM 角色套用至 Looker (Google Cloud Core) 資產,並會標示為
unsupported。您必須在每個 Looker (Google Cloud Core) 資產上,明確設定存取權群組權限。 - 在 Looker (Google Cloud Core) 中手動同步處理權限:在資料產品的 Looker (Google Cloud Core) 資產中設定的角色名稱,是提供給消費者的資訊預留位置。資料產生者必須手動設定及維護 Looker (Google Cloud Core) 執行個體內鏡像群組的資料夾存取層級和 Looker 角色。
配額和限制:如需 API 速率限制和容量配額的完整清單,請參閱「資料產品 API 要求配額」。
不支援可用區 bucket。
後續步驟
- 瞭解如何建立資料產品。
- 進一步瞭解如何管理資料產品。
- 瞭解如何搜尋資料產品。
- 瞭解如何要求資料產品的存取權。
- 瞭解如何搭配使用 VPC Service Controls 與資料產品。