Last reviewed 2026-06-09 UTC
本文提供高階架構,說明如何實作使用 AI 代理的跨雲端資料分析工作流程。本文件適用於雲端架構師、資料工程師和資料科學家,他們希望在多雲端資料湖泊、結構化資料倉儲和非結構化資料儲存空間中,使用代理式 AI 進行分析工作流程。本文假設您對代理式 AI 概念、資料分析和雲端架構有基礎瞭解。
本文的「部署」部分提供程式碼研究室,可協助您瞭解如何建構代理程式分析解決方案。
架構
下圖顯示代理程式分析解決方案的架構,可從分散在多個資料儲存空間和雲端服務供應商的結構化和非結構化資料中,取得業務洞察資料。
此架構中的元件分為下列幾層:
使用者和代理程式動作
- 代理程式開發環境:資料工程師和資料科學家等資料從業人員,可透過下列任一方法提交自然語言要求:
- 代理式開發環境,例如 Google Antigravity IDE 或 Microsoft Visual Studio Code。
- CLI 代理程式,例如 Gemini CLI、Claude Code 或 Codex。
- Google Cloud Data Agent Kit 擴充功能:擴充功能可載入適當的技能並連線至遠端 MCP 伺服器,以存取Google Cloud 中的受信任資料,進而提供 Google Cloud 服務。
- 基礎模型:如要從可信的情境和資料生成商機洞察,代理開發環境會使用基礎模型,例如Gemini 系列模型。模型會使用 Data Agent Kit 擴充功能的適當技能,並使用必要的 MCP 伺服器工具,實作複雜的分析工作流程。
- 代理程式開發環境:資料工程師和資料科學家等資料從業人員,可透過下列任一方法提交自然語言要求:
Analytics 工作流程
- Lakehouse for Apache Iceberg: Lakehouse 提供高效能的統合中繼資料目錄,可將 Apache Iceberg 開放式資料表格式與 Google Cloud中的企業級儲存空間整合。
- Managed Service for Apache Spark: 這是架構中的核心資料處理元件。Managed Service for Apache Spark 的 Lightning Engine 功能支援批次和互動模式中的高效能無伺服器資料處理作業。Spark 資料處理工作會使用 Lakehouse 中的 Iceberg 目錄中繼資料,從 BigQuery 讀取結構化資料,並從 Amazon S3 等外部來源執行零複製讀取作業。
- Knowledge Catalog: 代理會使用 Knowledge Catalog 對 Cloud Storage 中的非結構化資料執行智慧掃描、擷取語意中繼資料,並建構脈絡圖。
信任的資料儲存庫
- Google Cloud 中的資料:BigQuery 是結構化資料的中央倉儲,包括從 Cloud Storage 中非結構化資料擷取的結構化資料。
- 外部來源的資料:架構會顯示外部資料來源,例如 Amazon S3 值區中的資料,以及 Databricks Unity Catalog 中的中繼資料。Cross-Cloud Interconnect 提供 Google Cloud和其他雲端服務供應商之間的高頻寬專屬連線。
使用的產品
此架構使用下列 Google Cloud 產品和工具:
- Google Cloud Data Agent Kit:代理程式擴充功能,可讓資料科學家、資料工程師和資料應用程式開發人員,在偏好的代理程式開發環境中管理整個資料生命週期。
- BigQuery:企業資料倉儲,內建機器學習、地理空間分析和商業智慧等功能,有助於管理及分析資料。
- Managed Service for Apache Spark:這項代管服務可在代管運算基礎架構上執行 Apache Spark 批次工作負載。
- Lakehouse for Apache Iceberg:高效能儲存引擎,可讓您建構開放式資料湖倉,並提供統一的介面,用於進階分析和 AI。
- Knowledge Catalog:這項 AI 輔助服務提供統一的資料資產目錄,以及智慧型中繼資料和治理功能。
- Gemini:Google 開發的一系列多模態 AI 模型。
- Cloud Storage:適用於多種資料類型的物件儲存庫,成本低廉且沒有限制。 資料在 Google Cloud 內外都能存取,且會複製到多個位置,以便提供備援機制。 Google Cloud
- Cross-Cloud Interconnect:這項服務提供高頻寬、低延遲的專屬連線,可連結 Google Cloud 和其他雲端服務供應商。
- Google Cloud MCP 伺服器:Google 管理的遠端服務,可實作 Model Context Protocol (MCP),讓 AI 應用程式存取 Google 和 Google Cloud 產品與服務。
用途
本文說明的架構適用於下列用途:
- 多雲端資料分析:有效率地查詢及分析分散在 Google Cloud 和其他雲端服務供應商的資料,不必移動檔案或建構複雜的擷取、轉換及載入 (ETL) 管道。舉例來說,全球零售商的行銷經理可以將 Amazon S3 中的顧客忠誠度資料,與 BigQuery 中的行銷作業資料合併,藉此分析行銷活動的成效。
- 智慧資料探索:使用自然語言提示和 AI 代理程式,在多個環境中探索、查詢及處理聯邦資料集。舉例來說,採購專家可以根據供應鏈管理 (SCM) 系統中的結構化資料,以及非結構化電子郵件通訊和損壞評估報告的洞察資料,判斷供應鏈中斷的常見原因。
- 從非結構化來源擷取結構化資料:掃描大量非結構化資料、衍生語意中繼資料,並將擷取的結構化資料儲存在 BigQuery 中,以供後續分析。舉例來說,營運控管人員可以從以非結構化格式 (例如 PDF 檔案) 儲存的數千張發票中擷取結構化資料,有效分析支出。
部署作業
如要瞭解如何使用 Data Agent Kit 擴充功能建構代理式分析解決方案,請參閱「Raw data to forecasting in seconds with AI agents」程式碼研究室。本程式碼實驗室會說明如何透過 Data Agent Kit 擴充功能,在偏好的代理式開發環境中有效分析資料。程式碼研究室使用的所有範例資料都儲存在Google Cloud中。
後續步驟
- 瞭解如何使用 Data Agent Kit 擴充功能,透過筆記本轉換及分析資料。
- 探索 Knowledge Catalog 的應用實例。
- 進一步瞭解 Lakehouse。
- 瞭解如何使用 Lightning Engine 加速處理 Apache Spark 工作負載。
- 瞭解如何將 Knowledge Catalog 做為 BigQuery 的控管和代理層。
- 如要查看更多參考架構、圖表和最佳做法,請瀏覽 Cloud Architecture Center。
貢獻者
作者:Kumar Dhanagopal | 跨產品解決方案開發人員
其他貢獻者:
- Abirami Sukumaran | 員工開發人員服務代表
- Arti Prasad | 技術文件撰稿者
- Brad Miro | 資深開發人員服務代表
- Matthew Rahmann | 資深產品經理
- Ranadip Chatterjee | 解決方案工程師
- Remigiusz Samborski | Lead Developer Relations Engineer