關於跨雲端資料存取權

有了跨雲端資料存取功能,您就能直接從 Google Cloud 查詢其他雲端供應商儲存的資料,不必移轉檔案,也不必使用 Cross-Cloud Interconnect 建立複雜的 ETL 管道。

這項功能是無邊界湖倉的一部分,可讓您使用 BigQuery、獨立的 Apache Spark 環境或 Managed Service for Apache Spark,對分散式資料集執行統一分析及套用 AI。

除了分析查詢,您也可以使用同盟資料取得 AI 輔助洞察和進行控管:

  • 對話式數據分析: 根據確切的資料來源 (包括跨雲端資料表) 建構專用代理,透過單一對話分析不同雲端環境中的資料。
  • Knowledge Catalog: 使用 Knowledge Catalog 功能,透過聯邦資料來源進行資料剖析和深入分析。

用途

Lakehouse 支援多種重要用途,可存取多個雲端服務供應商的資料:

  • 減少資料遷移:您可以直接查詢儲存在其他雲端環境中的資料,簡化資料存取和處理作業。
  • 統一分析:無論資料位於何處,您都能使用一致的功能和硬體最佳化技術,對所有資料執行進階分析。
  • 無邊界 AI 和機器學習可讓您直接將 AI 模型、自主代理程式和機器學習套用至遠端資料,不必遷移資料。

存取跨雲端資料的運作方式

資料湖倉會透過下列程序查詢遠端資料:

  1. 中繼資料探索: Google CloudLakehouse 會連線至遠端 Apache Iceberg REST 目錄,例如 Databricks Unity 或 AWS Glue。湖倉會探索資料,不會複製任何檔案。視遠端目錄提供者而定,Lakehouse 會透過 Secret Manager 或 OpenID Connect 權杖聯盟,以 Google 做為身分提供者 (OIDC 權杖聯盟),安全地進行驗證。
  2. 安全傳輸:選擇透過私有互連網路 (例如專屬 CCI 或合作夥伴互連網路) 傳輸流量,可大幅降低資料移轉費用,且延遲時間非常穩定,相較於公用網際網路更具優勢。
  3. 最佳化執行:由於查詢會從遠端雲端讀取資料,Lakehouse 會在專用儲存空間的 Google Cloud 中,暫時在本機快取這些資料區段。後續查詢會使用本機快取,避免產生大量跨雲端輸出費用。

支援的目錄

Lakehouse 支援從下列遠端目錄供應商查詢資料:

  • Databricks Unity Catalog:支援 Amazon Web Services (AWS) 和 Google Cloud。
  • AWS Glue:Amazon Web Services (AWS) 支援這項服務。
  • Snowflake Horizon Catalog:支援 Amazon Web Services (AWS) 和 Google Cloud。
  • SAP Business Data Cloud (BDC):使用 SAP BDC 連接器支援。

核心概念

本節說明使用跨雲端資料存取功能時,不可或缺的重要元件。

中繼資料層

中繼資料層會連線至遠端 Apache Iceberg REST 目錄端點,根據重新整理間隔同步處理 Iceberg 資源 (命名空間、資料表) 中繼資料。Lakehouse 會透過儲存在 Secret Manager 或 OIDC 權杖聯盟中的 OAuth 憑證,安全地進行驗證。

傳輸層

傳輸層可讓 BigQuery 和開放原始碼引擎使用中繼資料層的同步中繼資料查詢資料。對於特定類型的遠端目錄,Lakehouse 支援透過公開網際網路或專屬私人互連網路查詢資料。

選取符合架構和安全性需求的傳輸方式:

客戶擁有的帳戶 (CCI)

您可以設定 BigQuery,透過私人 Cross-Cloud Interconnect,使用專屬 Cross-Cloud Interconnect合作夥伴 Cross-Cloud Interconnect,查詢儲存在 Amazon Web Services (AWS) Amazon S3 bucket 中的資料。

使用私人互連網路可享有下列優點:

  • 提升安全性:資料會在 Google Cloud 和 AWS 之間的私人網路連線中傳輸,避開公開網際網路。
  • 降低費用:相較於網際網路輸出,從 AWS 輸出資料的費用可能較低,尤其是搭配私人互連容量時。
  • 穩定效能:與公開網際網路相比,網路延遲時間和頻寬更可預測。

架構總覽

如要啟用私人查詢,請透過私人互連設定從 BigQuery 到 AWS Amazon S3 bucket 的路徑。虛擬私有雲 (VPC) Google Cloud的重要元件是內部負載平衡器 (ILB)。ILB 會將 BigQuery 的要求分配至 AWS VPC 內 Amazon S3 的私人端點,這些端點是使用 AWS PrivateLink 佈建。

使用 ILB 時,必須將多個彈性網路介面 (ENI) 做為後端,才能進行負載平衡、擴充及確保高可用性。無論您使用專屬 CCI 或 Partner Interconnect,都適用這項規定。

私人查詢工作流程如下:

  1. BigQuery 會使用透過 Service Directory 服務設定的連線。
  2. Service Directory 會將服務名稱解析為 Google Cloud ILB 的內部 IP 位址。
  3. ILB 會接收來自 BigQuery 的要求,並將要求分配至已設定的後端。
  4. ILB 後端是混合式連線網路端點群組 (NEG),每個群組都指向 AWS VPC 中 ENI 的私人 IP 位址。
  5. 流量會從 ILB 經由 NEG,透過私有互連,傳輸至 AWS ENI。
  6. AWS ENI 是 Amazon S3 VPC 介面端點 (AWS PrivateLink) 的一部分,可提供 Amazon S3 服務的私有存取權。

公開網際網路 (無 CCI)

如未設定私有互連,查詢遠端目錄的預設路徑會經過公開網際網路。

透過公用網際網路查詢資料時,請考量下列影響:

  • 標準加密:資料存取要求和資料傳輸作業會透過公用網際網路,使用標準 TLS 通訊協定進行傳輸加密。
  • 輸出費用:資料移轉會產生標準網際網路輸出費用,由遠端雲端供應商 (例如 AWS) 收取,這類費用通常高於私有互連輸出費率。
  • 延遲時間不一:網路效能、頻寬和延遲時間取決於公開網際網路的路由和壅塞情況,因此與專用私人互連網路相比,查詢執行時間較難預測。
  • 簡化設定:不需要額外的網路基礎架構、虛擬私有雲對等互連,或在 Google Cloud 或遠端雲端服務供應商中設定服務目錄。

架構總覽

透過公用網際網路查詢資料時,Lakehouse 會直接連線至遠端目錄和物件儲存端點,不需要私有 Google Cloud 或遠端雲端網路基礎架構。

公開網際網路查詢工作流程如下:

  1. BigQuery 會針對 Lakehouse 目錄中定義的聯合資料表啟動查詢。
  2. Lakehouse 會使用儲存在 Secret Manager 中的憑證或 OIDC 權杖聯盟,安全地向遠端 Apache Iceberg 目錄進行驗證。
  3. Lakehouse 會透過公開網際網路擷取資料表的中繼資料和資訊清單檔案,找出相關的基礎資料檔案 (例如 AWS Amazon S3 中的檔案)。
  4. 基礎物件的資料存取要求會透過標準 TLS 加密,直接從Google Cloud 透過公開網際網路傳送。
  5. 遠端儲存服務會使用 Lakehouse 提供的臨時範圍憑證驗證要求,並透過公用網際網路將要求的資料區塊傳回 Google Cloud。

智慧型快取

查詢遠端雲端資料時,Lakehouse 會自動在 Google Cloud內快取擷取的資料區塊。系統會自動為所有跨雲端查詢啟用快取,盡量減少遠端雲端服務供應商的輸出費用。後續查詢目標為快取資料時,會直接從本機 Google Cloud 儲存空間讀取,而不是跨雲端重新擷取資料。

節省輸出流量費用

在初始查詢執行期間,Lakehouse 會從遠端雲端供應商擷取所需資料區塊,並填入本機快取。後續查詢會直接從本機Google Cloud 快取讀取相同的資料區塊,而不是跨雲端重新擷取資料。

對於在相同資料集上重複查詢的工作負載,快取功能可從本機儲存空間提供資料要求,進而減少跨雲端輸出費用。實際的輸出費用節省金額取決於查詢存取模式、資料修改率,以及目標 Google Cloud區域的快取保留時間等因素。

在作業統計資料中驗證快取用量和輸出成本節省量

如要驗證查詢的快取命中率和輸出費用節省量,請檢查 BigQuery 控制台或 API (JobStatistics2) 中的查詢統計資料。由於查詢可以參照多個雲端服務供應商的資料,因此工作統計資料會提供重複的 object_storage_stats (objectStorageStats) 欄位,其中包含執行期間存取的每個雲端服務供應商的項目。

每個 object_storage_stats 項目都會回報下列指標:

  • cloud_provider (cloudProvider):代管物件儲存空間的雲端服務供應商 (例如 AWSAZURE)。
  • cache_bytes_read (cacheBytesRead):從本機 Google Cloud 快取讀取的位元組總數,可避免讀取遠端物件儲存空間。
  • object_storage_bytes_read (objectStorageBytesRead):直接從遠端雲端供應商的物件儲存空間讀取的總位元組數。

資料落地與管轄權考量

在 Google Cloud 區域中建立同盟目錄或連線時,系統會將靜態資料快取在該目標區域的本機。

如果遠端雲端資料位於不同地理區域或管轄區 (例如,歐盟的 AWS Amazon S3 與 us-east4 中的 BigQuery 計算資源配對),跨雲端查詢會將遠端資料的靜態資料快取副本儲存在目標Google Cloud 區域。建立連線或目錄的使用者或管理員,必須確保跨管轄區快取符合貴機構的資料落地、主權和法規遵循規定。

加密和 CMEK 支援

Lakehouse 快取不支援客戶自行管理的加密金鑰 (CMEK)。所有快取資料區塊都會使用預設的Google-owned and Google-managed encryption keys加密。

如果貴機構強制執行「限制非 CMEK 服務」機構政策限制 (constraints/gcp.restrictNonCmekServices),Lakehouse 會自動停用查詢的快取功能,避免存取受限制的資料表。查詢仍會順利執行,但不會快取資料區塊,也無法享有快取相關的輸出費用節省優惠。

後續步驟