有了跨雲端資料存取功能,您就能直接從 Google Cloud 查詢其他雲端供應商儲存的資料,不必移轉檔案,也不必使用 Cross-Cloud Interconnect 建立複雜的 ETL 管道。
這項功能是無邊界湖倉的一部分,可讓您使用 BigQuery、獨立的 Apache Spark 環境或 Managed Service for Apache Spark,對分散式資料集執行統一分析及套用 AI。
除了分析查詢,您也可以使用同盟資料取得 AI 輔助洞察和進行控管:
- 對話式數據分析: 根據確切的資料來源 (包括跨雲端資料表) 建構專用代理,透過單一對話分析不同雲端環境中的資料。
- Knowledge Catalog: 使用 Knowledge Catalog 功能,透過聯邦資料來源進行資料剖析和深入分析。
用途
Lakehouse 支援多種重要用途,可存取多個雲端服務供應商的資料:
- 減少資料遷移:您可以直接查詢儲存在其他雲端環境中的資料,簡化資料存取和處理作業。
- 統一分析:無論資料位於何處,您都能使用一致的功能和硬體最佳化技術,對所有資料執行進階分析。
- 無邊界 AI 和機器學習可讓您直接將 AI 模型、自主代理程式和機器學習套用至遠端資料,不必遷移資料。
存取跨雲端資料的運作方式
資料湖倉會透過下列程序查詢遠端資料:
- 中繼資料探索: Google CloudLakehouse 會連線至遠端 Apache Iceberg REST 目錄,例如 Databricks Unity 或 AWS Glue。湖倉會探索資料,不會複製任何檔案。視遠端目錄提供者而定,Lakehouse 會透過 Secret Manager 或 OpenID Connect 權杖聯盟,以 Google 做為身分提供者 (OIDC 權杖聯盟),安全地進行驗證。
- 安全傳輸:選擇透過私有互連網路 (例如專屬 CCI 或合作夥伴互連網路) 傳輸流量,可大幅降低資料移轉費用,且延遲時間非常穩定,相較於公用網際網路更具優勢。
- 最佳化執行:由於查詢會從遠端雲端讀取資料,Lakehouse 會在專用儲存空間的 Google Cloud 中,暫時在本機快取這些資料區段。後續查詢會使用本機快取,避免產生大量跨雲端輸出費用。
支援的目錄
Lakehouse 支援從下列遠端目錄供應商查詢資料:
- Databricks Unity Catalog:支援 Amazon Web Services (AWS) 和 Google Cloud。
- AWS Glue:Amazon Web Services (AWS) 支援這項服務。
- Snowflake Horizon Catalog:支援 Amazon Web Services (AWS) 和 Google Cloud。
- SAP Business Data Cloud (BDC):使用 SAP BDC 連接器支援。
核心概念
本節說明使用跨雲端資料存取功能時,不可或缺的重要元件。
中繼資料層
中繼資料層會連線至遠端 Apache Iceberg REST 目錄端點,根據重新整理間隔同步處理 Iceberg 資源 (命名空間、資料表) 中繼資料。Lakehouse 會透過儲存在 Secret Manager 或 OIDC 權杖聯盟中的 OAuth 憑證,安全地進行驗證。
傳輸層
傳輸層可讓 BigQuery 和開放原始碼引擎使用中繼資料層的同步中繼資料查詢資料。對於特定類型的遠端目錄,Lakehouse 支援透過公開網際網路或專屬私人互連網路查詢資料。
選取符合架構和安全性需求的傳輸方式:
客戶擁有的帳戶 (CCI)
您可以設定 BigQuery,透過私人 Cross-Cloud Interconnect,使用專屬 Cross-Cloud Interconnect或合作夥伴 Cross-Cloud Interconnect,查詢儲存在 Amazon Web Services (AWS) Amazon S3 bucket 中的資料。
使用私人互連網路可享有下列優點:
- 提升安全性:資料會在 Google Cloud 和 AWS 之間的私人網路連線中傳輸,避開公開網際網路。
- 降低費用:相較於網際網路輸出,從 AWS 輸出資料的費用可能較低,尤其是搭配私人互連容量時。
- 穩定效能:與公開網際網路相比,網路延遲時間和頻寬更可預測。
架構總覽
如要啟用私人查詢,請透過私人互連設定從 BigQuery 到 AWS Amazon S3 bucket 的路徑。虛擬私有雲 (VPC) Google Cloud的重要元件是內部負載平衡器 (ILB)。ILB 會將 BigQuery 的要求分配至 AWS VPC 內 Amazon S3 的私人端點,這些端點是使用 AWS PrivateLink 佈建。
使用 ILB 時,必須將多個彈性網路介面 (ENI) 做為後端,才能進行負載平衡、擴充及確保高可用性。無論您使用專屬 CCI 或 Partner Interconnect,都適用這項規定。
私人查詢工作流程如下:
- BigQuery 會使用透過 Service Directory 服務設定的連線。
- Service Directory 會將服務名稱解析為 Google Cloud ILB 的內部 IP 位址。
- ILB 會接收來自 BigQuery 的要求,並將要求分配至已設定的後端。
- ILB 後端是混合式連線網路端點群組 (NEG),每個群組都指向 AWS VPC 中 ENI 的私人 IP 位址。
- 流量會從 ILB 經由 NEG,透過私有互連,傳輸至 AWS ENI。
- AWS ENI 是 Amazon S3 VPC 介面端點 (AWS PrivateLink) 的一部分,可提供 Amazon S3 服務的私有存取權。
公開網際網路 (無 CCI)
如未設定私有互連,查詢遠端目錄的預設路徑會經過公開網際網路。
透過公用網際網路查詢資料時,請考量下列影響:
- 標準加密:資料存取要求和資料傳輸作業會透過公用網際網路,使用標準 TLS 通訊協定進行傳輸加密。
- 輸出費用:資料移轉會產生標準網際網路輸出費用,由遠端雲端供應商 (例如 AWS) 收取,這類費用通常高於私有互連輸出費率。
- 延遲時間不一:網路效能、頻寬和延遲時間取決於公開網際網路的路由和壅塞情況,因此與專用私人互連網路相比,查詢執行時間較難預測。
- 簡化設定:不需要額外的網路基礎架構、虛擬私有雲對等互連,或在 Google Cloud 或遠端雲端服務供應商中設定服務目錄。
架構總覽
透過公用網際網路查詢資料時,Lakehouse 會直接連線至遠端目錄和物件儲存端點,不需要私有 Google Cloud 或遠端雲端網路基礎架構。
公開網際網路查詢工作流程如下:
- BigQuery 會針對 Lakehouse 目錄中定義的聯合資料表啟動查詢。
- Lakehouse 會使用儲存在 Secret Manager 中的憑證或 OIDC 權杖聯盟,安全地向遠端 Apache Iceberg 目錄進行驗證。
- Lakehouse 會透過公開網際網路擷取資料表的中繼資料和資訊清單檔案,找出相關的基礎資料檔案 (例如 AWS Amazon S3 中的檔案)。
- 基礎物件的資料存取要求會透過標準 TLS 加密,直接從Google Cloud 透過公開網際網路傳送。
- 遠端儲存服務會使用 Lakehouse 提供的臨時範圍憑證驗證要求,並透過公用網際網路將要求的資料區塊傳回 Google Cloud。