在 BigQuery 中与无边界 Lakehouse 数据互动

无边界 Lakehouse 是一种存储 引擎,它可将 Google Cloud 和开源服务整合在一起,从而为高级分析和 AI 创建统一的 界面。它为构建开放式、托管式且高性能的湖仓一体架构奠定了基础,该架构使用 Apache Iceberg,具有自动化数据管理和内置治理功能。

在 Lakehouse 中 创建表时, 系统会自动在 BigQuery 中查询该表,并且该表会显示在 控制台的 Google Cloud BigQuery 页面上。您的 Lakehouse 命名空间和架构也会自动映射到 BigQuery 数据集。

Lakehouse 资源与其他 BigQuery 资源之间的区别

Lakehouse 资源与标准 BigQuery 资源之间的主要区别如下:

  • Lakehouse 数据集会显示在 控制台的 Google Cloud BigQuery 页面上,紧挨着 水滴图标。
  • 您无法通过 BigQuery 修改 Lakehouse 资源。
  • Lakehouse 资源在其各自的详细信息 部分中包含其他元数据。

Iceberg 表功能比较

下表比较了由 Lakehouse 运行时目录管理的 Apache Iceberg 表与由 BigQuery 管理的 Apache Iceberg 表的功能。

功能 由 Lakehouse 运行时目录管理的 Apache Iceberg 表 由 BigQuery 管理的 Apache Iceberg 表
目录 Lakehouse 运行时目录(与 Iceberg REST 目录兼容) BigQuery
存储 Cloud Storage Cloud Storage
可通过 Iceberg REST 目录端点访问 是,使用 BigQuery 目录联合
读/写互操作性
BigQuery 读取查询(SELECT、BQML、AI 函数) 支持 支持
BigQuery DML(INSERT、UPDATE、DELETE、MERGE) 支持(预览版) 支持(正式版)
OSS 引擎读取 支持(正式版) 支持(正式版)(使用 BigQuery 目录联合)
OSS 引擎写入 支持(正式版) 不支持
OSS 引擎流式写入(Kafka、Spark、Dataflow,使用 Iceberg I/O 接收器) 支持(正式版) 不支持
托管功能和高级功能
表管理(压缩、垃圾回收) 支持(预览版) 支持(正式版)
BigQuery 流式写入(存储写入 API) 不支持 支持(正式版)
Pub/Sub 流式传输/订阅、Dataflow 流式传输(使用 BigQuery I/O 接收器) 不支持 支持(正式版)
BigQuery 变更数据捕获 (CDC) 不支持 支持(非公开预览版)
BigQuery 多语句事务 不支持 支持(预览版)
托管式灾难恢复 不支持 不支持
搜索索引 不支持 不支持
向量索引(包括自动嵌入生成) 不支持 不支持
时间旅行
时间旅行(使用 OSS 引擎) 灵活(通过表属性配置) 不支持
时间旅行(使用 BigQuery) 限制为 7 天 限制为 7 天
快照历史记录和回滚到之前的快照 支持 不支持
治理、安全和共享
BigQuery 授权视图 不支持 不支持
BigQuery 列级安全性 不支持 支持(正式版)
BigQuery 数据遮盖和政策标记 不支持 支持(正式版)
BigQuery 行级安全性 不支持 不支持
Analytics Hub 集成 不支持 支持
Knowledge Catalog 功能
元数据编目、搜索和发现 支持 支持
沿袭 支持 支持
数据质量/分析 支持 支持
数据分析 支持 支持
基于 AI 的列和表说明生成 支持 支持

访问跨云数据

借助 Lakehouse 的 跨云数据访问功能 ,您可以直接通过 BigQuery 查询存储在其他云提供商中的数据,而无需迁移文件或构建复杂的 ETL 流水线。如需了解配置信息,请参阅 查询远程数据

后续步骤