Borderless Lakehouse は、オープン データ レイクハウスの構築用に設計された高性能ストレージ エンジンです。Apache Iceberg オープン テーブル形式をGoogle Cloudのフルマネージドのエンタープライズ グレードのストレージと統合することで、高度な分析と AI のための統合インターフェースを提供します。
オープン テーブルのメタデータを管理するために、Lakehouse は Lakehouse ランタイム カタログを使用します。このフルマネージドのサーバーレス メタデータ サービスは、異なるシステム間で信頼できる唯一の情報源を提供し、検出を一元化して、異なるリポジトリ間でメタデータを同期する必要をなくします。
Google Cloud の Lakehouse は、ストレージとコンピューティングを分離することで、分析システムとトランザクション システム間のシームレスな相互運用性を実現します。このアーキテクチャにより、Apache Spark、Apache Flink、Apache Hive、Trino、BigQuery などの複数のエンジンが単一の信頼できる情報源にアクセスできるようになり、データの重複が解消され、一貫した分析情報が確保されます。
主なメリット
- サーバーレス アーキテクチャ: Google Cloud の Lakehouse では、サーバーやクラスタの管理が不要になるため、運用オーバーヘッドが削減され、需要に応じて自動的にスケーリングされます。コンピューティング ワークロードの場合、サーバーレス バッチ セッションとインタラクティブ セッションにより、ジョブ間のリソース競合が解消され、インフラストラクチャのメンテナンスが自動化されます。
- 統合データ マネジメントとガバナンス: Knowledge Catalog との統合により、複数のエンジン間でガバナンス ポリシーを一元的に定義して適用し、セマンティック検索、データリネージ、品質チェックを行うことができます。
- ストレージ拡張機能: Google Cloud の Lakehouse は、Cloud Storage の管理機能を拡張して、Autoclass 階層化や顧客管理の暗号鍵(CMEK)などの機能を含めます。
- フルマネージド エクスペリエンス: BigQuery と統合すると、Google Cloud の Lakehouse はフルマネージドの分析と AI のエクスペリエンスを提供します。
- 高可用性と障害復旧: Google Cloud の Lakehouse には、データの高可用性をサポートするクロスリージョン レプリケーションと障害復旧(プレビュー)のオプションがあります。
ユースケース
- オープン レイクハウス: Cloud Storage をストレージ レイヤとして使用し、Google Cloud のレイクハウスは Apache Iceberg データの管理とガバナンスのインターフェースを提供します。
- 分析とトランザクションの統合: AlloyDB for PostgreSQL(プレビュー)内で分析 Apache Iceberg テーブルに直接アクセスし、分析データとトランザクション ワークロードを組み合わせます。
- 統合アクセス: 異なるエンジン(Apache Spark、Apache Flink、BigQuery)が、一貫性のあるメタデータを使用して同じ Apache Iceberg テーブルとやり取りできるようにします。
- クロスクラウド分析と AI: クロスクラウド データ(プレビュー)にアクセスして、他のクラウド プロバイダのメタデータを同期します。これにより、データを移行することなく、Apache Iceberg REST カタログ エンドポイントを介して BigQuery または外部のオープンソース エンジンでデータをクエリできます。
- 一般公開データセットの探索: インフラストラクチャを管理することなく、Apache Iceberg REST カタログ エンドポイントを使用して高品質の一般公開データセットを簡単にクエリできます。
- Hive Metastore: Hive カタログ(プレビュー)を使用して、Apache Spark や Apache Hive などのオープンソース エンジンを Lakehouse ランタイム カタログに接続します。これにより、セルフホストの Hive Metastore(HMS)を維持する運用上のオーバーヘッドが解消され、BigQuery でのシームレスなデータ共有とテーブルの直接クエリが可能になります。
インターフェースとツール
Google Cloud の Lakehouse リソースは、次のツールを使用して操作できます。
- Google Cloud コンソール: コンソールを使用して、カタログの作成、カタログ プロパティの表示、監査ログの表示、権限の構成を行います。
- BigQuery SQL: 標準 SQL DDL(データ定義言語)を使用して、Lakehouse ランタイム カタログと統合された Apache Iceberg テーブルと外部テーブルを作成して管理します。
- オープンソース エンジン: Lakehouse ランタイム カタログで Apache Spark、Apache Flink、Apache Hive などのエンジンを使用して、データの読み取りと書き込みを行います。
- IDE とノートブック: 対話型の Apache Spark ノートブックと IDE 拡張機能(VS Code 用の Data Agent Kit(DAK)拡張機能など)を使用して、Google Cloud に対する認証、コードの対話的な作成、開発環境内でのノートブック セッションの直接管理を行います。
- オーケストレーションと MLOps ツール: Managed Service for Apache Airflow(旧称 Cloud Composer)と Vertex AI の Kubeflow Pipelines を使用して、サーバーレス バッチ パイプラインとカタログ オペレーションをオーケストレーション ワークフローと統合します。
- Lakehouse ランタイム カタログ API: Apache Iceberg REST カタログ エンドポイントを使用して、オープン Apache Iceberg REST 仕様と互換性のあるツールを使用してサービスを操作します。
- Apache Iceberg テーブルのサポート: Apache Iceberg V2 テーブル(一般提供)と V3 テーブル(プレビュー)がサポートされています。Iceberg V1 テーブルはサポートされていません。
次のステップ
- Google Cloud のボーダーレス Lakehouse のアーキテクチャについて理解する。