適切なテーブル アーキテクチャを選択することは、パフォーマンスを最大化し、費用を削減し、分析ツール全体でデータアクセスを確保するために重要です。このページでは、ボーダーレス Lakehouse で使用できるさまざまなテーブル タイプとサービング エンドポイントについて説明します。これにより、書き込みエンジン、読み取り要件、管理制御のニーズに基づいて最適なオプションを選択できます。
カタログまたはエンジン別のテーブル形式
カタログまたはエンジンを選択して、サポートされているテーブル形式、メタストア構成、ストレージ最適化機能、エンジンの相互運用性について確認します。
Lakehouse ランタイム カタログ
Lakehouse ランタイム カタログは、Iceberg REST カタログ エンドポイントを介して Apache Iceberg テーブルを管理し、業界標準の Iceberg REST カタログ インターフェースに支えられながら、Iceberg 互換エンジン(Spark、Flink、Trino)と BigQuery の間でシームレスな読み書きの相互運用性を提供します。
サポートされている表形式
Apache Iceberg V2 テーブル(一般提供版)と V3 テーブル(プレビュー版)がサポートされています。Iceberg V1 テーブルはサポートされていません。既存の V1 テーブルを Lakehouse で使用する前に、サポートされているバージョンにアップグレードする必要があります。詳細については、Iceberg V1 テーブルを V2 にアップグレードするをご覧ください。
主な特長は以下のとおりです。
- Metastore: Lakehouse ランタイム カタログ。
- ストレージ: Cloud Storage。
- ストレージの最適化: ユーザーが管理するか、必要に応じて Google が管理します(プレビュー)。
- 読み取り / 書き込みアクセス:
- オープンソース エンジン: 読み取りと書き込み(一般提供)
- BigQuery: 読み取り/書き込み(プレビュー)
- ユースケース: 高度な分析、ストリーミング、AI 向けのハイ パフォーマンスのエンタープライズ グレードのストレージを備えたオープン レイクハウス。
Hive メタストア
Lakehouse ランタイム カタログは、Apache Spark ExternalCatalog 互換性用に最適化された Apache Hive メタストア(HMS)エンドポイントを介して Apache Hive テーブルを管理し、Apache Spark、Apache Hive、BigQuery 間でデータをシームレスに共有できるようにします。これらのテーブルは、オープンソース エンジンから作成して Cloud Storage に保存します。このオプションは、ETL ワークフローをオープンソース エンジンで管理し、個別のセルフホスト Hive metastore を必要とせず、BigQuery からの読み取りアクセスのみが必要な場合に最適です。
Hive メタストア エンドポイントで管理されるテーブルは、Apache Iceberg テーブルではなく、標準の Apache Hive テーブルと Spark テーブル(Hive SerDes または Spark データソースを使用)です。Lakehouse ランタイム カタログで Apache Iceberg テーブルを作成して管理するには、代わりに Iceberg REST カタログ エンドポイントを使用します。
主な特長は以下のとおりです。
- Metastore: Lakehouse ランタイム カタログ(カスタム
IMetastoreClientを使用)。 - ストレージ: Cloud Storage(Parquet、ORC、Avro などの形式をサポート)。
- ストレージの最適化: ユーザーまたはサードパーティによって管理されます。
- 読み取り / 書き込みアクセス:
- オープンソース エンジン(Spark と Hive): 読み取りと書き込み。
- BigQuery: 読み取り専用。
- ユースケース: 既存の Spark ワークロードと Hive ワークロードを Google Cloud上のフルマネージドのサーバーレス メタストアに移行します。
プロダクト別のテーブル形式
次のグラフを使用して、Lakehouse ランタイム カタログのテーブルタイプを比較します。
Lakehouse
| Apache Iceberg(一般提供) | クロスクラウド データアクセス(プレビュー) | Apache Hive(プレビュー) | |
|---|---|---|---|
| メタストア | Lakehouse ランタイム カタログ | Lakehouse ランタイム カタログ | Lakehouse ランタイム カタログ |
| ストレージ | Cloud Storage | Cloud Storage / Amazon S3 | Cloud Storage |
| ストレージの最適化 | お客様管理、サードパーティ管理、Google 管理(プレビュー) | お客様または第三者による管理 | お客様または第三者による管理 |
| 読み取り/書き込み |
オープンソース エンジン(読み取り/書き込み) BigQuery(読み取り/書き込み [プレビュー]) |
オープンソース エンジン(読み取り) BigQuery(読み取り) |
オープンソース エンジン(読み取り/書き込み) BigQuery(読み取り専用) |
| 高度なオペレーション | なし | なし | なし |
| アクセス制御 | IAM を使用したテーブルレベルのセキュリティ | IAM を使用したテーブルレベルのセキュリティ | IAM を使用したテーブルレベルのセキュリティ |
| ユースケース | オープン レイクハウス | ファイルを移行したり、複雑な ETL パイプラインを構築したりすることなく、他のクラウド プロバイダのデータにクエリを実行します。 | 既存の Spark ワークロードと Hive ワークロードをフルマネージドのサーバーレス metastore に移行する |
Iceberg テーブルの機能
次の表に、Lakehouse ランタイム カタログの Apache Iceberg テーブルで提供される機能の詳細を示します。
| 能力 | サポート |
|---|---|
| カタログ | Lakehouse ランタイム カタログ(Iceberg REST カタログ互換) |
| ストレージ | Cloud Storage |
| Iceberg REST カタログのエンドポイントを介してアクセス可能 | ○ |
| 読み取り/書き込みの相互運用性 | |
| BigQuery 読み取りクエリ(SELECT、BQML、AI 関数) | サポート対象(一般提供) |
| BigQuery DML(INSERT、UPDATE、DELETE、MERGE) | サポート対象(プレビュー) |
| OSS エンジンの読み取り | サポート対象(一般提供) |
| OSS エンジンの書き込み | サポート対象(一般提供) |
| OSS エンジンのストリーミング書き込み(Kafka、Spark、Iceberg I/O シンクを使用した Dataflow) | サポート対象(一般提供) |
| マネージド機能と高度な機能 | |
| テーブル管理(圧縮、ガベージ コレクション) | サポート対象(プレビュー) |
| BigQuery 変更データ キャプチャ(CDC) | サポート対象(プレビュー) |
| タイムトラベル | |
| タイムトラベル(OSS エンジンを使用) | 柔軟(テーブルのプロパティで構成) |
| タイムトラベル(BigQuery を使用) | 最長 7 日間 |
| スナップショットの履歴と以前のスナップショットへのロールバック | サポート対象(一般提供) |
| Knowledge Catalog の機能 | |
| メタデータのカタログ化、検索と見つけやすさ | サポート対象(一般提供) |
| リネージ | サポート対象(一般提供) |
| データ品質/プロファイリング | サポート対象(一般提供) |
| 分析情報 | サポート対象(一般提供) |
| AI ベースの列とテーブルの説明の生成 | サポート対象(一般提供) |
次のステップ
Apache Iceberg テーブルを管理する方法を学習する。