Memilih arsitektur tabel yang tepat sangat penting untuk memaksimalkan performa, mengurangi biaya, dan memastikan akses data di seluruh alat analisis Anda. Halaman ini menjelaskan berbagai jenis tabel dan endpoint penayangan yang tersedia di Lakehouse tanpa batas, sehingga membantu Anda memilih opsi terbaik berdasarkan mesin tulis, persyaratan baca, dan kebutuhan kontrol pengelolaan.
Format tabel menurut katalog atau mesin telusur
Pilih katalog atau mesin untuk mempelajari format tabel yang didukung, konfigurasi metastore, kemampuan pengoptimalan penyimpanan, dan interoperabilitas mesin.
Katalog runtime lakehouse
Katalog runtime Lakehouse mengelola tabel Apache Iceberg melalui endpoint katalog REST Iceberg dan menyediakan interoperabilitas baca-tulis yang lancar di seluruh mesin yang kompatibel dengan Iceberg (Spark, Flink, Trino) dan BigQuery, sekaligus didukung oleh antarmuka katalog REST Iceberg standar industri.
Format tabel yang didukung
Tabel Apache Iceberg V2 (GA) dan tabel V3 (Pratinjau) didukung. Tabel Iceberg V1 tidak didukung. Sebelum menggunakan tabel V1 yang ada dengan Lakehouse, Anda harus mengupgrade tabel tersebut ke versi yang didukung. Untuk mengetahui informasi selengkapnya, lihat Mengupgrade tabel Iceberg V1 ke V2.
Key features include:
- Metastore: Katalog runtime Lakehouse.
- Penyimpanan: Cloud Storage.
- Pengoptimalan penyimpanan: Dikelola oleh Anda, atau secara opsional oleh Google (Pratinjau).
- Akses baca dan tulis:
- Mesin open source: baca dan tulis (GA)
- BigQuery: baca/tulis (Pratinjau)
- Kasus penggunaan: Lakehouse terbuka dengan penyimpanan berperforma tinggi dan tingkat perusahaan untuk analisis lanjutan, streaming, dan AI.
Metastore Hive
Katalog runtime Lakehouse mengelola tabel Apache Hive melalui
endpoint metastore (HMS) Apache Hive yang dioptimalkan untuk kompatibilitas
ExternalCatalog Apache Spark, sehingga Anda dapat membagikan data dengan lancar di
Apache Spark, Apache Hive, dan BigQuery. Anda membuat tabel ini
dari mesin open source dan menyimpannya di Cloud Storage. Opsi ini paling cocok jika Anda ingin alur kerja ETL dikelola oleh mesin open source tanpa memerlukan metastore Hive yang dihosting sendiri secara terpisah, dan hanya memerlukan akses baca dari BigQuery.
Tabel yang dikelola oleh endpoint metastore Hive adalah tabel Apache Hive dan Spark standar (menggunakan SerDe Hive atau sumber data Spark), bukan tabel Apache Iceberg. Untuk membuat dan mengelola tabel Apache Iceberg di katalog runtime Lakehouse, gunakan endpoint katalog REST Iceberg.
Key features include:
- Metastore: Katalog runtime Lakehouse (melalui
IMetastoreClientkustom). - Penyimpanan: Cloud Storage (mendukung format seperti Parquet, ORC, dan Avro).
- Pengoptimalan penyimpanan: Dikelola oleh Anda atau pihak ketiga.
- Akses baca dan tulis:
- Mesin open source (Spark dan Hive): Baca dan tulis.
- BigQuery: hanya baca.
- Kasus penggunaan: Memigrasikan workload Spark dan Hive yang ada ke metastore serverless yang terkelola sepenuhnya di Google Cloud.
Format tabel menurut produk
Gunakan diagram berikut untuk membandingkan jenis tabel dalam katalog runtime Lakehouse.
Lakehouse
| Apache Iceberg (GA) | Akses data lintas cloud (Pratinjau) | Apache Hive (Pratinjau) | |
|---|---|---|---|
| Metastore | Katalog runtime lakehouse | Katalog runtime lakehouse | Katalog runtime lakehouse |
| Penyimpanan | Cloud Storage | Cloud Storage / Amazon S3 | Cloud Storage |
| Pengoptimalan penyimpanan | Dikelola pelanggan, dikelola pihak ketiga, atau dikelola Google (Pratinjau) | Dikelola pelanggan atau pihak ketiga | Dikelola pelanggan atau pihak ketiga |
| Baca/tulis |
Mesin open source (baca/tulis) BigQuery (baca/tulis [Pratinjau]) |
Mesin open source (baca) BigQuery (baca) |
Mesin open source (baca/tulis) BigQuery (hanya baca) |
| Operasi lanjutan | Tidak ada | Tidak satu pun | Tidak ada |
| Access control | Keamanan tingkat tabel dengan IAM | Keamanan tingkat tabel dengan IAM | Keamanan tingkat tabel dengan IAM |
| Use cases | Lakehouse terbuka | Buat kueri data di penyedia cloud lain tanpa memigrasikan file atau membuat pipeline ETL yang kompleks. | Memigrasikan workload Spark dan Hive yang ada ke metastore serverless yang terkelola sepenuhnya |
Kemampuan tabel Iceberg
Gunakan tabel berikut untuk mempelajari lebih lanjut kemampuan yang ditawarkan di tabel Apache Iceberg dalam katalog runtime Lakehouse.
| Kemampuan | Dukungan |
|---|---|
| Catalog | Katalog runtime Lakehouse (kompatibel dengan katalog REST Iceberg) |
| Penyimpanan | Cloud Storage |
| Dapat diakses melalui endpoint katalog REST Iceberg | Ya |
| Interoperabilitas Baca/Tulis | |
| Kueri baca BigQuery (SELECT, BQML, fungsi AI) | Didukung (GA) |
| DML BigQuery (INSERT, UPDATE, DELETE, MERGE) | Didukung (Pratinjau) |
| Pembacaan mesin OSS | Didukung (GA) |
| Penulisan mesin OSS | Didukung (GA) |
| Penulisan streaming mesin OSS (Kafka, Spark, Dataflow dengan sink I/O Iceberg) | Didukung (GA) |
| Kemampuan Terkelola dan Lanjutan | |
| Pengelolaan tabel (pemadatan, pembersihan sampah memori) | Didukung (Pratinjau) |
| Perjalanan Waktu | |
| Menembus waktu (menggunakan mesin OSS) | Fleksibel (dikonfigurasi melalui properti tabel) |
| Perjalanan waktu (menggunakan BigQuery) | Dibatasi hingga 7 hari |
| Histori snapshot dan rollback ke snapshot sebelumnya | Didukung (GA) |
| Kemampuan katalog pengetahuan | |
| Pengatalogan, penelusuran, dan penemuan metadata | Didukung (GA) |
| Silsilah | Didukung (GA) |
| Kualitas/pembuatan profil data | Didukung (GA) |
| Insight | Didukung (GA) |
| Pembuatan deskripsi kolom dan tabel berbasis AI | Didukung (GA) |
Langkah berikutnya
Pelajari cara mengelola tabel Apache Iceberg.
Pelajari cara mengimpor tabel Iceberg eksternal menggunakan Dataflow.