Membandingkan jenis tabel

Memilih arsitektur tabel yang tepat sangat penting untuk memaksimalkan performa, mengurangi biaya, dan memastikan akses data di seluruh alat analisis Anda. Halaman ini menjelaskan berbagai jenis tabel dan endpoint penayangan yang tersedia di Lakehouse tanpa batas, sehingga membantu Anda memilih opsi terbaik berdasarkan mesin tulis, persyaratan baca, dan kebutuhan kontrol pengelolaan.

Format tabel menurut katalog atau mesin telusur

Pilih katalog atau mesin untuk mempelajari format tabel yang didukung, konfigurasi metastore, kemampuan pengoptimalan penyimpanan, dan interoperabilitas mesin.

Katalog runtime lakehouse

Katalog runtime Lakehouse mengelola tabel Apache Iceberg melalui endpoint katalog REST Iceberg dan menyediakan interoperabilitas baca-tulis yang lancar di seluruh mesin yang kompatibel dengan Iceberg (Spark, Flink, Trino) dan BigQuery, sekaligus didukung oleh antarmuka katalog REST Iceberg standar industri.

Format tabel yang didukung

Tabel Apache Iceberg V2 (GA) dan tabel V3 (Pratinjau) didukung. Tabel Iceberg V1 tidak didukung. Sebelum menggunakan tabel V1 yang ada dengan Lakehouse, Anda harus mengupgrade tabel tersebut ke versi yang didukung. Untuk mengetahui informasi selengkapnya, lihat Mengupgrade tabel Iceberg V1 ke V2.

Key features include:

  • Metastore: Katalog runtime Lakehouse.
  • Penyimpanan: Cloud Storage.
  • Pengoptimalan penyimpanan: Dikelola oleh Anda, atau secara opsional oleh Google (Pratinjau).
  • Akses baca dan tulis:
    • Mesin open source: baca dan tulis (GA)
    • BigQuery: baca/tulis (Pratinjau)
  • Kasus penggunaan: Lakehouse terbuka dengan penyimpanan berperforma tinggi dan tingkat perusahaan untuk analisis lanjutan, streaming, dan AI.

Metastore Hive

Katalog runtime Lakehouse mengelola tabel Apache Hive melalui endpoint metastore (HMS) Apache Hive yang dioptimalkan untuk kompatibilitas ExternalCatalog Apache Spark, sehingga Anda dapat membagikan data dengan lancar di Apache Spark, Apache Hive, dan BigQuery. Anda membuat tabel ini dari mesin open source dan menyimpannya di Cloud Storage. Opsi ini paling cocok jika Anda ingin alur kerja ETL dikelola oleh mesin open source tanpa memerlukan metastore Hive yang dihosting sendiri secara terpisah, dan hanya memerlukan akses baca dari BigQuery.

Tabel yang dikelola oleh endpoint metastore Hive adalah tabel Apache Hive dan Spark standar (menggunakan SerDe Hive atau sumber data Spark), bukan tabel Apache Iceberg. Untuk membuat dan mengelola tabel Apache Iceberg di katalog runtime Lakehouse, gunakan endpoint katalog REST Iceberg.

Key features include:

  • Metastore: Katalog runtime Lakehouse (melalui IMetastoreClient kustom).
  • Penyimpanan: Cloud Storage (mendukung format seperti Parquet, ORC, dan Avro).
  • Pengoptimalan penyimpanan: Dikelola oleh Anda atau pihak ketiga.
  • Akses baca dan tulis:
    • Mesin open source (Spark dan Hive): Baca dan tulis.
    • BigQuery: hanya baca.
  • Kasus penggunaan: Memigrasikan workload Spark dan Hive yang ada ke metastore serverless yang terkelola sepenuhnya di Google Cloud.

Format tabel menurut produk

Gunakan diagram berikut untuk membandingkan jenis tabel dalam katalog runtime Lakehouse.

Lakehouse

Apache Iceberg (GA) Akses data lintas cloud (Pratinjau) Apache Hive (Pratinjau)
Metastore Katalog runtime lakehouse Katalog runtime lakehouse Katalog runtime lakehouse
Penyimpanan Cloud Storage Cloud Storage / Amazon S3 Cloud Storage
Pengoptimalan penyimpanan Dikelola pelanggan, dikelola pihak ketiga, atau dikelola Google (Pratinjau) Dikelola pelanggan atau pihak ketiga Dikelola pelanggan atau pihak ketiga
Baca/tulis Mesin open source (baca/tulis)

BigQuery (baca/tulis [Pratinjau])
Mesin open source (baca)

BigQuery (baca)
Mesin open source (baca/tulis)

BigQuery (hanya baca)
Operasi lanjutan Tidak ada Tidak satu pun Tidak ada
Access control Keamanan tingkat tabel dengan IAM Keamanan tingkat tabel dengan IAM Keamanan tingkat tabel dengan IAM
Use cases Lakehouse terbuka Buat kueri data di penyedia cloud lain tanpa memigrasikan file atau membuat pipeline ETL yang kompleks. Memigrasikan workload Spark dan Hive yang ada ke metastore serverless yang terkelola sepenuhnya

Kemampuan tabel Iceberg

Gunakan tabel berikut untuk mempelajari lebih lanjut kemampuan yang ditawarkan di tabel Apache Iceberg dalam katalog runtime Lakehouse.

Kemampuan Dukungan
Catalog Katalog runtime Lakehouse (kompatibel dengan katalog REST Iceberg)
Penyimpanan Cloud Storage
Dapat diakses melalui endpoint katalog REST Iceberg Ya
Interoperabilitas Baca/Tulis
Kueri baca BigQuery (SELECT, BQML, fungsi AI) Didukung (GA)
DML BigQuery (INSERT, UPDATE, DELETE, MERGE) Didukung (Pratinjau)
Pembacaan mesin OSS Didukung (GA)
Penulisan mesin OSS Didukung (GA)
Penulisan streaming mesin OSS (Kafka, Spark, Dataflow dengan sink I/O Iceberg) Didukung (GA)
Kemampuan Terkelola dan Lanjutan
Pengelolaan tabel (pemadatan, pembersihan sampah memori) Didukung (Pratinjau)
Perjalanan Waktu
Menembus waktu (menggunakan mesin OSS) Fleksibel (dikonfigurasi melalui properti tabel)
Perjalanan waktu (menggunakan BigQuery) Dibatasi hingga 7 hari
Histori snapshot dan rollback ke snapshot sebelumnya Didukung (GA)
Kemampuan katalog pengetahuan
Pengatalogan, penelusuran, dan penemuan metadata Didukung (GA)
Silsilah Didukung (GA)
Kualitas/pembuatan profil data Didukung (GA)
Insight Didukung (GA)
Pembuatan deskripsi kolom dan tabel berbasis AI Didukung (GA)

Langkah berikutnya