Membandingkan jenis tabel

Memilih arsitektur tabel yang tepat sangat penting untuk memaksimalkan performa, mengurangi biaya, dan memastikan akses data di seluruh alat analisis Anda. Halaman ini menjelaskan berbagai jenis tabel dan endpoint penayangan yang tersedia di Lakehouse untuk Apache Iceberg, yang membantu Anda memilih opsi terbaik berdasarkan mesin tulis, persyaratan baca, dan kebutuhan kontrol pengelolaan.

Format tabel menurut katalog atau mesin

Pilih katalog atau mesin untuk mempelajari format tabel yang didukung, konfigurasi metastore, kemampuan pengoptimalan penyimpanan, dan interoperabilitas mesin.

Katalog runtime Lakehouse

Katalog runtime Lakehouse mengelola tabel Apache Iceberg melalui endpoint katalog REST Iceberg dan menyediakan interoperabilitas baca-tulis yang lancar di seluruh mesin yang kompatibel dengan Iceberg (Spark, Flink, Trino) dan BigQuery, sekaligus didukung oleh antarmuka katalog REST Iceberg standar industri.

Format tabel yang didukung

Tabel Apache Iceberg V2 (GA) dan tabel V3 (Pratinjau) didukung. Tabel Iceberg V1 tidak didukung. Sebelum menggunakan tabel V1 yang ada dengan Lakehouse untuk Apache Iceberg, Anda harus mengupgrade-nya ke versi yang didukung. Untuk mengetahui informasi selengkapnya, lihat Mengupgrade tabel Iceberg V1 ke V2.

Key features include:

  • Metastore: Katalog runtime Lakehouse.
  • Penyimpanan: Cloud Storage.
  • Pengoptimalan penyimpanan: Dikelola oleh Anda, atau secara opsional oleh Google (Pratinjau).
  • Akses baca dan tulis:
    • Mesin open source: baca dan tulis (GA)
    • BigQuery: baca/tulis (Pratinjau)
  • Kasus penggunaan: Lakehouse terbuka dengan penyimpanan berperforma tinggi dan tingkat perusahaan untuk analisis lanjutan, streaming, dan AI.

Metastore Hive

Katalog runtime Lakehouse mengelola tabel Apache Hive melalui endpoint metastore Apache Hive (HMS) yang dioptimalkan untuk kompatibilitas ExternalCatalog Apache Spark, sehingga Anda dapat berbagi data dengan lancar di seluruh Apache Spark, Apache Hive, dan BigQuery. Anda membuat tabel ini dari mesin open source dan menyimpannya di Cloud Storage. Opsi ini paling cocok jika Anda ingin alur kerja ETL dikelola oleh mesin open source tanpa memerlukan metastore Hive yang dihosting sendiri secara terpisah, dan hanya memerlukan akses baca dari BigQuery.

Tabel yang dikelola oleh endpoint metastore Hive adalah tabel Apache Hive dan Spark standar (menggunakan sumber data Hive SerDes atau Spark), bukan tabel Apache Iceberg. Untuk membuat dan mengelola tabel Apache Iceberg di katalog runtime Lakehouse, gunakan endpoint katalog REST Iceberg.

Key features include:

  • Metastore: Katalog runtime Lakehouse (melalui kustom IMetastoreClient).
  • Penyimpanan: Cloud Storage (mendukung format seperti Parquet, ORC, dan Avro).
  • Pengoptimalan penyimpanan: Dikelola oleh Anda atau pihak ketiga.
  • Akses baca dan tulis:
    • Mesin open source (Spark dan Hive): Baca dan tulis.
    • BigQuery: hanya baca.
  • Kasus penggunaan: Memigrasikan workload Spark dan Hive yang ada ke metastore serverless yang terkelola sepenuhnya di Google Cloud.

BigQuery

BigQuery mendukung tabel terkelola Apache Iceberg, tabel native, dan tabel eksternal.

  • Tabel terkelola Apache Iceberg: Ini adalah tabel Apache Iceberg yang Anda buat dan kelola dari BigQuery dan disimpan di Cloud Storage. Meskipun dapat dibaca oleh mesin open source, BigQuery adalah mesin yang mengelola metadata dan menulis ke tabel tersebut. Opsi ini paling cocok jika Anda ingin alur kerja dikelola sepenuhnya oleh BigQuery.

  • Tabel native: Ini adalah tabel BigQuery native. Tabel ini terkelola sepenuhnya dan menawarkan fitur analisis dan pengelolaan paling canggih. Opsi ini paling cocok untuk workload non-Iceberg.

  • Tabel eksternal: Tabel ini adalah konstruksi khusus BigQuery untuk data yang disimpan di Cloud Storage, Amazon S3, atau Azure Blob Storage. Data dan metadata dikelola sendiri, dan BigQuery hanya memiliki akses baca. Pilih opsi ini untuk data yang ingin Anda kelola di katalog atau penyimpanan pihak ketiga secara langsung.

Format tabel menurut produk

Gunakan diagram berikut untuk membandingkan jenis tabel antara katalog runtime Lakehouse dan BigQuery.

Lakehouse

Apache Iceberg (GA) Lakehouse lintas cloud (Pratinjau) Apache Hive (Pratinjau)
Metastore Katalog runtime Lakehouse Katalog runtime Lakehouse Katalog runtime Lakehouse
Penyimpanan Cloud Storage Cloud Storage / Amazon S3 Cloud Storage
Pengoptimalan penyimpanan Pelanggan, dikelola pihak ketiga, atau dikelola Google (Pratinjau) Pelanggan atau dikelola pihak ketiga Pelanggan atau dikelola pihak ketiga
Baca/tulis Mesin open source (baca/tulis)

BigQuery (baca/tulis [Pratinjau])
Mesin open source (baca)

BigQuery (baca)
Mesin open source (baca/tulis)

BigQuery (hanya baca)
Operasi lanjutan Tidak ada Tidak satu pun Tidak ada
Kasus penggunaan Lakehouse terbuka Membuat kueri data di penyedia cloud lain tanpa memigrasikan file atau membuat pipeline ETL yang kompleks. Memigrasikan workload Spark dan Hive yang ada ke metastore serverless yang terkelola sepenuhnya,

BigQuery

Tabel terkelola Apache Iceberg Tabel eksternal Tabel standar
Metastore BigQuery Metastore eksternal atau yang dihosting sendiri BigQuery
Penyimpanan Cloud Storage Cloud Storage / Amazon S3 / Azure BigQuery
Pengoptimalan penyimpanan Dikelola Google Pelanggan atau dikelola pihak ketiga Dikelola Google
Baca/tulis Mesin open source (hanya baca dengan library Iceberg, interoperabilitas baca/tulis dengan BigQuery Storage API)

BigQuery (baca/tulis)

Mesin open source (baca/tulis)

BigQuery (hanya baca)
Mesin open source (interoperabilitas baca/tulis dengan BigQuery Storage API)

BigQuery (baca/tulis)

Operasi lanjutan Streaming throughput tinggi dengan BigQuery Storage Write API, Change Data Capture (CDC), dan transaksi multi-pernyataan Tidak ada Streaming throughput tinggi dengan BigQuery Storage Write API, Change Data Capture (CDC), dan transaksi multi-pernyataan
Kasus penggunaan Lakehouse terbuka dengan penyimpanan berperforma tinggi dan tingkat perusahaan untuk analisis lanjutan, streaming, dan AI Tabel staging untuk pemuatan BigQuery, tabel lama yang hanya dapat dikueri Penyimpanan tingkat perusahaan untuk analisis lanjutan, streaming, dan AI

Langkah berikutnya