Konsep utama

Dokumen ini mendefinisikan istilah dan konsep utama untuk Lakehouse tanpa batas.

Halaman ini bukan daftar lengkap fitur, melainkan referensi umum istilah dan konsep yang digunakan di seluruh dokumentasi Lakehouse Google Cloud.

Konsep Inti

Konsep berikut membentuk fondasi arsitektur Lakehouse Google Cloud.

Data lakehouse

Data lakehouse menggabungkan penghematan biaya dan fleksibilitas data lake dengan pengelolaan data dan performa data warehouse. Dengan demikian, Anda dapat menyimpan data dalam format terbuka di Cloud Storage dan menggunakan fitur BigQuery, seperti kontrol keamanan yang akurat dan kueri cepat.

Arsitektur medali

Pola desain umum dalam lakehouse data adalah arsitektur medali, yang secara logis mengatur data ke dalam lapisan struktur dan kualitas progresif:

  • Lapisan perunggu (mentah): Menyerap dan menyimpan data mentah dalam format terbuka seperti Apache Iceberg di Cloud Storage.
  • Lapisan silver (dibersihkan): Membersihkan, memfilter, dan memperkaya data mentah menjadi tabel standar.
  • Lapisan gold (pilihan): Menyediakan tabel tingkat bisnis yang telah dikurasi dan diagregasi sepenuhnya. Di Lakehouse Google Cloud, BigQuery sering digunakan untuk menyajikan lapisan emas untuk konsumsi, pelaporan, dan analisis berperforma tinggi.

Interoperabilitas Terbuka

Interoperabilitas terbuka adalah kemampuan beberapa sistem analitik dan transaksional, seperti BigQuery, Apache Spark, dan Apache Flink, untuk beroperasi pada satu salinan data dalam format terbuka seperti Apache Iceberg. Dengan demikian, Anda tidak perlu melakukan duplikasi data dan dapat memastikan tampilan data yang konsisten di berbagai alat yang berbeda.

Katalog runtime lakehouse

Katalog runtime Lakehouse adalah layanan metadata terpusat tanpa server yang berfungsi sebagai satu sumber tepercaya untuk Lakehouse Google Cloud. BigLake memungkinkan beberapa mesin, seperti Apache Spark, Apache Flink, dan BigQuery, menemukan dan mengkueri tabel yang sama secara bersamaan.

Jenis Katalog

Katalog runtime Lakehouse menawarkan berbagai jenis katalog untuk mengelola metadata Anda.

Endpoint katalog REST Apache Iceberg

Ini adalah katalog berdasarkan endpoint katalog REST Apache Iceberg. BigLake menyediakan interoperabilitas antara mesin open source dan BigQuery, serta mendukung fitur seperti penyediaan kredensial dan pemulihan dari bencana.

Konfigurasi penyimpanan katalog

Saat membuat endpoint katalog REST Apache Iceberg, Anda dapat memilih di antara dua model penyimpanan:

  • Katalog multi-bucket (direkomendasikan): Memungkinkan Anda memberi nama katalog secara independen dan mengonfigurasi hingga 15 bucket Cloud Storage (default_location dan restricted_locations). Saat mengonfigurasi mesin kueri klien (seperti Spark atau Trino), tetapkan jalur gudang ke bl://projects/PROJECT_ID/catalogs/CATALOG_ID.
  • Katalog bucket tunggal: Konfigurasi lama tempat katalog dikunci ke satu bucket Cloud Storage dan mewarisi nama bucket. Saat mengonfigurasi mesin kueri klien, tetapkan jalur gudang ke gs://CLOUD_STORAGE_BUCKET_NAME.

Katalog Apache Iceberg kustom untuk BigQuery

Integrasi ini menggunakan katalog BigQuery secara langsung sebagai layanan metadata pendukung untuk tabel Apache Iceberg terkelola.

Endpoint katalog Apache Hive

Endpoint ini menyediakan kompatibilitas untuk workload open source yang bergantung pada antarmuka metastore Apache Hive (HMS), sehingga Anda dapat menjalankan workload Apache Hive atau Spark terhadap layanan metastore terkelola sepenuhnya di Google Cloud.

Jenis tabel

Lakehouse Google Cloud mendukung beberapa format tabel, bergantung pada mesin yang digunakan untuk mengelola data dan endpoint katalog yang Anda gunakan.

Tabel Apache Iceberg

Ini adalah tabel Apache Iceberg yang Anda buat dari mesin open source dan disimpan di Cloud Storage. Katalog runtime Lakehouse mengelola tabel ini melalui endpoint katalog REST Apache Iceberg. Mesin open source memiliki akses baca dan tulis ke tabel ini, sedangkan BigQuery memiliki akses hanya baca. Opsi ini paling cocok jika Anda ingin alur kerja ETL dikelola oleh mesin open source.

Tabel BigQuery

Tabel ini dikelola dengan BigQuery.

Tabel Apache Iceberg

Ini adalah tabel Apache Iceberg yang Anda buat dari BigQuery dan disimpan di Cloud Storage. BigQuery menangani semua tata letak dan pengoptimalan data. Meskipun tabel ini dapat dibaca oleh beberapa mesin, BigQuery adalah satu-satunya mesin yang dapat menulis langsung ke tabel tersebut.

Tabel native

Tabel ini dikelola oleh BigQuery dan menyimpan data di penyimpanan BigQuery. Anda dapat menghubungkan tabel ini ke katalog runtime Lakehouse.

Tabel eksternal

Tabel eksternal berada di luar katalog runtime Lakehouse. Data dan metadata dikelola sendiri di katalog pihak ketiga (seperti Cloud Storage, S3, atau Azure Blob Storage). BigQuery hanya dapat membaca dari tabel ini.

Fitur Tabel

Evolusi tabel

Lakehouse Google Cloud mendukung evolusi tabel Apache Iceberg, yang memungkinkan Anda mengubah skema atau spesifikasi partisi tabel dari waktu ke waktu tanpa menulis ulang data tabel atau membuat ulang tabel.

Perjalanan waktu

Perjalanan waktu memungkinkan Anda mengkueri data tabel sebagaimana adanya pada titik waktu atau ID snapshot tertentu. Hal ini berguna untuk mengaudit, mereproduksi eksperimen, atau memulihkan data setelah penghapusan yang tidak disengaja.

Caching Metadata

Caching metadata adalah fitur yang mempercepat performa kueri untuk tabel eksternal. Fitur ini menyimpan salinan metadata tabel di penyimpanan BigQuery, sehingga mengurangi kebutuhan untuk membaca file metadata dari Cloud Storage selama eksekusi kueri.

Pengelolaan tabel Lakehouse Google Cloud

Pengelolaan tabel Lakehouse Google Cloud menyederhanakan pemeliharaan lakehouse dengan mengotomatiskan tugas seperti pemadatan dan pembersihan sampah memori untuk tabel terkelola. Hal ini memastikan performa kueri dan efisiensi penyimpanan yang optimal.

Konsep Interoperabilitas

Borderless Lakehouse

Lakehouse tanpa batas memperluas Lakehouse Google Cloud, sehingga Anda dapat terhubung ke katalog eksternal jarak jauh (seperti Databricks Unity Catalog, AWS Glue, Snowflake Horizon Catalog, atau SAP BDC). BigLake menyinkronkan metadata dari penyedia cloud lain, sehingga Anda dapat membuat kueri data dengan BigQuery atau mesin open source eksternal melalui endpoint katalog REST Apache Iceberg, tanpa memigrasikan data.

Set data publik

Lakehouse Google Cloud menghosting set data publik berkualitas tinggi yang ditayangkan melalui katalog REST Apache Iceberg, sehingga memberikan akses hanya baca untuk eksplorasi dan pengujian tanpa perlu mengelola infrastruktur.

Struktur penamaan P.C.N.T.

Struktur penamaan P.C.N.T. adalah konvensi empat bagian yang digunakan untuk mengidentifikasi dan membuat kueri tabel secara unik dalam katalog runtime Lakehouse dari BigQuery. Ini adalah singkatan dari Project.Catalog.Namespace.Table:

  • Project: ID project Google Cloud .
  • Katalog: Nama katalog runtime Lakehouse.
  • Namespace: Pengelompokan logis untuk tabel (mirip dengan set data).
  • Tabel: Nama tabel data.

Konsep Keamanan

Koneksi

Koneksi adalah resource BigQuery yang menyimpan kredensial untuk mengakses data eksternal. Di Lakehouse Google Cloud, koneksi mendelegasikan akses ke Cloud Storage dengan mengizinkan akun layanan koneksi mengakses bucket penyimpanan atas nama Anda.

Pemberian Kredensial

Pemberian kredensial adalah mekanisme keamanan yang membantu memperketat kontrol akses saat menggunakan katalog runtime Lakehouse. Jika diaktifkan, layanan akan membuat kredensial yang berlaku singkat dan dipersempit cakupannya yang dirancang untuk memberikan akses hanya ke jalur file tertentu yang diperlukan untuk kueri.

Tata kelola terpadu

Tata kelola terpadu memungkinkan Anda menentukan dan menerapkan kebijakan keamanan dan pengelolaan data secara terpusat melalui integrasi dengan Knowledge Catalog. Saat Anda mendaftarkan tabel ke katalog runtime Lakehouse, sistem akan otomatis mendaftarkan entri yang sesuai ke katalog metadata bisnis (Knowledge Catalog), sehingga memungkinkan silsilah data, penelusuran semantik, dan tata kelola terpusat di seluruh mesin tanpa memindahkan atau menyalin file.

Konsep Query Engine

Lakehouse Google Cloud memisahkan penyimpanan dari komputasi, sehingga memungkinkan berbagai mesin analisis berinteraksi dengan tabel terbuka.

Managed Service untuk Apache Spark

Managed Service untuk Apache Spark (sebelumnya Managed Service untuk Apache Spark) menyediakan runtime yang terkelola sepenuhnya untuk memproses format tabel terbuka seperti Apache Iceberg. Ini mendukung dua mode eksekusi utama:

  • Batch serverless: Dirancang untuk pipeline pemrosesan data dan workload ETL yang otomatis dan non-interaktif. Model bayar per eksekusi ini menghilangkan pengelolaan cluster, menghapus pertentangan resource antar-tugas, dan mengotomatiskan pemeliharaan infrastruktur.
  • Sesi interaktif tanpa server: Dirancang untuk analisis data eksploratif, rekayasa data, dan eksperimen data science. Sesi interaktif mendukung notebook Apache Spark di balik layar menggunakan Spark Connect atau kernel Spark jarak jauh, sehingga menyediakan lingkungan penskalaan otomatis tanpa penyiapan infrastruktur.

Tingkat layanan

Saat menjalankan workload Apache Spark terhadap katalog runtime Lakehouse, Anda dapat memilih di antara berbagai tingkat layanan:

  • Tingkat standar: Tingkat eksekusi default yang cocok untuk workload batch processing standar.
  • Tingkat Premium: Menyediakan kemampuan lanjutan, termasuk dukungan untuk sesi notebook interaktif serverless dan fitur yang mempercepat performa seperti Lightning Engine.

Template sesi

Template sesi menyederhanakan konfigurasi sesi interaktif serverless. Dengan template ini, administrator dapat menentukan dan mempertahankan setelan lingkungan umum (seperti properti katalog, konfigurasi jaringan, dan versi runtime). Hal ini meningkatkan konsistensi dan meningkatkan produktivitas developer dengan meminimalkan penyiapan berulang. Template sesi dapat dibuat dan dikelola menggunakan konsol Google Cloud , gcloud CLI, REST API, atau Terraform.

Konsep Keandalan

Replikasi lintas-region

Replikasi lintas-region mereplikasi metadata di beberapa region untuk memastikan ketersediaan katalog selama pemadaman layanan regional.

Failover

Failover adalah proses beralih antara region utama dan sekunder selama pemadaman layanan regional untuk mempertahankan operasi katalog.