Kasus penggunaan Anda mungkin mengharuskan Anda menghubungkan tabel Iceberg REST Catalog (IRC) eksternal ke tabel Lakehouse yang sudah ada. UI builder tugas Dataflow memungkinkan Anda membangun pipeline yang memigrasikan tabel katalog Iceberg open source eksternal ke Lakehouse dengan cara low-code atau no-code. Proses ini memungkinkan Anda menggabungkan data ke dalam format Iceberg yang dikelola Lakehouse dan terpadu untuk analisis lintas mesin.
Gunakan detail koneksi berikut untuk mengimpor data dari katalog Iceberg eksternal.
Setelah mengimpor tabel, Anda memiliki opsi untuk mengimpor data perubahan secara berkala guna menyinkronkan pembaruan tabel sumber ke tabel Lakehouse. Untuk mengetahui informasi selengkapnya, lihat Memigrasikan data change data capture (CDC) Apache Iceberg ke Lakehouse tanpa batas menggunakan Dataflow.
Sebelum memulai
Untuk mengimpor data, Anda memerlukan hal berikut:
- Informasi koneksi untuk Katalog REST Iceberg eksternal. Misalnya: nama katalog, namespace, nama tabel, URI akun, dan peran untuk mengakses katalog.
- Katalog, namespace, dan tabel Iceberg Lakehouse untuk mengimpor data.
Dukungan dan batasan
Mengimpor data dari katalog Iceberg eksternal ke Lakehouse menggunakan Dataflow memiliki batasan berikut:
- Fitur ini mendukung pembacaan dari penyedia Iceberg yang tersedia secara eksternal yang mendukung IRC (Iceberg Rest Catalog) ke Lakehouse. Jenis katalog Iceberg lainnya tidak didukung.
- Fitur ini mendukung pipeline batch dan streaming.
Mengimpor tabel katalog Iceberg eksternal
Untuk mengimpor tabel katalog Iceberg eksternal ke Lakehouse, selesaikan langkah-langkah berikut:
Di konsol Google Cloud , buka halaman katalog runtime Lakehouse.
Pilih katalog, namespace, dan tabel tempat Anda ingin mengimpor data.
Di halaman Table details, klik Import table, lalu pilih From Apache Iceberg REST Catalog (Batch).
Halaman Job builder Dataflow akan terbuka.
Di bagian Sumber:
Untuk meluaskan panel sumber Tabel gunung es, klik panah peluas .
Di kolom Tabel Iceberg, masukkan ID tabel Apache Iceberg.
Di kolom Catalog name, masukkan nama katalog.
Di kolom Filter, masukkan filter Iceberg yang akan digunakan. Contoh,
id > 5.Opsional: Untuk menentukan perubahan kolom tabel sumber, gunakan bagian Pertahankan kolom atau Hapus kolom.
Di daftar Jenis katalog di bagian Properti katalog, pilih jenis katalog.
Di kolom Catalog URI, masukkan URI katalog. Contoh,
http://localhost:8181.Di kolom Warehouse name, masukkan nama katalog.
Untuk beberapa penyedia Katalog REST Iceberg eksternal, gudang akan diabstrakkan, dan nama katalog diberikan sebagai nama gudang.
Dalam daftar Authentication type, pilih jenis autentikasi. Contoh,
OAUTH2.
Opsional: Di bagian Transformasi, tambahkan transformasi apa pun ke data sumber.
Di bagian Sink:
- Opsional: Tinjau panel sink tabel Lakehouse. Informasi di panel ini, seperti tabel Lakehouse, nama katalog, dan lokasi gudang, biasanya sudah terisi otomatis.
Di bagian Opsi Dataflow, klik Jalankan tugas.
Langkah berikutnya
- Pelajari lebih lanjut di Pengantar tabel Lakehouse untuk Apache Iceberg di BigQuery.
- Pelajari lebih lanjut cara Memigrasikan data pengambilan data perubahan (CDC) Apache Iceberg ke Lakehouse secara berkala.
- Pelajari Penyerapan pengambilan data perubahan di Lakehouse.
- Pelajari lebih lanjut cara Membuat tugas kustom dengan UI pembuat tugas.
- Baca postingan blog Lebih dari sekadar BigLake: Bangun lakehouse berbasis Iceberg yang terbuka, berperforma tinggi, dan khusus perusahaan.