Mengimpor tabel Iceberg eksternal ke katalog runtime Lakehouse menggunakan Dataflow

Format tabel yang didukung

Hanya tabel Apache Iceberg V2 yang didukung; tabel Iceberg V1 tidak didukung. Jika memiliki tabel Iceberg V1 yang sudah ada, Anda harus mengupgradenya ke V2 (misalnya, dengan menjalankan ALTER TABLE catalog.schema.table SET TBLPROPERTIES ('format-version'='2'); atau menggunakan operasi mesin yang serupa) sebelum mengimpornya ke katalog runtime Lakehouse.

Kasus penggunaan Anda mungkin mengharuskan Anda menghubungkan tabel Katalog REST Iceberg (IRC) eksternal ke tabel Lakehouse untuk Apache Iceberg yang sudah ada. UI builder tugas Dataflow memungkinkan Anda membangun pipeline yang memigrasikan tabel katalog Iceberg open source eksternal ke Lakehouse dengan cara low-code atau no-code. Proses ini memungkinkan Anda menggabungkan data ke dalam format Iceberg yang dikelola Lakehouse dan terpadu untuk analisis lintas mesin.

Gunakan detail koneksi berikut untuk mengimpor data dari katalog Iceberg eksternal.

Sebelum memulai

Untuk mengimpor data, Anda memerlukan hal berikut:

  1. Informasi koneksi untuk Katalog REST Iceberg eksternal. Misalnya: nama katalog, namespace, nama tabel, URI akun, dan peran untuk mengakses katalog.
  2. Katalog, namespace, dan tabel Iceberg Lakehouse untuk mengimpor data.

Dukungan dan batasan

Mengimpor data dari katalog Iceberg eksternal ke Lakehouse untuk Apache Iceberg menggunakan Dataflow memiliki batasan berikut:

  • Fitur ini mendukung pembacaan dari penyedia Iceberg yang tersedia secara eksternal yang mendukung IRC (Iceberg Rest Catalog) ke Lakehouse. Jenis katalog Iceberg lainnya tidak didukung.
  • Fitur ini mendukung pipeline batch dan streaming.

Mengimpor tabel katalog Iceberg eksternal

Untuk mengimpor tabel katalog Iceberg eksternal ke Lakehouse untuk Apache Iceberg, selesaikan langkah-langkah berikut:

  1. Di konsol Google Cloud , buka halaman Lakehouse runtime catalog.

    Buka katalog runtime Lakehouse

  2. Pilih katalog, namespace, dan tabel tempat Anda ingin mengimpor data.

  3. Di halaman Detail tabel, klik Impor tabel, lalu pilih Dari Katalog REST Apache Iceberg (Batch).

    Halaman Job builder Dataflow akan terbuka.

  4. Di bagian Sumber:

    1. Untuk meluaskan panel sumber Tabel gunung es, klik panah peluas .

    2. Di kolom Tabel Iceberg, masukkan ID tabel Apache Iceberg.

    3. Di kolom Catalog name, masukkan nama katalog.

    4. Di kolom Filter, masukkan filter Iceberg yang akan digunakan. Contoh, id > 5.

    5. Opsional: Untuk menentukan perubahan kolom tabel sumber, gunakan bagian Pertahankan kolom atau Hapus kolom.

    6. Di daftar Jenis katalog di bagian Properti katalog, pilih jenis katalog.

    7. Di kolom Catalog URI, masukkan URI katalog. Contoh, http://localhost:8181.

    8. Di kolom Warehouse name, masukkan nama katalog.

      Untuk beberapa penyedia Katalog REST Iceberg eksternal, gudang diabstraksi, dan nama katalog diberikan sebagai nama gudang.

    9. Dalam daftar Jenis autentikasi, pilih jenis autentikasi. Contoh, OAUTH2.

  5. Opsional: Di bagian Transformasi, tambahkan transformasi apa pun ke sumber data.

  6. Di bagian Sink:

    1. Opsional: Tinjau panel sink tabel Lakehouse. Informasi di panel ini, seperti tabel Lakehouse, nama katalog, dan lokasi gudang, biasanya sudah terisi otomatis.
  7. Di bagian Opsi Dataflow, klik Jalankan tugas.

Langkah berikutnya