Membuat tugas kustom dengan pembuat tugas

Pembuat tugas memungkinkan Anda membuat tugas Dataflow batch dan streaming kustom. Anda juga dapat menyimpan tugas pembuat tugas sebagai Apache Beam YAML file untuk dibagikan dan digunakan kembali.

Membuat pipeline baru

Untuk membuat pipeline baru di pembuat tugas, ikuti langkah-langkah berikut:

  1. Buka halaman Tugas di Google Cloud konsol.

    Buka Tugas

  2. Klik Buat tugas dari pembuat.

  3. Untuk Nama tugas, masukkan nama tugas.

  4. Pilih Batch atau Streaming.

  5. Jika Anda memilih Streaming, pilih mode penjendelaan. Kemudian, masukkan spesifikasi untuk jendela, sebagai berikut:

    • Jendela tetap: Masukkan ukuran jendela, dalam detik.
    • Jendela geser: Masukkan ukuran jendela dan periode jendela, dalam detik.
    • Periode sesi: Masukkan jeda sesi, dalam detik.

    Untuk mengetahui informasi selengkapnya tentang penjendelaan, lihat Jendela dan fungsi penjendelaan.

Selanjutnya, tambahkan sumber, transformasi, dan sink ke pipeline, seperti yang dijelaskan di bagian berikut.

Menambahkan sumber ke pipeline

Pipeline harus memiliki minimal satu sumber. Awalnya, pembuat tugas diisi dengan sumber kosong. Untuk mengonfigurasi sumber, lakukan langkah-langkah berikut:

  1. Di kotak Nama sumber, masukkan nama sumber atau gunakan nama default. Nama tersebut akan muncul di grafik tugas saat Anda menjalankan tugas.

  2. Dalam daftar Jenis sumber, pilih jenis sumber data.

  3. Bergantung pada jenis sumber, berikan informasi konfigurasi tambahan.

    • Misalnya, jika Anda memilih BigQuery, tentukan tabel yang akan dibaca.
    • Jika Anda memilih Pub/Sub, tentukan skema pesan. Masukkan nama dan jenis data setiap kolom yang ingin Anda baca dari pesan Pub/Sub. Pipeline akan menghapus kolom apa pun yang tidak ditentukan dalam skema.
    • Jika Anda memilih Apache Iceberg, tentukan detail koneksi untuk Katalog REST Iceberg (IRC), seperti ID tabel Iceberg, nama katalog, jenis katalog, URI katalog, dan nama gudang.
    • Jika Anda memilih Delta Lake, tentukan detail untuk tabel Delta Lake yang disimpan di Cloud Storage.
  4. Opsional: Untuk beberapa jenis sumber, Anda dapat mengklik Pratinjau data sumber untuk melihat pratinjau data sumber.

Untuk menambahkan sumber lain ke pipeline, klik Tambahkan sumber. Untuk menggabungkan data dari beberapa sumber, tambahkan transformasi SQL atau Join ke pipeline Anda.

Menambahkan transformasi ke pipeline

Secara opsional, tambahkan satu atau beberapa transformasi ke pipeline. Anda dapat menggunakan transformasi berikut untuk memanipulasi, menggabungkan, atau menggabungkan data dari sumber dan transformasi lainnya:

Jenis transformasi Deskripsi Informasi Transformasi YAML Beam
Filter (Python) Memfilter data dengan ekspresi Python.
Transformasi SQL Memanipulasi data atau menggabungkan beberapa input dengan pernyataan SQL.
Petakan Kolom (Python) Menambahkan kolom baru atau memetakan ulang seluruh data dengan ekspresi dan fungsi Python.
Petakan Kolom (SQL) Menambahkan atau memetakan kolom data dengan ekspresi SQL.
Transformasi YAML:
  1. AssertEqual
  2. AssignTimestamps
  3. Combine
  4. Explode
  5. Filter
  6. Flatten
  7. Join
  8. LogForTesting
  9. MLTransform
  10. MapToFields
  11. PyTransform
  12. WindowInfo

Gunakan transformasi apa pun dari Beam YAML SDK.

Konfigurasi transformasi YAML: Berikan parameter konfigurasi untuk transformasi YAML sebagai peta YAML. Pasangan nilai kunci digunakan untuk mengisi bagian config dari transformasi YAML Beam yang dihasilkan. Untuk mengetahui parameter konfigurasi yang didukung untuk setiap jenis transformasi, lihat dokumentasi transformasi YAML Beam. Contoh parameter konfigurasi:

Combine
group_by:
combine:
Join
type:
equalities:
fields:
Log Mencatat data ke log pekerja tugas.
Kelompokkan menurut Menggabungkan data dengan fungsi seperti count() dan sum().
Gabung Menggabungkan beberapa input pada kolom yang sama.
Explode Membagi data dengan meratakan kolom array.

Untuk menambahkan transformasi:

  1. Klik Tambahkan transformasi.

  2. Di kotak Nama transformasi, masukkan nama transformasi atau gunakan nama default. Nama tersebut akan muncul di grafik tugas saat Anda menjalankan tugas.

  3. Dalam daftar Jenis transformasi, pilih jenis transformasi.

  4. Bergantung pada jenis transformasi, berikan informasi konfigurasi tambahan. Misalnya, jika Anda memilih Filter (Python), masukkan ekspresi Python yang akan digunakan sebagai filter.

  5. Pilih langkah input untuk transformasi. Langkah input adalah sumber atau transformasi yang outputnya memberikan input untuk transformasi ini.

Menambahkan sink ke pipeline

Pipeline harus memiliki minimal satu sink. Awalnya, pembuat tugas diisi dengan sink kosong. Untuk mengonfigurasi sink, lakukan langkah-langkah berikut:

  1. Di kotak Nama sink, masukkan nama sink atau gunakan nama default. Nama tersebut akan muncul di grafik tugas saat Anda menjalankan tugas.

  2. Dalam daftar Jenis sink, pilih jenis sink.

  3. Bergantung pada jenis sink, berikan informasi konfigurasi tambahan. Misalnya, jika Anda memilih sink BigQuery, pilih tabel BigQuery yang akan ditulis.

  4. Pilih langkah input untuk sink. Langkah input adalah sumber atau transformasi yang outputnya memberikan input untuk transformasi ini.

  5. Untuk menambahkan sink lain ke pipeline, klik Tambahkan sink.

Menjalankan pipeline

Untuk menjalankan pipeline dari pembuat tugas, lakukan langkah-langkah berikut:

  1. Opsional: Tetapkan opsi tugas Dataflow. Untuk meluaskan bagian opsi Dataflow, klik panah expander.

  2. Klik Jalankan tugas. Pembuat tugas akan membuka grafik tugas untuk tugas yang dikirimkan. Anda dapat menggunakan grafik tugas untuk memantau status tugas.

Memvalidasi pipeline sebelum meluncurkan

Untuk pipeline dengan konfigurasi yang kompleks, seperti filter Python dan ekspresi SQL, sebaiknya periksa konfigurasi pipeline untuk mengetahui error sintaksis sebelum meluncurkan. Untuk memvalidasi sintaksis pipeline, lakukan langkah-langkah berikut:

  1. Klik Validasi untuk membuka Cloud Shell dan memulai layanan validasi.
  2. Klik Mulai Validasi.
  3. Jika error ditemukan selama validasi, tanda seru merah akan muncul.
  4. Perbaiki error yang terdeteksi dan verifikasi perbaikan dengan mengklik Validasi. Jika tidak ada error yang ditemukan, tanda centang hijau akan muncul.

Menjalankan dengan gcloud CLI

Anda juga dapat menjalankan pipeline YAML Beam menggunakan gcloud CLI. Untuk menjalankan pipeline pembuat tugas dengan gcloud CLI:

  1. Klik Simpan YAML untuk membuka jendela Simpan YAML.

  2. Lakukan salah satu tindakan berikut:

    • Untuk menyimpan ke Cloud Storage, masukkan jalur Cloud Storage, lalu klik Simpan.
    • Untuk mendownload file lokal, klik Download.
  3. Jalankan perintah berikut di shell atau terminal Anda:

      gcloud dataflow yaml run my-job-builder-job --yaml-pipeline-file=YAML_FILE_PATH
    

    Ganti YAML_FILE_PATH dengan jalur file YAML Anda, baik secara lokal maupun di Cloud Storage.

Langkah berikutnya