Builder tugas adalah UI visual untuk membangun dan menjalankan pipeline Dataflow di Google Cloud konsol, tanpa perlu menulis kode.
Gambar berikut menunjukkan detail dari UI builder tugas. Dalam gambar ini, pengguna membuat pipeline untuk membaca dari Pub/Sub ke BigQuery:
Ringkasan
Builder tugas mendukung pembacaan dan penulisan jenis data berikut:
- Pesan Pub/Sub
- Data tabel BigQuery
- File CSV, file JSON, dan file teks di Cloud Storage
- Data tabel PostgreSQL, MySQL, Oracle, dan SQL Server
- Data tabel Apache Iceberg
- Data tabel Delta Lake
Builder tugas mendukung transformasi pipeline, termasuk filter, peta, SQL, group-by, gabung, dan explode (array flatten).
Dengan builder tugas, Anda dapat:
- Melakukan streaming dari Pub/Sub ke BigQuery dengan transformasi dan agregasi berjendela
- Menulis data dari Cloud Storage ke BigQuery
- Menggunakan penanganan error untuk memfilter data yang salah (antrean pesan yang tidak terkirim)
- Memanipulasi atau menggabungkan data menggunakan SQL dengan transformasi SQL
- Menambahkan, mengubah, atau menghapus kolom dari data dengan transformasi pemetaan
- Menjadwalkan tugas batch berulang
Builder tugas juga dapat menyimpan pipeline sebagai file YAML Apache Beam dan memuat definisi pipeline dari file YAML Beam. Dengan menggunakan fitur ini, Anda dapat mendesain pipeline di builder tugas, lalu menyimpan file YAML di Cloud Storage atau repositori kontrol sumber untuk digunakan kembali. Definisi tugas YAML juga dapat digunakan untuk meluncurkan tugas menggunakan gcloud CLI.
Pertimbangkan builder tugas untuk kasus penggunaan berikut:
- Anda ingin membuat pipeline dengan cepat tanpa menulis kode.
- Anda ingin menyimpan pipeline ke YAML untuk digunakan kembali.
- Pipeline Anda dapat dinyatakan menggunakan sumber, sink, dan transformasi yang didukung.
- Tidak ada template yang disediakan Google yang sesuai dengan kasus penggunaan Anda.
Menjalankan contoh tugas
Contoh Word Count adalah pipeline batch yang membaca teks dari Cloud Storage, membuat token baris teks menjadi kata individual, dan menjalankan penghitungan frekuensi pada setiap kata.
Jika bucket Cloud Storage berada di luar perimeter layanan Anda, buat aturan egress yang memungkinkan akses ke bucket tersebut.
Untuk menjalankan pipeline Word Count, ikuti langkah-langkah berikut:
Buka halaman Jobs di Google Cloud konsol.
Klik Create job from template.
Di panel samping, klik Job builder.
Klik Load blueprints.
Klik Word Count. Builder tugas diisi dengan representasi grafis pipeline.
Untuk setiap langkah pipeline, builder tugas menampilkan kartu yang menentukan parameter konfigurasi untuk langkah tersebut. Misalnya, langkah pertama membaca file teks dari Cloud Storage. Lokasi data sumber telah diisi otomatis di kotak Text location.
Temukan kartu berjudul New sink. Anda mungkin perlu men-scroll.
Di kotak Text location, masukkan awalan jalur lokasi Cloud Storage untuk file teks output.
Klik Run job. Builder tugas membuat tugas Dataflow, lalu membuka grafik tugas. Saat tugas dimulai, grafik tugas akan menampilkan representasi grafis pipeline. Representasi grafik ini mirip dengan yang ditampilkan di builder tugas. Saat setiap langkah pipeline berjalan, status akan diperbarui di grafik tugas.
Panel Job info menampilkan status keseluruhan tugas. Jika tugas berhasil diselesaikan, kolom Job status akan diperbarui menjadi Succeeded.
Langkah berikutnya
- Menggunakan antarmuka pemantauan tugas Dataflow.
- Membuat tugas kustom di builder tugas.
- Menyimpan dan memuat definisi tugas YAML di builder tugas.
- Mempelajari YAML Beam lebih lanjut.