Mengelola pipeline

Dokumen ini menjelaskan cara mengelola pipeline BigQuery, termasuk cara menjadwalkan dan menghapus pipeline.

Dokumen ini juga menjelaskan cara melihat dan mengelola metadata pipeline di Knowledge Catalog.

Pipeline didukung oleh Dataform.

Sebelum memulai

  1. Buat pipeline BigQuery.
  2. Untuk mengelola metadata pipeline di Knowledge Catalog, pastikan Dataplex API diaktifkan di project Google Cloud Anda.

Peran yang diperlukan

Untuk mendapatkan izin yang Anda perlukan untuk mengelola pipeline, minta administrator untuk memberi Anda peran IAM berikut:

  • Untuk melihat dan menjalankan pipeline:
  • Untuk menjalankan pipeline dengan kredensial pengguna untuk Akun Google: BigQuery Data Editor (roles/bigquery.dataEditor) di project atau set data BigQuery tertentu
  • Untuk menghapus pipeline: Dataform Admin (roles/dataform.Admin) di pipeline
  • Untuk melihat dan mengelola metadata di Knowledge Catalog: Dataplex Catalog Editor (roles/dataplex.catalogEditor) di project atau grup entri @bigquery

Untuk mengetahui informasi selengkapnya tentang pemberian peran, lihat Mengelola akses ke project, folder, dan organisasi.

Anda mungkin juga bisa mendapatkan izin yang diperlukan melalui peran khusus atau peran bawaan lainnya.

Untuk mengetahui informasi selengkapnya tentang Dataform IAM, lihat Mengontrol akses dengan IAM.

Jika Anda menggunakan akun layanan kustom untuk menjalankan pipeline, Anda harus memberikan peran berikut ke akun layanan tersebut:

Melihat semua pipeline

Untuk melihat daftar semua pipeline di project Anda, lakukan hal berikut:

  1. Di Google Cloud konsol, buka halaman BigQuery.

    Buka BigQuery

  2. Di panel kiri, klik Explorer:

    Tombol yang ditandai untuk panel Explorer.

    Jika Anda tidak melihat panel kiri, klik Luaskan panel kiri untuk membuka panel.

  3. Di panel Explorer , luaskan project Anda, lalu klik Pipelines.

Melihat operasi manual sebelumnya

Untuk melihat operasi manual sebelumnya dari pipeline yang dipilih, ikuti langkah-langkah berikut:

  1. Di Google Cloud konsol, buka halaman BigQuery.

    Buka BigQuery

  2. Di panel kiri, klik Explorer:

    Tombol yang ditandai untuk panel Explorer.

  3. Di panel Explorer, luaskan project Anda, klik Pipelines, lalu pilih pipeline.

  4. Klik Executions.

  5. Opsional: Untuk memuat ulang daftar operasi sebelumnya, klik Refresh.

Mengonfigurasi pemberitahuan untuk operasi pipeline yang gagal

Setiap pipeline memiliki ID repositori Dataform yang sesuai. Setiap operasi pipeline BigQuery dicatat di Cloud Logging menggunakan ID repositori Dataform yang sesuai. Anda dapat menggunakan Cloud Monitoring untuk mengamati tren dalam log Cloud Logging untuk operasi pipeline BigQuery dan untuk memberi tahu Anda saat kondisi yang Anda jelaskan terjadi.

Untuk menerima pemberitahuan saat operasi pipeline BigQuery gagal, Anda dapat membuat kebijakan pemberitahuan berbasis log untuk ID repositori Dataform yang sesuai. Untuk mengetahui petunjuknya, lihat Mengonfigurasi pemberitahuan untuk pemanggilan alur kerja yang gagal.

Untuk menemukan ID repositori Dataform pipeline Anda, lakukan hal berikut:

  1. Di Google Cloud konsol, buka halaman BigQuery.

    Buka BigQuery

  2. Di panel kiri, klik Explorer:

    Tombol yang ditandai untuk panel Explorer.

  3. Di panel Explorer, luaskan project Anda, klik Pipelines, lalu pilih pipeline.

  4. Klik Settings.

    ID repositori Dataform pipeline Anda ditampilkan di bagian bawah tab Settings.

Menghapus pipeline

Untuk menghapus pipeline secara permanen, ikuti langkah-langkah berikut:

  1. Di Google Cloud konsol, buka halaman BigQuery.

    Buka BigQuery

  2. Di panel kiri, klik Explorer:

    Tombol yang ditandai untuk panel Explorer.

  3. Di panel Explorer , luaskan project Anda, lalu klik Pipelines.

  4. Temukan pipeline yang ingin Anda hapus.

  5. Klik View actions di samping pipeline, lalu klik Delete.

  6. Klik Delete.

Mengelola metadata di Knowledge Catalog

Knowledge Catalog memungkinkan Anda menyimpan dan mengelola metadata untuk pipeline. Pipeline tersedia di Knowledge Catalog secara default, tanpa konfigurasi tambahan.

Anda dapat menggunakan Knowledge Catalog untuk mengelola pipelines di semua lokasi pipeline. Pengelolaan pipeline di Knowledge Catalog tunduk pada kuota dan batas Knowledge Catalog serta harga Knowledge Catalog.

Knowledge Catalog secara otomatis mengambil metadata berikut dari pipeline:

  • Nama aset data
  • Parent aset data
  • Lokasi aset data
  • Jenis aset data
  • Project yang sesuai Google Cloud

Knowledge Catalog mencatat pipeline sebagai entri dengan nilai entri berikut:

Grup entri sistem
Grup entri sistem untuk pipeline adalah @dataform. Untuk melihat detail entri pipeline di Knowledge Catalog, Anda harus melihat grup entri sistem dataform. Untuk mengetahui petunjuk tentang cara melihat daftar semua entri dalam grup entri, lihat Melihat detail grup entri di dokumentasi Knowledge Catalog.
Jenis entri sistem
Jenis entri sistem untuk pipeline adalah dataform-code-asset. Untuk melihat detail pipeline,Anda harus melihat jenis entri sistem dataform-code-asset, memfilter hasil dengan filter berbasis aspek, dan menetapkan kolom type di dalam aspek dataform-code-asset ke WORKFLOW. Kemudian, pilih entri pipeline yang dipilih. Untuk mengetahui petunjuk tentang cara melihat detail jenis entri yang dipilih, lihat Melihat detail jenis entri di dokumentasi Knowledge Catalog. Untuk mengetahui petunjuk tentang cara melihat detail entri yang dipilih, lihat Melihat detail entri di dokumentasi Knowledge Catalog.
Jenis aspek sistem
Jenis aspek sistem untuk pipeline adalah dataform-code-asset. Untuk memberikan konteks tambahan ke pipeline di Knowledge Catalog dengan menganotasi entri pipeline data dengan aspek, lihat jenis aspek dataform-code-asset, filter hasilnya dengan filter berbasis aspek, dan tetapkan kolom type di dalam aspek dataform-code-asset ke WORKFLOW. Untuk mengetahui petunjuk tentang cara menganotasi entri dengan aspek, lihat Mengelola aspek dan memperkaya metadata di dokumentasi Knowledge Catalog.
Jenis
Jenis untuk kanvas data adalah WORKFLOW. Jenis ini memungkinkan Anda memfilter pipeline dalam jenis entri sistem dataform-code-asset dan jenis aspek dataform-code-asset menggunakan kueri aspect:dataplex-types.global.dataform-code-asset.type=WORKFLOW dalam filter berbasis aspek.

Untuk mengetahui petunjuk tentang cara menelusuri aset di Knowledge Catalog, lihat Menelusuri aset data di Knowledge Catalog di dokumentasi Knowledge Catalog.

Integrasi scorecard kualitas data dan pengayaan metadata

Dataform dapat memublikasikan metadata berikut ke Knowledge Catalog:

  • Jenis aspek ringkasan
  • Jenis aspek generik
  • Jenis aspek scorecard kualitas data

Asersi Dataform otomatis terintegrasi dengan scorecard kualitas data Knowledge Catalog. Selama eksekusi pipeline, hasil asersi Dataform apa pun akan otomatis dipublikasikan ke Knowledge Catalog. Hasil ini mengisi scorecard kualitas data Knowledge Catalog dengan status lulus atau gagal.

Untuk memeriksa status update metadata, ikuti petunjuk di Melihat operasi manual sebelumnya.

Setelah metadata disinkronkan, Anda dapat menelusuri dan melihat entri di Knowledge Catalog. Untuk mengetahui informasi selengkapnya, lihat Menelusuri resource.

Langkah berikutnya