Mentransformasi data

Google Cloud Data Agent Kit memungkinkan Anda menggunakan notebook untuk pembersihan data, rekayasa fitur, dan analisis mendalam.Ada tiga jenis notebook yang dapat dipilih.

  • Notebook BigQuery DataFrames. Ini adalah notebook Python yang memungkinkan Anda memproses set data besar di BigQuery menggunakan API pandas dan scikit-learn yang sudah dikenal. Notebook ini mendukung penulisan kode di GoogleSQL untuk BigQuery selain Python.
  • Notebook Apache Spark Terkelola dengan kernel lokal. Ini adalah notebook Python yang memungkinkan Anda membuat dan menjalankan tugas di Managed Service untuk Apache Spark menggunakan library Spark Connect.

  • Notebook Apache Spark Terkelola dengan kernel jarak jauh. Notebook ini memungkinkan Anda menjalankan notebook di kernel jarak jauh yang berjalan sepenuhnya di Managed Service untuk Apache Spark. Tidak ada bagian kode Anda yang dieksekusi secara lokal di komputer Anda. Selain PySpark, Anda dapat menulis kode di Spark SQL dengan bantuan magic sel %%sparksql.

Sebelum memulai

Untuk notebook BigQuery, library bigframes harus diinstal di lingkungan virtual Python yang sama dengan tempat Anda menjalankan notebook. Saat Anda membuat notebook baru, sel inisialisasi berisi baris berikut, yang diberi komentar:

#%pip install --upgrade bigframes
  1. Opsional: jika Anda tidak menginstal library bigframes di lingkungan virtual Python, hapus komentar.

  2. Opsional: jika Anda berencana menulis kode SQL di notebook, instal bigquery-magics:

pip install --upgrade bigquery-magics

Peran yang diperlukan

Untuk mendapatkan izin yang diperlukan untuk menjalankan notebook BigQuery, minta administrator untuk memberi Anda BigQuery Studio User (roles/bigquery.studioUser) di project yang Anda pilih di ekstensi.

Untuk mendapatkan izin yang diperlukan untuk notebook Managed Service untuk Apache Spark, minta administrator untuk memberi Anda peran berikut di project:

Untuk mengetahui informasi selengkapnya tentang cara memberikan peran, lihat Mengelola akses ke project, folder, dan organisasi. Anda mungkin juga bisa mendapatkan izin yang diperlukan melalui peran khusus atau peran bawaan lainnya.

Mengubah data Anda

Untuk data dalam tabel BigLake atau BigQuery, ekstensi ini menyediakan template notebook untuk membantu Anda memulai.

Buka tabel BigQuery atau BigLake:

  1. Buka palet perintah dengan menekan Ctrl/Cmd-Shift-P.
  2. Luaskan penjelajah Katalog dan temukan BigQuery atau BigLake Anda.
  3. Klik kanan ID tabel.
  4. Dari menu mengambang, pilih Load in Spark DataFrame atau Load in BigQuery DataFrame. Editor baru akan menampilkan informasi tentang tabel.

    Anda juga dapat menemukan tabel menggunakan Penelusuran Universal. Klik ID tabel untuk membuka editor baru, klik tab Data, lalu pilih Load in Spark DataFrame atau Load in BigQuery DataFrame.

Menginisialisasi notebook

Setelah Anda memuat tabel, notebook Jupyter baru akan terbuka di tab editor yang berisi kode yang diperlukan untuk memuat tabel Anda dalam jenis DataFrame yang dipilih.

  1. Jika Anda tidak menginstal library yang diperlukan di lingkungan virtual Python, hapus komentar pada baris pip install.

  2. Klik Select Kernel dan pilih kernel Python.

    Untuk notebook Spark Terkelola dengan kernel jarak jauh, Anda harus memilih kernel Spark jarak jauh.

  3. Jalankan sel dengan mengklik ▷ Run All atau menekan Shift+Enter di bagian bawah sel.

  4. Jika Anda diminta untuk menginstal software yang tidak ada, klik Install.

Sel ini akan membuat DataFrame yang berisi data dalam tabel yang dipilih.

Menerapkan transformasi data ke DataFrame

Tambahkan sel tambahan ke notebook dan tulis kode untuk mengubah data Anda. Untuk BigQuery DataFrames, Anda dapat mengubah DataFrame menggunakan API yang kompatibel dengan pandas yang disediakan oleh BigQuery DataFrames.

Atau, BigQuery DataFrames menyediakan perintah magics yang dapat Anda gunakan untuk mengubah DataFrame menggunakan SQL di notebook Jupyter. Untuk mengubah data menggunakan SQL, selesaikan langkah-langkah berikut:

  1. Buat dan jalankan sel untuk mengaktifkan magics Jupyter.

    %load_ext bigframes

  2. Buat sel SQL menggunakan magics %%bqsql.

Menyimpan hasil

Gunakan salah satu dari banyak metode output yang disediakan oleh jenis DataFrame Anda untuk menyimpan data yang diubah ke BigQuery atau Cloud Storage. Untuk BigQuery DataFrames, metode output mencakup hal berikut:

Untuk data kecil, Anda dapat mengekspor ke Arrow atau Pandas untuk manipulasi dan visualisasi lokal lebih lanjut.

Pembersihan

Untuk menghindari tagihan ke Google Cloud akun Anda, hapus resource yang Anda buat tetapi tidak lagi diperlukan.

Langkah berikutnya