Menggunakan Agen Data Science Colab Enterprise dengan BigQuery
Agen Data Science (DSA) untuk Colab Enterprise dan BigQuery memungkinkan Anda mengotomatiskan analisis data eksploratori, menjalankan tugas machine learning, dan memberikan insight, semuanya dalam notebook Colab Enterprise.
Sebelum memulai
- Login ke akun Google Cloud Anda. Jika Anda baru menggunakan Google Cloud, buat akun untuk mengevaluasi performa produk kami dalam skenario dunia nyata. Pelanggan baru juga mendapatkan kredit gratis senilai $300 untuk menjalankan, menguji, dan men-deploy workload.
-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
-
Aktifkan BigQuery, Gemini untuk Google Cloud, Dataform, dan Compute Engine API, jika ada yang belum diaktifkan.
Peran yang diperlukan untuk mengaktifkan API
Untuk mengaktifkan API, Anda memerlukan izin
serviceusage.services.enable. Jika Anda membuat project, kemungkinan Anda sudah memiliki izin ini melalui peran Pemilik (roles/owner). Jika tidak, Anda bisa mendapatkan izin ini melalui peran Admin Penggunaan Layanan (roles/serviceusage.serviceUsageAdmin). Pelajari cara memberikan peran.Untuk project baru, BigQuery API diaktifkan secara otomatis.
Jika Anda baru menggunakan Colab Enterprise di BigQuery, lihat langkah-langkah penyiapan di halaman Membuat notebook.
Batasan
- Agen Data Science hanya tersedia dalam lingkungan Colab Enterprise.
- Agen Data Science mendukung sumber data berikut:
- File CSV
- Tabel BigQuery
- Kode yang dihasilkan oleh Agen Data Science hanya berjalan di runtime notebook Anda.
- Penelusuran tabel BigQuery menggunakan fungsi
@mentiondibatasi untuk project saat ini. Gunakan pemilih tabel untuk menelusuri seluruh project. - Fungsi
@mentionhanya menelusuri tabel BigQuery. Untuk menelusuri file data yang dapat Anda upload, gunakan simbol+. - PySpark di Agen Data Science hanya membuat kode Managed Service untuk Apache Spark 4.0. DSA dapat membantu Anda mengupgrade ke Managed Service untuk Apache Spark 4.0, tetapi pengguna yang memerlukan versi sebelumnya tidak boleh menggunakan Agen Data Science.
- Kunci enkripsi yang dikelola pelanggan (CMEK) tidak didukung.
Kapan harus menggunakan Agen Data Science
Agen Data Science membantu Anda menyelesaikan tugas mulai dari analisis data eksploratif hingga membuat prediksi dan perkiraan machine learning. Anda dapat menggunakan DSA untuk:
- Pemrosesan data skala besar: Gunakan BigQuery ML, BigQuery DataFrames, atau Managed Service untuk Apache Spark guna melakukan pemrosesan data terdistribusi pada set data besar. Dengan demikian, Anda dapat membersihkan, mentransformasi, dan menganalisis data yang terlalu besar untuk dimuat ke dalam memori di satu mesin secara efisien.
- Membuat rencana: Buat dan ubah rencana untuk menyelesaikan tugas tertentu menggunakan alat umum seperti Python, SQL, Managed Service untuk Apache Spark, dan BigQuery DataFrame.
- Eksplorasi data: Jelajahi set data untuk memahami struktur, mengidentifikasi potensi masalah seperti nilai yang hilang dan pencilan, serta memeriksa distribusi variabel utama menggunakan Python atau SQL.
- Pembersihan data: Bersihkan data Anda. Misalnya, hapus titik data yang merupakan anomali.
- Data wrangling: Mengonversi fitur kategoris menjadi representasi numerik menggunakan teknik seperti enkode one-hot atau encoding label atau dengan menggunakan alat transformasi fitur BigQuery ML. Buat fitur baru untuk analisis.
- Analisis data: Menganalisis hubungan antara berbagai variabel. Hitung korelasi antara fitur numerik dan jelajahi distribusi fitur kategoris. Cari pola dan tren dalam data.
- Visualisasi data: Buat visualisasi seperti histogram, diagram kotak garis, diagram sebar, dan diagram batang yang merepresentasikan distribusi variabel individual dan hubungan di antara variabel tersebut. Anda juga dapat membuat visualisasi di Python untuk tabel yang disimpan di BigQuery.
- Rekayasa fitur: Merekayasa fitur baru dari set data yang sudah dibersihkan.
- Pemisahan data: Memisahkan set data yang telah direkayasa menjadi set data pelatihan, validasi, dan pengujian.
- Pelatihan model: Latih model menggunakan data pelatihan di DataFrame pandas (
X_train,y_train), BigQuery DataFrames, PySpark DataFrame, atau menggunakan pernyataanCREATE MODELBigQuery ML dengan tabel BigQuery. - Pengoptimalan model: Mengoptimalkan model menggunakan set validasi.
Pelajari model alternatif seperti
DecisionTreeRegressordanRandomForestRegressorserta bandingkan performanya. - Evaluasi model: Mengevaluasi performa model pada set data pengujian menggunakan pandas DataFrame, BigQuery DataFrames, atau PySpark DataFrame. Anda juga dapat menilai kualitas model dan membandingkan model menggunakan fungsi evaluasi model BigQuery ML untuk model yang dilatih menggunakan BigQuery ML.
- Inferensi model: Lakukan inferensi dengan model terlatih BigQuery ML, model yang diimpor, dan model jarak jauh menggunakan fungsi inferensi BigQuery ML. Anda juga dapat menggunakan
metode BigFrames
model.predict()atau transformer PySpark untuk membuat prediksi.
Menggunakan Agen Data Science di BigQuery
Langkah-langkah berikut menunjukkan cara menggunakan Agen Data Science di BigQuery.
Buat atau buka notebook Colab Enterprise.
Opsional: Merujuk data Anda dengan salah satu cara berikut:
- Upload file CSV atau gunakan simbol
+dalam perintah Anda untuk menelusuri file yang tersedia. - Pilih satu atau beberapa tabel BigQuery di pemilih tabel dari project saat ini atau dari project lain yang aksesnya Anda miliki.
- Referensi nama tabel BigQuery dalam perintah Anda dalam format
ini:
project_id:dataset.table. - Ketik simbol
@untuk menelusuri nama tabel BigQuery menggunakan fungsi@mention.
- Upload file CSV atau gunakan simbol
Masukkan perintah yang menjelaskan analisis data yang ingin Anda lakukan atau prototipe yang ingin Anda buat. Perilaku default Agen Ilmu Data adalah membuat kode Python menggunakan library open source seperti sklearn untuk menyelesaikan tugas machine learning yang kompleks. Untuk menggunakan alat tertentu, sertakan kata kunci berikut dalam perintah Anda:
- Jika Anda ingin menggunakan BigQuery ML, sertakan kata kunci "SQL".
- Jika Anda ingin menggunakan "BigQuery DataFrames", tentukan kata kunci "BigFrames" atau "BigQuery DataFrames".
- Jika Anda ingin menggunakan PySpark, sertakan kata kunci "Apache Spark" atau "PySpark".
Untuk mendapatkan bantuan, lihat contoh perintah.
Pilih model Anda. Model defaultnya adalah Gemini 3.0 Flash.
Kirim perintah Anda, dan periksa hasilnya.
Menganalisis file CSV
Untuk menganalisis CSV menggunakan Agen Data Science di BigQuery, ikuti langkah-langkah berikut.
Buka halaman BigQuery.
Di panel kiri, luaskan project Anda, lalu klik klik Notebooks.
Klik Notebook baru > Notebook kosong.
Atau, di tab, klik panah drop-down arrow_drop_down di samping ikon add_box Tambahkan, lalu klik Notebook > Notebook kosong.
Klik tombol kilauan Aktifkan Gemini di Colab untuk membuka dialog chat.
Upload file CSV Anda.
Di dialog chat, klik Tambahkan ke Gemini > Upload.
Jika perlu, beri otorisasi Akun Google Anda.
Jelajahi lokasi file CSV, lalu klik Buka.
Atau, ketik simbol
+dalam perintah Anda untuk menelusuri file yang tersedia untuk diupload.Masukkan perintah Anda di jendela chat. Contoh:
Identify trends and anomalies in this file.Pilih model Anda. Model defaultnya adalah Gemini 3.0 Flash.
Klik Kirim. Hasilnya akan muncul di jendela chat.
Anda dapat meminta agen untuk mengubah rencana, atau Anda dapat menjalankannya dengan mengklik Terima & jalankan. Saat rencana berjalan, kode dan teks yang dihasilkan akan muncul di notebook. Klik Batal untuk menghentikan.
Menganalisis tabel BigQuery
Untuk menganalisis tabel BigQuery, pilih satu atau beberapa tabel di pemilih tabel, berikan referensi ke tabel dalam perintah Anda, atau telusuri tabel menggunakan simbol @.
Buka halaman BigQuery.
Di panel kiri, luaskan project Anda, lalu klik Notebooks.
Klik Notebook baru > Notebook kosong.
Atau, di tab, klik panah drop-down arrow_drop_down di samping ikon add_box Tambahkan, lalu klik Notebook > Notebook kosong.
Klik tombol kilauan Aktifkan Gemini di Colab untuk membuka dialog chat.
Masukkan perintah Anda di jendela chat.
Referensi data Anda dengan salah satu cara berikut:
Pilih satu atau beberapa tabel menggunakan pemilih tabel:
Klik Tambahkan ke tabel BigQuery > Gemini.
Di jendela BigQuery tables, pilih satu atau beberapa tabel di project Anda. Anda dapat menelusuri tabel di seluruh project dan memfilter tabel menggunakan kotak penelusuran.
Sertakan nama tabel BigQuery langsung dalam perintah Anda. Misalnya: "Bantu saya melakukan analisis data eksploratif dan mendapatkan insight tentang data dalam tabel ini:
project_id:dataset.table."Ganti kode berikut:
project_id: project ID Andadataset: nama set data yang berisi tabel yang Anda analisistable: nama tabel yang Anda analisis
Ketik
@untuk menelusuri tabel BigQuery di project saat ini.
Pilih model Anda. Model defaultnya adalah Gemini 3.0 Flash.
Klik Kirim.
Hasilnya akan muncul di jendela chat.
Anda dapat meminta agen untuk mengubah rencana, atau Anda dapat menjalankannya dengan mengklik Terima & jalankan. Saat rencana berjalan, kode dan teks yang dihasilkan akan muncul di notebook. Untuk langkah-langkah tambahan dalam rencana, Anda mungkin diminta untuk mengklik Setuju & jalankan lagi. Klik Batal untuk menghentikan.
Contoh perintah
Terlepas dari kompleksitas perintah yang Anda gunakan, Agen Data Science akan membuat rencana yang dapat Anda sesuaikan untuk memenuhi kebutuhan Anda.
Contoh berikut menunjukkan jenis perintah yang dapat Anda gunakan dengan DSA.
Perintah Python
Kode Python dibuat secara default, kecuali jika Anda menggunakan kata kunci tertentu dalam perintah seperti "BigQuery ML" atau "SQL".
- "Selidiki dan isi nilai yang tidak ada menggunakan algoritma machine learning k-Nearest Neighbors (KNN)."
- "Buat plot gaji menurut tingkat pengalaman. Gunakan kolom
experience_leveluntuk mengelompokkan gaji, dan buat diagram kotak untuk setiap grup yang menampilkan nilai dari kolomsalary_in_usd." - "Gunakan algoritma XGBoost untuk membuat model guna menentukan
classvariabel buah tertentu. Pisahkan data menjadi set data pelatihan dan pengujian untuk membuat model dan menentukan akurasi model. Buat matriks konfusi untuk menunjukkan prediksi di antara setiap kelas, termasuk semua prediksi yang benar dan salah." - "Prakiraan
target_variabledarifilename.csvselama enam bulan ke depan."
Perintah SQL dan BigQuery ML
- "Buat dan evaluasi model klasifikasi di
bigquery-public-data.ml_datasets.census_adult_incomemenggunakan BigQuery SQL." - "Dengan SQL, prediksi traffic situs saya untuk bulan depan berdasarkan
bigquery-public-data.google_analytics_sample.ga_sessions_*. Kemudian, buat plot untuk nilai historis dan hasil prediksinya." - "Kelompokkan pelanggan yang serupa untuk membuat kampanye pemasaran yang ditargetkan menggunakan model KMeans dan fungsi SQL BigQuery ML. Gunakan tiga fitur untuk
pengelompokan. Kemudian, visualisasikan hasilnya dengan membuat serangkaian diagram pencar 2D. Gunakan tabel
bigquery-public-data.ml_datasets.census_adult_income." - "Buat embedding teks di BigQuery ML menggunakan konten ulasan di
bigquery-public-data.imdb.reviews."
Untuk mengetahui daftar model dan tugas machine learning yang didukung, lihat dokumentasi BigQuery ML.
Perintah DataFrame
- "Buat pandas DataFrame untuk data di
project_id:dataset.table. Analisis data tersebut untuk mencari nilai null, lalu buat grafik distribusi untuk tiap kolom menggunakan jenis grafik yang sesuai. Gunakan violin plot untuk nilai yang terukur dan bar plot untuk kategori." - "Baca
filename.csvdan buat DataFrame. Jalankan analisis pada DataFrame untuk menentukan tindakan yang perlu dilakukan terhadap nilai. Misalnya, apakah ada nilai yang hilang yang perlu diganti atau dihapus, atau apakah ada baris duplikat yang perlu ditangani. Gunakan file data untuk menentukan distribusi uang yang diinvestasikan dalam USD per lokasi kota. Buat grafik 20 hasil teratas menggunakan grafik batang yang menampilkan hasil dalam urutan menurun sebagai Lokasi versus Jumlah Rata-Rata Investasi (USD)." - "Buat dan evaluasi model klasifikasi pada
project_id:dataset.tablemenggunakan BigQuery DataFrames." - "Buat model perkiraan deret waktu di
project_id:dataset.tablemenggunakan BigQuery DataFrames, dan visualisasikan evaluasi model." - Visualisasikan angka penjualan dalam setahun terakhir di Tabel BigQuery
project_id:dataset.tablemenggunakan BigQuery DataFrames. - Temukan fitur yang dapat memprediksi spesies penguin terbaik dari tabel
bigquery-public_data.ml_datasets.penguinsmenggunakan BigQuery DataFrames.
Perintah PySpark
- "Buat dan evaluasi model klasifikasi di
project_id:dataset.tablemenggunakan Managed Service untuk Apache Spark." - "Kelompokkan pelanggan yang serupa untuk membuat kampanye pemasaran yang menargetkan pasar, tetapi
lakukan reduksi dimensi terlebih dahulu menggunakan model PCA. Gunakan PySpark untuk melakukannya
di tabel
project_id:dataset.table."
Menonaktifkan Gemini di BigQuery
Untuk menonaktifkan Gemini in BigQuery untuk Google Cloud project, administrator harus menonaktifkan Gemini for Google Cloud API. Lihat Menonaktifkan layanan.
Untuk menonaktifkan Gemini di BigQuery bagi pengguna tertentu, administrator
harus mencabut peran
Gemini for
Google Cloud User (roles/cloudaicompanion.user) bagi pengguna tersebut. Lihat
Mencabut
satu peran IAM.
Harga
Harga Agen Data Science didasarkan pada data input dan output Anda. Untuk mengetahui informasi selengkapnya, lihat Harga agen di Cara kerja harga BigQuery.
Region yang didukung
Untuk melihat region yang didukung untuk Agen Ilmu Data Colab Enterprise, lihat Lokasi.