Platform Diagnostik ML

Google Cloud Diagnostik ML adalah platform terkelola end-to-end untuk mengoptimalkan, memantau, dan mendiagnosis workload AI dan ML di Google Cloud. Gunakan Diagnostik ML untuk memantau beban kerja, serta mengumpulkan dan memvisualisasikan semua metrik, konfigurasi, dan profil beban kerja dalam satu platform. Diagnostik ML berlaku untuk workload pelatihan dan inferensi, serta kompatibel dengan semua pengorkestrasi di Cloud TPU, termasuk Google Kubernetes Engine (GKE) dan pengorkestrasi kustom. Diagnostik ML mencakup fitur berikut:

  • Pemantauan workload: Memantau dan mendiagnosis workload AI/ML yang berjalan di TPU GKE secara otomatis. Untuk setiap tugas GKE, Pemantauan Workload Diagnostik ML secara otomatis membuat proses Machine Learning, memantau siklus tugas TPU di seluruh workload, mendeteksi peristiwa yang memengaruhi workload, dan menganalisis berbagai lapisan workload -- seperti infrastruktur, pengorkestrasi, dan framework -- untuk membantu menentukan potensi penyebab peristiwa tersebut.
  • Eksekusi machine learning: Gunakan Diagnostik ML untuk membuat dan mendaftarkan eksekusi machine learning melalui Google Cloud CLI, atau integrasikan SDK Diagnostik ML dengan beban kerja Anda. Anda dapat membuat dan mendaftarkan proses secara otomatis dengan pemantauan workload, serta men-deploy instance XProf terkelola dengan proses machine learning, serta mengumpulkan dan mengelola metrik, konfigurasi, dan sesi pembuatan profil workload.
  • Pengalaman gcloud CLI: Gunakan ML Diagnostics API melalui gcloud CLI untuk mendaftarkan dan mengelola proses, men-deploy resource XProf terkelola, memvisualisasikan sesi profil di bucket penyimpanan, dan memicu pengambilan profil dari CLI. Anda juga dapat mencantumkan semua peristiwa yang terdeteksi oleh pemantauan beban kerja dan mendapatkan detail penganalisis untuk peristiwa ini melalui CLI atau API.
  • Python SDK: Gunakan ML Diagnostics SDK open source yang terintegrasi dengan beban kerja ML untuk mendapatkan pengalaman diagnostik beban kerja ML yang lengkap. Pantau beban kerja serta kumpulkan dan kelola metrik, konfigurasi, dan profil beban kerja di Google Cloud.
  • Pembuatan profil terkelola: ML Diagnostics men-deploy instance terkelola XProf dengan backend yang skalabel ke akun terkait, sehingga memungkinkan pemuatan profil besar yang cepat. Alat ini mendukung beberapa pengguna yang mengakses profil secara bersamaan, dan berisi fitur bawaan seperti pembuatan profil multi-host dan pembuatan profil sesuai permintaan.
  • Metrik beban kerja: Melacak metrik beban kerja, termasuk kualitas model, performa model, dan metrik sistem. Dengan pemantauan beban kerja, Anda bisa mendapatkan metrik sistem yang terkait dengan beban kerja tanpa mengintegrasikan SDK.
  • Pengelolaan konfigurasi workload: Lacak konfigurasi workload, termasuk konfigurasi software, konfigurasi sistem, dan konfigurasi yang ditentukan pengguna.
  • Visualisasi di Cluster Director dan GKE: Visualisasikan metrik, konfigurasi, dan profil di Cluster Director dan Google Kubernetes Engine di konsol Google Cloud .
  • Berbagi link: Berkolaborasi menggunakan link yang dapat dibagikan dengan informasi tentang proses machine learning, pemantauan beban kerja, metrik, dan profil.

Jalur pengguna

Anda dapat menggunakan platform Diagnostik ML secara otomatis dengan pemantauan beban kerja untuk semua tugas GKE, atau mengintegrasikan SDK dengan beban kerja Anda untuk mendapatkan pengalaman diagnostik beban kerja ML yang lengkap. Anda dapat berinteraksi dengan sistem diagnostik ML melalui konsol Google Cloud atau CLI. Pemantauan workload otomatis tersedia untuk semua workload yang di-deploy dengan GKE di TPU.

Dengan CLI, Anda dapat menggunakan gcloud CLI Diagnostik ML untuk membuat atau mengubah proses machine learning, dan men-deploy resource XProf terkelola. Dengan ML Diagnostics SDK, SDK perlu diintegrasikan ke dalam workload ML Anda untuk mengumpulkan dan mengelola metrik serta konfigurasi workload, dan men-deploy resource XProf terkelola.

Untuk memulai, gunakan salah satu panduan berikut:

Pembuatan profil terkelola dengan XProf

Anda bisa mendapatkan pengalaman pembuatan profil terkelola dengan XProf saat menggunakan CLI atau SDK. XProf adalah alat analisis performa dan pembuatan profil open source untuk beban kerja machine learning dan merupakan bagian dari ekosistem OpenXLA.

Manfaat pengalaman pembuatan profil terkelola dibandingkan dengan pengalaman pembuatan profil yang dihosting sendiri meliputi:

  • Tidak diperlukan penyiapan XProf atau dependensi lainnya.
  • Keamanan dan perlindungan yang lebih baik dari kerentanan.
  • Link yang dapat dibagikan untuk kolaborasi.
  • Pemuatan profil besar yang lebih cepat.
  • Dukungan untuk beberapa pengguna yang mengakses profil secara bersamaan dengan penskalaan otomatis resource berdasarkan beban akses link.
  • Fitur bawaan seperti pembuatan profil multi-host dan pembuatan profil on-demand.
  • Muat beberapa sesi profil di beberapa proses dengan instance XProf terkelola yang sama.
  • Tidak ada biaya untuk resource XProf terkelola yang di-deploy oleh platform ML Diagnostics, sehingga XProf terkelola lebih hemat biaya daripada XProf yang dihosting sendiri.

Prasyarat

Sebelum menggunakan Diagnostik ML, aktifkan Cluster Director API dan tambahkan izin IAM yang diperlukan. Jika Anda menggunakan GKE, pemantauan workload sudah diaktifkan. Namun, ML Diagnostics SDK dan profiling sesuai permintaan memerlukan artefak GKE tambahan dan konfigurasi cluster GKE Anda. Untuk mengetahui informasi selengkapnya, lihat Menyiapkan GKE.

Aktifkan Cluster Director API

Anda tidak perlu menggunakan Cluster Director untuk men-deploy dan mengelola cluster guna menggunakan produk Diagnostik ML. Diagnostik ML berfungsi dengan cluster yang dikelola oleh GKE, Cluster Director, atau orchestrator kustom. ML Diagnostics adalah bagian dari rangkaian API Cluster Director, tetapi tidak bergantung pada pengguna yang menggunakan produk Cluster Director itu sendiri.

Untuk mengetahui informasi selengkapnya tentang cara mengaktifkan Cluster Director API, lihat Mengaktifkan API di project Google Cloud .

Izin IAM

Akun layanan Google Cloud yang digunakan oleh beban kerja Anda memerlukan peran IAM berikut yang ditetapkan di project:

  • roles/hypercomputecluster.editor: Untuk akses penuh dalam membuat dan mengelola resource MLRun serta melihat antarmuka pengguna.
  • roles/logging.logWriter: Untuk menulis log dan metrik ke Cloud Logging.
  • roles/storage.objectUser: Untuk menyimpan profil ke bucket Cloud Storage yang ditentukan dalam machinelearning_run.

Anda juga dapat membuat peran khusus yang menetapkan subset API yang diperlukan untuk Diagnostik ML kepada pengguna. Karena pengguna tidak perlu menggunakan Cluster Director untuk mengelola cluster, Anda hanya perlu menetapkan izin berikut:

  • hypercomputecluster.locations.get
  • hypercomputecluster.locations.list
  • hypercomputecluster.machineLearningRuns.create
  • hypercomputecluster.machineLearningRuns.delete
  • hypercomputecluster.machineLearningRuns.get
  • hypercomputecluster.machineLearningRuns.list
  • hypercomputecluster.machineLearningRuns.update
  • hypercomputecluster.operations.cancel
  • hypercomputecluster.operations.delete
  • hypercomputecluster.operations.get
  • hypercomputecluster.operations.list
  • resourcemanager.projects.get
  • Resourcemanager.projects.list

Untuk workload di Google Kubernetes Engine, gunakan Federasi Workload Identity untuk mengaitkan Akun Layanan Kubernetes dengan akun layanan yang telah diberi peran yang diperlukan. Google Cloud

Harga

Anda akan dikenai biaya untuk penyimpanan metrik melalui Cloud Logging, dan penyimpanan profil melalui Cloud Storage. Anda tidak perlu mengaktifkan penagihan tambahan untuk layanan ini saat menggunakan platform Diagnostik ML. Tidak ada biaya untuk resource XProf terkelola yang di-deploy oleh platform ML Diagnostics.