Platform ML Diagnostics
Google Cloud ML Diagnostics adalah platform terkelola end-to-end untuk mengoptimalkan, memantau, dan mendiagnosis workload AI dan ML di Google Cloud. Gunakan ML Diagnostics untuk memantau workload, serta mengumpulkan dan memvisualisasikan semua metrik, konfigurasi, dan profil workload dalam satu platform. ML Diagnostics berlaku untuk workload pelatihan dan inferensi, serta kompatibel dengan semua pengorkestrasi di Cloud TPU, termasuk Google Kubernetes Engine (GKE) dan pengorkestrasi kustom. ML Diagnostics mencakup fitur berikut:
- Pemantauan workload: Memantau dan mendiagnosis workload AI/ML yang berjalan di TPU GKE secara otomatis. Untuk setiap tugas GKE, Pemantauan Workload ML Diagnostics otomatis membuat proses Machine Learning, memantau siklus tugas TPU di seluruh workload, mendeteksi peristiwa yang memengaruhi workload, dan menganalisis berbagai lapisan workload -- seperti infrastruktur, pengorkestrasi, dan framework -- untuk membantu menentukan potensi penyebab peristiwa tersebut.
- Proses machine learning: Gunakan ML Diagnostics untuk membuat dan mendaftarkan proses machine learning Anda melalui Google Cloud CLI, atau mengintegrasikan ML Diagnostics SDK dengan workload Anda. Anda dapat membuat dan mendaftarkan proses secara otomatis dengan pemantauan workload, men-deploy instance XProf terkelola dengan proses machine learning, serta mengumpulkan dan mengelola metrik, konfigurasi, dan sesi profil workload.
- Pengalaman gcloud CLI: Gunakan ML Diagnostics API melalui gcloud CLI untuk mendaftarkan dan mengelola proses, men-deploy resource XProf terkelola, memvisualisasikan sesi profil di bucket penyimpanan, dan memicu pengambilan profil dari CLI. Anda juga dapat mencantumkan semua peristiwa yang terdeteksi oleh pemantauan workload dan mendapatkan detail analyzer untuk peristiwa ini melalui CLI atau API.
- Python SDK: Gunakan ML Diagnostics SDK open source yang terintegrasi dengan workload ML untuk mendapatkan pengalaman diagnostik workload ML yang lengkap. Pantau workload, serta kumpulkan dan kelola metrik workload, konfigurasi, dan profil di Google Cloud.
- Pembuatan profil terkelola: ML Diagnostics men-deploy instance XProf terkelola dengan backend yang dapat diskalakan ke akun terkait, sehingga memungkinkan pemuatan profil besar yang cepat. Fitur ini mendukung beberapa pengguna yang mengakses profil secara bersamaan, dan berisi fitur bawaan seperti pembuatan profil multi-host dan pembuatan profil sesuai permintaan.
- Metrik workload: Lacak metrik workload, termasuk kualitas model, performa model, dan metrik sistem. Dengan pemantauan workload, Anda bisa mendapatkan metrik sistem yang terkait dengan workload tanpa mengintegrasikan SDK.
- Pengelolaan konfigurasi workload: Lacak konfigurasi workload, termasuk konfigurasi software, konfigurasi sistem, dan yang ditentukan pengguna konfigurasi.
- Visualisasi di Cluster Director dan GKE: Visualisasikan metrik, konfigurasi, dan profil di Cluster Director dan Google Kubernetes Engine di Google Cloud konsol.
- Berbagi link: Berkolaborasi menggunakan link yang dapat dibagikan dengan informasi tentang proses machine learning, pemantauan workload, metrik, dan profil.
Jalur pengguna
Anda dapat menggunakan platform ML Diagnostics secara otomatis dengan pemantauan workload untuk semua tugas GKE, atau mengintegrasikan SDK dengan workload Anda untuk mendapatkan pengalaman diagnostik workload ML yang lengkap. Anda dapat berinteraksi dengan sistem diagnostik ML melalui Google Cloud konsol atau CLI. Pemantauan workload otomatis tersedia untuk semua workload yang di-deploy dengan GKE di TPU.
Dengan CLI, Anda dapat menggunakan ML Diagnostics gcloud CLI untuk membuat atau mengubah proses machine learning, dan men-deploy resource XProf terkelola. Dengan ML Diagnostics SDK, SDK harus diintegrasikan ke dalam workload ML Anda untuk mengumpulkan dan mengelola metrik dan konfigurasi workload, serta men-deploy resource XProf terkelola.
Untuk memulai, gunakan salah satu panduan berikut:
Pembuatan profil terkelola dengan XProf
Anda bisa mendapatkan pengalaman pembuatan profil terkelola dengan XProf saat menggunakan CLI atau SDK. XProf adalah alat analisis performa dan pembuatan profil open source untuk workload machine learning dan merupakan bagian dari ekosistem OpenXLA.
Manfaat pengalaman pembuatan profil terkelola dibandingkan dengan pengalaman pembuatan profil yang dihosting sendiri meliputi:
- Tidak diperlukan penyiapan XProf atau dependensi lainnya.
- Keamanan dan perlindungan yang lebih baik dari kerentanan.
- Link yang dapat dibagikan untuk kolaborasi.
- Pemuatan profil besar yang lebih cepat.
- Dukungan untuk beberapa pengguna yang mengakses profil secara bersamaan dengan penskalaan resource otomatis berdasarkan beban akses link.
- Fitur bawaan seperti pembuatan profil multi-host dan pembuatan profil sesuai permintaan.
- Memuat beberapa sesi profil di beberapa proses dengan instance XProf terkelola yang sama.
- Tidak ada biaya untuk resource XProf terkelola yang di-deploy oleh platform ML Diagnostics, sehingga XProf terkelola lebih hemat biaya daripada XProf yang dihosting sendiri.
Prasyarat
Sebelum menggunakan ML Diagnostics, aktifkan Cluster Director API dan tambahkan izin IAM yang diperlukan. Jika Anda menggunakan GKE, pemantauan workload sudah diaktifkan. Namun, ML Diagnostics SDK dan pembuatan profil sesuai permintaan memerlukan artefak GKE tambahan dan konfigurasi cluster GKE Anda. Untuk mengetahui informasi selengkapnya, lihat Menyiapkan GKE.
Mengaktifkan Cluster Director API
Anda tidak perlu menggunakan Cluster Director untuk men-deploy dan mengelola cluster agar dapat menggunakan produk ML Diagnostics. ML Diagnostics berfungsi dengan cluster yang dikelola oleh GKE, Cluster Director, atau pengorkestrasi kustom. ML Diagnostics adalah bagian dari rangkaian API Cluster Director, tetapi tidak bergantung pada pengguna yang menggunakan produk Cluster Director itu sendiri.
Untuk mengetahui informasi selengkapnya tentang cara mengaktifkan Cluster Director API, lihat Mengaktifkan API di project Google Cloud Anda.
Izin IAM
Akun Google Cloud layanan yang digunakan oleh workload Anda memerlukan peran IAM berikut yang ditetapkan di project:
roles/hypercomputecluster.editor: Untuk akses penuh guna membuat dan mengelola resourceMLRunserta melihat antarmuka pengguna.roles/logging.logWriter: Untuk menulis log dan metrik ke Cloud Logging.roles/storage.objectUser: Untuk menyimpan profil ke bucket Cloud Storage yang ditentukan dimachinelearning_run.
Anda juga dapat membuat peran kustom yang menetapkan subset API yang diperlukan untuk ML Diagnostics kepada pengguna. Karena pengguna tidak perlu menggunakan Cluster Director untuk mengelola cluster, Anda hanya perlu menetapkan izin berikut:
hypercomputecluster.locations.gethypercomputecluster.locations.listhypercomputecluster.machineLearningRuns.createhypercomputecluster.machineLearningRuns.deletehypercomputecluster.machineLearningRuns.gethypercomputecluster.machineLearningRuns.listhypercomputecluster.machineLearningRuns.updatehypercomputecluster.operations.cancelhypercomputecluster.operations.deletehypercomputecluster.operations.gethypercomputecluster.operations.listresourcemanager.projects.getResourcemanager.projects.list
Untuk workload di Google Kubernetes Engine, gunakan Workload Identity
Federation untuk mengaitkan
Akun Layanan Kubernetes dengan Google Cloud akun layanan yang telah
diberi peran yang diperlukan. Pod yang berjalan di jaringan host (hostNetwork: true) tidak menggunakan Workload Identity Federation untuk GKE. Untuk kasus ini, lihat Alternatif untuk Workload Identity Federation untuk GKE.
Harga
Anda akan dikenai biaya untuk penyimpanan metrik melalui Cloud Logging, dan penyimpanan profil melalui Cloud Storage. Anda tidak perlu mengaktifkan penagihan tambahan untuk layanan ini saat menggunakan platform ML Diagnostics. Tidak ada biaya untuk resource XProf terkelola yang di-deploy oleh platform ML Diagnostics.