Kemampuan observasi untuk GKE

Dokumen ini menjelaskan fitur kemampuan pengamatan di Google Kubernetes Engine (GKE) untuk memantau kondisi dan ketersediaan aplikasi.

Untuk membantu memastikan ketersediaan dan keandalan aplikasi Anda di GKE, Anda perlu memantau kondisi dan performanya. GKE menyediakan fitur observabilitas, seperti metrik dan dasbor, yang menawarkan insight penting tentang workload dalam container Anda, sehingga membantu Anda mendeteksi masalah sejak dini dan mengoptimalkan performa. Kemampuan ini dapat sangat bermanfaat untuk workload yang menuntut, seperti aplikasi AI/ML, yang memerlukan kontrol dan performa yang sangat penting.

Dokumen ini ditujukan untuk admin IT, developer, dan operator yang ingin memantau workload mereka. Untuk mempelajari lebih lanjut peran umum dan contoh tugas yang kami referensikan dalam Google Cloud konten, lihat Peran dan tugas pengguna GKE umum.

Fitur kemampuan observasi default

Secara default, cluster GKE dikonfigurasi untuk melakukan hal berikut:

  • Kirim log sistem, log audit, dan log aplikasi ke Cloud Logging.
  • Kirim metrik sistem ke Cloud Monitoring.
  • Gunakan Google Cloud Managed Service for Prometheus untuk mengumpulkan metrik pihak ketiga dan yang ditentukan pengguna yang dikonfigurasi, lalu kirimkan ke Cloud Monitoring. Google Cloud Managed Service for Prometheus memungkinkan Anda memantau dan membuat pemberitahuan terkait workload menggunakan Prometheus, tanpa harus mengelola dan mengoperasikan Prometheus secara manual dalam skala besar.

Menyesuaikan dan meningkatkan pengumpulan data

Secara default, GKE membuat repositori Logging untuk menyimpan log setiap cluster. Anda dapat mengontrol log dan metrik mana, jika ada, yang dikirim dari cluster GKE ke Cloud Logging dan Cloud Monitoring.

Anda juga dapat mengontrol apakah akan mengaktifkan Google Cloud Managed Service for Prometheus.

Untuk cluster GKE Autopilot, Anda tidak dapat menonaktifkan integrasi Cloud Monitoring dan Cloud Logging.

Metrik kemampuan observasi tambahan

Anda dapat mengumpulkan metrik kemampuan observasi tambahan menggunakan metode seperti berikut:

  • Aktifkan satu atau beberapa paket metrik kemampuan observasi, seperti berikut:

    • Metrik bidang kontrol: Pantau performa komponen Kubernetes dengan mengumpulkan metrik untuk server API Kubernetes, Scheduler, dan Controller Manager. Metrik ini adalah sinyal kondisi layanan yang berguna untuk menentukan tujuan tingkat layanan (SLO).
    • Metrik kube state: Memantau kondisi objek Kubernetes seperti Deployment, Node, dan Pod.
    • Metrik cAdvisor/Kubelet: Memantau kondisi container dan kubelet.
  • Konfigurasikan Google Cloud Managed Service for Prometheus untuk mengumpulkan metrik tertentu dari komponen Kubernetes. Metode ini berguna jika Anda ingin mengumpulkan metrik yang bukan bagian dari paket metrik, atau jika Anda hanya ingin sebagian metrik dari paket metrik.

Metrik pihak ketiga dan yang ditentukan pengguna

Untuk memantau aplikasi pihak ketiga yang berjalan di cluster Anda seperti Postgres, MongoDB, dan Redis, gunakan pengekspor Prometheus dengan Google Cloud Managed Service for Prometheus.

Anda juga dapat menulis pengekspor kustom untuk memantau sinyal kesehatan dan performa lainnya.

Menggunakan data yang dikumpulkan

Gunakan data yang Anda kumpulkan untuk menganalisis kondisi aplikasi, men-debug, memecahkan masalah, dan menguji saat Anda mengembangkan, men-deploy, dan memelihara aplikasi.

GKE menyediakan fitur observabilitas bawaan untuk membantu Anda memulai dengan cepat:

  • Lihat data yang dikumpulkan untuk cluster dan workload Anda didasbor kemampuan observasi GKE. Anda dapat menyesuaikan dasbor yang disediakan untuk tujuan berikut:

    • Melihat metrik cluster utama, seperti pemakaian CPU, pemakaian memori, dan jumlah insiden terbuka.
    • Lihat cluster berdasarkan infrastruktur, workload, atau Layanan.
    • Periksa namespace, Node, workload, Service, Pod, dan container.
    • Untuk Pod dan container, lihat metrik sebagai fungsi waktu dan lihat entri log.

    Anda juga dapat membuat dasbor sendiri atau mengimpor dasbor Grafana untuk memenuhi kebutuhan Anda.

  • Lihat detail untuk workload AI/ML Anda di konsol Google Cloud , termasuk resource seperti JobSet, RayJob, PyTorchJob, dan Deployment untuk inferensi inferensi.

    Buka konsol Google Cloud

  • Dari tab Observability, Anda dapat membuat kebijakan pemberitahuan yang direkomendasikan agar Anda diberi tahu tentang masalah. Untuk mempelajari pemberitahuan lebih lanjut, lihat Ringkasan pemberitahuan.

  • Buat SLO untuk memantau sasaran performa layanan Anda menggunakan metrik GKE yang dikumpulkan.

  • Gunakan playbook GKE untuk memecahkan masalah umum seperti Pod yang tidak dapat dijadwalkan dan container yang berulang kali error setelah dimulai ulang.

  • Jelajahi dan analisis data Anda dengan alat seperti Logs Explorer, Metrics Explorer, dan Error Reporting.

  • Tinjau log audit GKE yang mencatat aktivitas administratif dan akses sebagai bagian dari Cloud Audit Logs. Kebijakan log audit menentukan peristiwa mana yang dicatat dan apakah entri log termasuk dalam log Aktivitas Admin atau log Akses Data.

Fitur lainnya

GKE terintegrasi dengan layanan Google Cloud lain untuk membantu Anda memantau dan mengelola cluster dan workload.

Harga

Harga untuk integrasi dengan Cloud Logging (termasuk Cloud Audit Logs), Cloud Monitoring, dan Google Cloud Managed Service for Prometheus didasarkan pada jumlah log dan metrik yang dikumpulkan. Lihat halaman Harga untuk mengetahui detailnya.

Fitur yang disediakan oleh layanan Google Cloud lain yang tercantum di Fitur lainnya memiliki harga terpisah. Lihat bagian Harga di halaman dokumentasi tersebut untuk mengetahui informasi selengkapnya.

Langkah berikutnya