Memantau deployment

Pelajari cara memantau kondisi, waktu beroperasi, dan upgrade deployment Google Distributed Cloud terhubung, termasuk workload yang didukung. Untuk mengetahui informasi selengkapnya tentang cara mengonfigurasi pemantauan dan metrik yang tersedia, lihat bagian Log dan metrik.

Memantau kondisi dan waktu aktif workload

Anda bertanggung jawab untuk memantau kondisi dan waktu operasional workload Anda (container dan virtual machine) yang berjalan di deployment Distributed Cloud terhubung Anda.

Workload container

Untuk memantau kondisi dan waktu aktif workload yang di-deploy dalam container, sebaiknya gunakan solusi metrik Prometheus. Anda dapat mengonfigurasi Prometheus untuk melakukan scraping metrik dari Pod dan Layanan Anda. Layanan sistem yang dikelola Google dipantau dan dikelola secara otomatis oleh Google. Untuk mengetahui informasi selengkapnya tentang mengonfigurasi Prometheus, lihat Mengumpulkan metrik dengan Prometheus.

Gunakan metrik utama berikut untuk memantau beban kerja container. Jika Anda menggunakan Prometheus, Anda bertanggung jawab untuk men-deploy dan mengelola Kube State Metrics untuk mengekspos metrik tertentu ini untuk workload Anda:

  • kube_pod_status_phase: Memantau Pod dalam fase Failed atau Unknown.
  • kube_pod_container_status_waiting_reason: Mengidentifikasi Pod yang macet di CrashLoopBackOff atau ImagePullBackOff.
  • container_cpu_usage_seconds_total dan container_memory_working_set_bytes (dari cAdvisor): Pantau konsumsi resource untuk mencegah masalah kehabisan memori (OOM).

Workload virtual machine

Di Distributed Cloud terhubung, virtual machine (VM) berjalan di dalam Pod Kubernetes standar, biasanya diawali dengan virt-launcher-. Pantau kondisi dan status VM terutama dengan memeriksa status resource kustom VirtualMachine atau dengan memantau metrik aplikasi dari dalam VM.

Gunakan metrik Pod virt-launcher yang mendasarinya sebagai indikator sekunder untuk detail berikut:

  • Penggunaan resource: Pantau konsumsi CPU dan memori Pod peluncur untuk memastikan VM memiliki resource yang cukup.
  • Fase pod: Lacak fase Pod peluncur untuk mengidentifikasi VM yang gagal dimulai atau error.

Untuk menyesuaikan resource yang ditetapkan ke VM, ubah spesifikasi resource kustom VM. Jangan mengubah YAML Pod virt-launcher yang mendasarinya secara langsung, karena dikelola oleh platform. Setiap perubahan langsung akan ditimpa atau menyebabkan error rekonsiliasi.

Untuk memecahkan masalah VM yang macet dalam status tertunda, lihat Memecahkan masalah mesin virtual yang macet dalam status Tertunda.

Memantau upgrade Distributed Cloud terhubung

Pantau progres dan status upgrade software yang terhubung ke Distributed Cloud menggunakan metrik Cloud Monitoring dan perintah gcloud. Upgrade dijadwalkan dan dijalankan oleh Google. Pemantauan hanya untuk visibilitas dan perencanaan migrasi workload.

Untuk mengetahui petunjuk mendetail tentang cara memeriksa apakah upgrade sedang berlangsung, memantau statusnya, dan memecahkan masalah upgrade yang gagal, lihat Memecahkan masalah upgrade software.

Memantau kondisi penyimpanan lokal

Distributed Cloud yang terhubung terus memantau kondisi perangkat penyimpanan dan memberi tahu Google saat drive fisik perlu diganti. Google akan bekerja sama dengan Anda untuk menjadwalkan kunjungan dan mengganti drive yang rusak. Anda dapat memantau kondisi penyimpanan menggunakan pemberitahuan kondisi Kubernetes, seperti DiskPressure.

Memantau kondisi penyimpanan sistem

Anda dapat memantau kondisi penyimpanan sistem yang terhubung ke Distributed Cloud menggunakan salah satu metode berikut:

  • Prometheus dengan Metrik Kube State (PromQL). Deploy dan kelola Kube State Metrics di cluster Anda untuk mengekspos metrik kondisi Kubernetes.

  • Metrik Cloud Monitoring. Buat kebijakan pemberitahuan berdasarkan metrik tingkat host yang diekspor ke Cloud Monitoring.

Memantau status penyimpanan sistem dengan Prometheus

Untuk memantau kondisi penyimpanan sistem dengan Prometheus dan Kube State Metrics (PromQL), siapkan pemberitahuan berikut:

  1. Segera beri tahu saat kondisi node memasuki status DiskPressure:

    kube_node_status_condition{condition="DiskPressure",status="true"} == 1
    
  2. Memberikan pemberitahuan secara proaktif sebelum batas penggusuran dilanggar dengan memeriksa kapan penggunaan disk melebihi batas operasional:

    (1 - (node_filesystem_avail_bytes{mountpoint="/mnt/shared_lpvs"} / node_filesystem_size_bytes{mountpoint="/mnt/shared_lpvs"})) > THRESHOLD
    

    Ganti THRESHOLD dengan nilai minimum operasional target dalam rentang 0.00 ~ 1.00. Google merekomendasikan agar Anda menetapkan nilai ini ke 0.85.

Memantau status penyimpanan sistem dengan Cloud Monitoring

Untuk memantau kondisi penyimpanan sistem dengan metrik Cloud Monitoring, buat kebijakan pemberitahuan dengan parameter berikut:

  • Metrik: edgecontainer.googleapis.com/machine/disk/utilization
  • Cakupan: Metrik ini secara khusus melaporkan penggunaan disk sistem file partisi sistem lokal node (/dev/mapper/shared_lpvs_encrypted).
  • Nilai minimum: Konfigurasi nilai minimum pemberitahuan saat pemakaian disk lebih besar dari 85%. Hal ini akan mendeteksi saturasi disk sistem sebelum peristiwa DiskPressure node berat terjadi.

Memantau kondisi penyimpanan workload

Anda dapat memantau kondisi penyimpanan beban kerja menggunakan metrik volume Kubelet atau langsung menggunakan telemetri tingkat aplikasi, bergantung pada mode volume yang digunakan oleh beban kerja.

  • Mode volume Filesystem. Anda dapat memantau volume sistem file menggunakan Prometheus dengan meng-scrape metrik volume Kubelet berikut:

    • kubelet_volume_stats_capacity_bytes
    • kubelet_volume_stats_available_bytes
    • kubelet_volume_stats_used_bytes
    • kubelet_volume_stats_inodes_used
    • kubelet_volume_stats_inodes_free
  • Mode volume Block. Volume blok mentah tidak terlihat oleh Kubelet. Untuk memantau kondisinya, Anda harus menggunakan metrik tingkat aplikasi atau Symcloud Storage.

Pemantauan multi-cluster

Jika Anda mengelola banyak cluster yang terhubung ke Distributed Cloud, sebaiknya gunakan Cloud Monitoring untuk menggabungkan dan memfilter metrik.

  • Gunakan label resource: Metrik yang diekspor ke Cloud Monitoring mencakup label yang mengidentifikasi sumber. Label yang tersedia bergantung pada jenis resource:

    • Untuk metrik cluster dan penampung, seperti k8s_container, label utama mencakup nilai berikut:

      • project_id: Google Cloud Project yang menghosting cluster.
      • location: Google Cloud Region tempat cluster terdaftar.
      • cluster_name: Nama cluster.
    • Untuk metrik hardware, seperti edgecontainer.googleapis.com/machine, label utama mencakup nilai berikut:

      • resource_container: Google Cloud Project yang terkait dengan hardware.
      • location: Region Google Cloud tempat zona yang terhubung ke Distributed Cloud didaftarkan.
      • machine_id: ID mesin.

      Metrik hardware tidak menyertakan label cluster_name secara langsung.

  • Membuat dasbor kustom: Buat dasbor yang menampilkan indikator kesehatan utama di seluruh perangkat Anda. Indikator kesehatan utama mencakup konektivitas, status VM, dan penggunaan resource. Untuk menampilkan data dari beberapa cluster dalam satu diagram, gunakan karakter pengganti atau operasi pengelompokan menurut.

  • Menyiapkan pemberitahuan multi-cluster: Mengonfigurasi kebijakan pemberitahuan yang berlaku untuk beberapa cluster. Misalnya, Anda dapat membuat pemberitahuan yang dipicu jika ada mesin di cluster mana pun yang kehilangan konektivitas.

Strategi pemberitahuan

Pemantauan dan pemeliharaan Distributed Cloud terhubung adalah tanggung jawab bersama. Bagian ini menjelaskan apa yang dipantau Google dan cara Anda dapat mengonfigurasi kebijakan pemberitahuan Anda sendiri.

Notifikasi Google saat diaktifkan

Google terus memantau infrastruktur yang mendasarinya. Fitur ini akan mengambil tindakan dan memberi tahu Anda jika diperlukan untuk situasi berikut:

  • Kegagalan hardware: Kegagalan catu daya, kegagalan kipas, kepanasan berlebih, atau kegagalan disk, seperti disk yang mencapai batas cadangan atau akhir masa pakainya. Google terus memantau kondisi perangkat penyimpanan internalnya dan memicu penggantian otomatis saat perangkat penyimpanan gagal.
  • Masalah konektivitas: Hilangnya koneksi sepenuhnya antara zona yang terhubung ke Distributed Cloud dan Google Cloud.
  • Kesehatan bidang kontrol: Kegagalan di bidang kontrol Kubernetes atau layanan sistem yang dikelola Google.
  • Kegagalan upgrade: Proses upgrade otomatis yang macet atau gagal.

Mengonfigurasikan pemberitahuan

Konfigurasi kebijakan pemberitahuan Anda sendiri di Cloud Monitoring atau di Prometheus untuk masalah yang memengaruhi workload atau lingkungan lokal Anda.

Anda dapat menyiapkan notifikasi untuk masalah berikut:

Masalah Deskripsi Sistem pemantauan Detail
Periode nonaktif workload Pod atau VM gagal dimulai atau mengalami loop error Prometheus Untuk workload container, buat pemberitahuan di kube_pod_status_phase untuk mendeteksi Pod dalam fase Failed atau Unknown. Anda juga dapat memberikan peringatan pada kube_pod_container_status_waiting_reason saat sama dengan CrashLoopBackOff atau ImagePullBackOff.
Cloud Monitoring Untuk workload VM yang berjalan di Pod, siapkan pemberitahuan menggunakan metrik container Kubernetes standar di Cloud Monitoring untuk melacak status Pod virt-launcher.
Penipisan resource workload Penggunaan disk mendekati kapasitas, atau penggunaan memori atau CPU yang tinggi pada workload Prometheus Untuk workload container, tetapkan pemberitahuan nilai minimum pada container_cpu_usage_seconds_total dan container_memory_working_set_bytes (dari cAdvisor) untuk mengidentifikasi Pod yang mendekati batas resource-nya.
Cloud Monitoring Untuk penyimpanan mesin, pantau metrik penggunaan disk mesin edgecontainer.googleapis.com/machine/disk/utilization untuk mendeteksi saat penyimpanan node mendekati kapasitas.
Masalah jaringan lokal Antarmuka jaringan terputus di komputer Cloud Monitoring Pantau apakah metrik aktif jaringan mesin edgecontainer.googleapis.com/machine/network/up adalah false.
Koneksi internet terputus Cloud Monitoring Pantau apakah metrik konektivitas jaringan edgecontainer.googleapis.com/machine/network/connectivity adalah false.
Mulai ulang komputer Komputer tiba-tiba melakukan reboot atau mati Cloud Monitoring Mengonfigurasi pemberitahuan dengan metrik edgecontainer.googleapis.com/machine/uptime dan edgecontainer.googleapis.com/machine/restart_count. Untuk mengetahui informasi selengkapnya, lihat Memecahkan masalah mulai ulang mesin.
Penyimpanan sistem habis Ruang penyimpanan sistem habis Cloud Monitoring Mengonfigurasi pemberitahuan dengan metrik edgecontainer.googleapis.com/machine/disk/utilization. Untuk mengetahui informasi selengkapnya, lihat Memantau kondisi penyimpanan sistem.

Hardware Distributed Cloud terhubung dikelola oleh Google. Anda tidak memiliki akses SSH ke mesin atau kontrol atas sistem operasi host. Jika pemberitahuan berdasarkan metrik tingkat mesin diaktifkan, seperti konektivitas jaringan atau mulai ulang, item tindakan Anda terbatas pada pemeriksaan daya fisik, pengkabelan, dan konfigurasi firewall dan jaringan lokal, atau meningkatkan masalah ke Dukungan Google.