Episode ini membahas perintah diagnostik Proxmox, analisis log dengan journalctl, troubleshooting masalah umum seperti split-brain, VM yang tidak bisa start, dan storage penuh, serta prosedur disaster recovery dari backup dan node yang gagal.

Semua yang kalian bangun dari episode 0 akan suatu saat bermasalah. Perbedaan antara administrator yang hebat dan yang biasa bukan pada kemampuan menghindari masalah — melainkan kecepatan dan ketenangan menyelesaikannya. Episode 19 melatih naluri diagnostik kalian.
Kita akan menguasai perintah diagnostik, membaca log dengan benar, menyelesaikan masalah umum yang paling sering terjadi di Proxmox, lalu menyusun prosedur disaster recovery yang bisa diandalkan saat benar-benar dibutuhkan.
Saat ada masalah, mulailah dari status yang paling umum. Perintah-perintah berikut memberi gambaran kesehatan sistem:
pvecm status
ha-manager status
qm list
pct listpvecm status menampilkan kesehatan cluster dan quorum, ha-manager status menunjukkan resource HA, sementara qm list dan pct list menampilkan semua VM dan container beserta statusnya.
Storage sering menjadi biang masalah:
pvesm status
zpool status
df -hzpool status menampilkan kesehatan pool ZFS — perhatikan status DEGRADED atau FAULTED pada disk.
Log adalah saksi terbaik. Service Proxmox utama — pvedaemon, pveproxy, pve-cluster — menulis log ke systemd journal:
journalctl -u pvedaemon -u pveproxy -bPerintah journalctl -u pvedaemon -u pveproxy -b menampilkan log dua service utama sejak boot terakhir. Tambahkan flag -f untuk mengikuti log secara real-time saat mendiagnosis masalah langsung.
Setiap operasi Proxmox meninggalkan jejak di task log. Untuk masalah VM yang tidak bisa start, lihat log task dan file konfigurasi:
qm start 100 --debug
cat /etc/pve/qemu-server/100.confPerintah qm start 100 --debug menampilkan detail lengkap saat VM gagal start — termasuk error QEMU yang menjadi petunjuk utama.
Jika pvecm status menampilkan QUORUM tidak tercapai, artinya jumlah suara kurang dari mayoritas. Penyebab umum: node mati atau jaringan Corosync terputus. Periksa konektivitas antar node dan pastikan jumlah node ganjil. Jangan pernah menyalakan ulang dua node sekaligus dalam cluster kecil.
VM yang gagal start biasanya meninggalkan pesan QEMU yang spesifik. Penyebab umum: tidak ada ruang disk, disk tidak tersedia di node, atau lock tersisa dari operasi sebelumnya. Hapus lock dengan qm unlock 100 jika diperlukan.
Container yang tidak bisa start sering disebabkan oleh konfigurasi storage yang berubah atau template yang tidak konsisten. Periksa log pct start dan pastikan rootfs container tersedia di storage yang dikonfigurasi.
Storage penuh membuat semua VM di atasnya bermasalah. Hapus file yang tidak perlu, tambah kapasitas, atau pindahkan data. Untuk ZFS DEGRADED, identifikasi disk yang gagal dengan zpool status, ganti, dan biarkan ZFS melakukan resilver.
Node yang tidak bisa diakses dari jaringan biasanya bermasalah di konfigurasi network. Akses lewat console fisik atau IPMI, periksa /etc/network/interfaces, dan uji dengan ip a.
Saat VM rusak parah, prosedur recovery dari backup adalah penyelamat:
qmrestore.qmrestore /var/lib/vz/dump/vzdump-qemu-100-2026_08_10-02_00_00.vma.zst 100
qm start 100Jika sebuah node benar-benar gagal (hardware mati), prosedurnya:
pvecm delnode.Warning
Disaster recovery hanya berfungsi jika prosedurnya diuji. Jadwalkan latihan restore berkala — tim yang pernah latihan akan jauh lebih tenang saat bencana sungguhan terjadi.
Episode 19 melatih kalian menghadapi kegagalan: menguasai perintah diagnostik, menganalisis log, menyelesaikan masalah umum seperti split-brain dan storage penuh, serta menyusun prosedur disaster recovery yang teruji.
Inti yang harus dibawa pulang:
pvecm status, ha-manager status, qm list, dan pct list.pvedaemon dan pveproxy untuk service utama.DEGRADED butuh penggantian disk dan resilver.Di episode 20 selanjutnya kita akan membahas studi kasus infrastruktur Proxmox production-grade — merancang arsitektur lengkap dari cluster 3 node, storage tier, networking, automation, hingga observability, plus checklist kesiapan produksi dan maintenance routine. Ini puncak perjalanan kalian; mari rakit semua keahlian menjadi satu desain utuh!