Merancang disaster recovery lintas data center: stretch cluster dengan failure domain datacenter, penggunaan RBD mirroring async untuk PV kritis, skenario failover dan failback, quorum MON di DC ketiga, serta batasan latensi dan bandwidth.

Kapasitas & performa sudah matang (episode 19-20). Episode 21 membahas dinding terakhir: resiliensi lintas data center — apa yang terjadi jika satu DC mati total?
Mengapa penting? Kegagalan DC lebih langka daripada kegagalan host, tetapi dampaknya jauh lebih besar. Ceph menawarkan dua mekanisme: stretch cluster (mirip aktif-aktif, quorum tersebar) dan RBD mirroring (replikasi async ke klaster sekunder). Memilih dan menyusun keduanya dengan benar adalah spesialisasi admin storage production.
Stretch cluster membuat MON & data tersebar di 2 DC + 1 arbiter:
apiVersion: ceph.rook.io/v1
kind: CephCluster
metadata:
name: rook-ceph
namespace: rook-ceph
spec:
cephConfig:
global:
mon_host: ...
mon:
count: 5 # 2 di DC1, 2 di DC2, 1 arbiterBakar atau kuorum hotlist MON DC3 tipis.
Prinsipnya:
Kembali ke konsep episode 14: RBD mirroring async mereplikasi image ke klaster sekunder dengan lag beberapa detik/menit.
apiVersion: ceph.rook.io/v1
kind: CephRBDMirror
metadata:
name: rbd-mirror
namespace: rook-ceph
spec:
count: 2Klasik untuk workload yang boleh kehilangan beberapa detik data:
Tapi bukan untuk database transaksi yang wajib RPO 0 — itu tugas stretch/kuorum sinkron.
rbd mirror image promote replicapool/csi-vol-xxxPeringatan penting: jangan pernah membuka kedua sisi sekaligus (split-brain). Satu arah aktif di satu waktu.
Split-brain terjadi bila 2 DC bertengkar "siapa yang benar". Arbiter ketiga & quorum (majority) memutuskan.
Warning
Dokumenkan perintah failover dalam runbook. Saat DC1 benar-benar mati, tim tidak boleh mencoba "mempromosi semua" secara tebak-tebakan. Tetapkan: siapa yang boleh promote, langkah apa, siapa yang mengubah DNS/DNS routing aplikasi.
ping -c 5 <ip-dc2-mon>
iperf3 -c <ip-dc2> # bandwidthGunakan hasil ini untuk menentukan mode mana yang layak.
Inti yang harus dibawa pulang:
Di episode 22 selanjutnya kita akan membahas node maintenance & drain yang Ceph-safe — menjaga daemon Ceph saat maintenance, drain OS node, dan waktu yang pas untuk OS maintenance. Sampai jumpa di episode 22!