
Sebuah artikel XDA baru-baru ini mengungkapkan cerita yang akrab: sebuah kontainer mati telah berada di homelab selama 64 hari, dan monitor populer tidak menangkapnya. Masalahnya adalah sebagian besar pemantauan homelab adalah teater pemeriksaan HTTP. Sistem memeriksa load balancer, mendapat respons 200, dan menganggap seluruh stack sehat sementara pekerja latar belakang mogok sebulan lalu. Ringkasan ini mencakup aplikasi terbaik untuk pemantauan kesehatan kontainer homelab di Windows, macOS, dan Linux, dengan fokus pada alat yang melihat kontainer itu sendiri, bukan hanya port di depannya.
Perbandingan cepat
| Aplikasi | Terbaik untuk | Platform | Paket gratis | Harga awal | Keunggulan |
|---|---|---|---|---|---|
| Uptime Kuma | Pemeriksaan HTTP dan Docker dengan perutean alert | Windows, macOS, Linux | Ya, self-host gratis | Gratis | Docker health probe, puluhan notifiers |
| Beszel | Dashboard homelab berbasis agent ringan | Windows, macOS, Linux | Ya, self-host gratis | Gratis | CPU dan memori kontainer dari waktu ke waktu, jejak tiny |
| Dozzle | Live container log tail di seluruh host | Windows, macOS, Linux | Ya, self-host gratis | Gratis | Log real-time dengan filter dan swarm view |
| Netdata | Metrik frekuensi tinggi dengan deteksi anomali | Windows, macOS, Linux | Ya, community edition | Cloud plan di bawah $10/bulan | Granularitas per detik, alert berbasis ML |
| Glances | Terminal-first metric browser dengan web UI | Windows, macOS, Linux | Ya, open source | Gratis | Satu layar untuk CPU, RAM, disk, kontainer |
| Prometheus + Grafana | Pipeline metrik nyata dengan dashboard | Windows, macOS, Linux | Ya, keduanya open source | Gratis | Aturan Alertmanager pada metrik apa pun |
| Zabbix | Platform pemantauan lengkap dengan agent | Windows, macOS, Linux | Ya, open source | Gratis | Template, escalations, distributed proxies |
| Autoheal | Restart otomatis kontainer yang tidak sehat | Windows, macOS, Linux | Ya, open source | Gratis | Mengawasi HEALTHCHECK dan restart saat gagal |
Apa yang dicari dalam monitor kontainer
Kasus XDA sangat menggambarkan masalah ini. Kontainer berjalan, port terbuka, dan proses di dalamnya macet. Monitor melihat port, jadi tidak ada yang memicu. Untuk menghindari hal itu:
- Baca HEALTHCHECK kontainer itu sendiri, bukan hanya port yang terbuka
- Beri alert pada loop restart, bukan hanya pada kegagalan
- Pantau volume log, karena proses yang macet sering berhenti membuat log
- Cakup host juga, sehingga disk penuh tidak secara diam-diam merusak setiap kontainer
- Beri notifikasi pada channel yang Anda benar-benar baca, bukan hanya email
1. Uptime Kuma, terbaik untuk pemeriksaan HTTP dan Docker dengan perutean alert
Uptime Kuma adalah monitor uptime self-hosted default karena alasan yang bagus. Ini berjalan sebagai satu kontainer, memeriksa endpoint HTTP, dan berbicara langsung ke Docker untuk status kontainer, jadi kontainer yang dihentikan memicu alert tanpa perlu pemeriksaan port terlebih dahulu.
Kekurangannya: monitor dikonfigurasi satu per satu di UI, yang bagus untuk homelab kecil tetapi menyakitkan untuk puluhan layanan. Data historis dibatasi oleh penyimpanan SQLite.
Harga:
- Gratis: open source, tanpa tier.
- Berbayar: tidak ada.
Platform: Windows, macOS, Linux melalui Docker.
Bottom line: hal pertama yang harus diinstal ketika homelab memiliki lebih dari tiga layanan.
2. Beszel, terbaik untuk dashboard berbasis agent ringan
Beszel adalah agent Go kecil ditambah hub yang merender dashboard bersih CPU, RAM, disk, dan statistik kontainer dari waktu ke waktu. Ia berjalan di mana Netdata terlalu berat dan Uptime Kuma terlalu biner.
Kekurangannya: lapisan alert lebih tipis daripada pipeline Prometheus, dan integrasi di luar notifiers bawaan memerlukan jahitan Webhook.
Harga:
- Gratis: open source, tanpa tier.
- Berbayar: tidak ada.
Platform: Windows, macOS, Linux binary native atau Docker.
Bottom line: pilihan yang tepat ketika Anda menginginkan grafik riwayat tanpa komitmen Prometheus.
3. Dozzle, terbaik untuk live log tailing di seluruh host
Dozzle melakukan streaming log kontainer di browser dengan filter, warna level log, dan mode swarm yang menarik log dari setiap host di satu panel. Kontainer yang sekarat sering menunjukkan kegagalan dalam lognya sebelum health check berflip, dan Dozzle adalah cara tercepat untuk melihat itu.
Kekurangannya: ini adalah penampil log, bukan monitor lengkap, jadi pasangkan dengan sesuatu yang alert pada pola yang Anda temukan.
Harga:
- Gratis: open source, tanpa tier.
- Berbayar: tidak ada.
Platform: Windows, macOS, Linux melalui Docker.
Bottom line: tab yang Anda biarkan terbuka ketika kontainer mulai berperilaku aneh.
4. Netdata, terbaik untuk metrik frekuensi tinggi dengan deteksi anomali
Netdata mengambil sampel setiap metrik per detik dan menerapkan model ML yang menandai anomali tanpa Anda menulis aturan alert. Penurunan kontainer, gangguan jaringan, dan latensi disk muncul di grafik live dalam satu atau dua detik.
Kekurangannya: agent menggunakan lebih banyak resource daripada Beszel atau Glances, dan cloud tier adalah tempat tampilan multi-node benar-benar bersinar.
Harga:
- Gratis: community edition mencakup satu node dengan semua metrik.
- Berbayar: cloud plan di bawah $10/bulan per pengguna untuk agregasi multi-node dan notifikasi.
Platform: Windows, macOS, Linux.
Bottom line: opsi untuk diambil ketika homelab melewati garis “cukup besar sehingga saya membutuhkan grafik nyata”.
5. Glances, terbaik untuk terminal-first metric browser
Glances menampilkan CPU, memori, disk, jaringan, dan statistik kontainer Docker dalam tampilan terminal tunggal, dan mengekspos tampilan yang sama melalui web UI ketika Anda menginginkan tab browser. Untuk server headless, ini adalah cara tercepat untuk melihat apa yang terjadi sekarang.
Kekurangannya: riwayat terbatas pada apa yang proses simpan dalam memori, dan tidak ada saluran alert bawaan selain stdout.
Harga:
- Gratis: open source, tanpa tier.
- Berbayar: tidak ada.
Platform: Windows, macOS, Linux.
Bottom line: tab SSH kedua di monitor setiap admin homelab.
6. Prometheus + Grafana, terbaik untuk pipeline metrik nyata
Prometheus mengikis metrik, Grafana merender mereka, dan Alertmanager merutekan alert ke mana pun Anda inginkan. Tunjukkan cAdvisor dan node-exporter ke Prometheus yang sama dan Anda memiliki CPU per-kontainer, memori, jumlah restart, dan status kesehatan dalam satu bahasa query.
Kekurangannya: tiga atau empat bagian bergerak untuk dikonfigurasi, dan PromQL membutuhkan liburan akhir pekan untuk dikuasai. Hadiah adalah stack pemantauan yang tidak melampaui homelab.
Harga:
- Gratis: semua komponen open source.
- Berbayar: tier cloud terkelola ada tetapi tidak diperlukan untuk homelab.
Platform: Windows, macOS, Linux melalui Docker atau binary native.
Download: Prometheus Grafana cAdvisor
Bottom line: endgame jika Anda berencana menumbuhkan homelab. Overkill untuk tiga kontainer.
7. Zabbix, terbaik untuk platform pemantauan lengkap
Zabbix adalah server pemantauan matang dengan agent untuk setiap OS, template untuk ratusan layanan, dan pohon escalation untuk alert. Ia melihat kontainer, host, dan jaringan dari satu dashboard.
Kekurangannya: UI menunjukkan usianya, dan homelab lima kontainer tidak memerlukan permukaan operasional yang dibawa Zabbix.
Harga:
- Gratis: open source, tanpa tier.
- Berbayar: dukungan komersial opsional.
Platform: Windows, macOS, Linux.
Bottom line: pilih ini jika Anda juga mengelola server nyata di tempat kerja dan menginginkan satu alat di kedua sisi pagar.
8. Autoheal, terbaik untuk restart otomatis pada health check yang gagal
Autoheal adalah satu kontainer yang mengawasi status HEALTHCHECK kontainer lain dan me-restart apa pun yang melaporkan tidak sehat terlalu lama. Ini tidak melaporkan, ini bertindak, jadi proses yang macet mati dan lahir kembali sebelum Anda tahu ada yang salah.
Kekurangannya: memerlukan HEALTHCHECK nyata di Dockerfile atau compose file setiap kontainer. Kontainer tanpa itu tidak terlihat oleh Autoheal.
Harga:
- Gratis: open source, tanpa tier.
- Berbayar: tidak ada.
Platform: Windows, macOS, Linux melalui Docker.
Download: GitHub
Bottom line: jaring keselamatan yang Anda tambahkan setelah memperbaiki definisi health-check.
Cara memilih yang tepat
- Jika Anda memiliki tiga layanan dan menginginkan satu alat, instal Uptime Kuma dan selesai.
- Jika Anda menginginkan riwayat tanpa kompleksitas, pasangkan Uptime Kuma dengan Beszel.
- Jika Anda perlu melihat mengapa kontainer tidak puas, biarkan Dozzle terbuka.
- Jika Anda menginginkan deteksi anomali tanpa menulis aturan, jalankan Netdata.
- Jika Anda tinggal di terminal, Glances adalah satu layar yang Anda simpan.
- Jika homelab berkembang dan Anda berencana menambah server, investasikan dalam Prometheus + Grafana sekarang.
- Jika Anda menginginkan platform tingkat enterprise dengan escalations, Zabbix adalah pilihan.
- Jika Anda menginginkan kontainer mati memperbaiki diri mereka sendiri, tambahkan Autoheal.
FAQ
Mengapa pemantauan saya melewatkan kontainer mati? Penyebab paling umum adalah pemeriksaan yang melihat port di depan kontainer sementara proses di belakangnya macet. Pindahkan pemeriksaan ke dalam kontainer menggunakan Docker HEALTHCHECK, atau pasangkan pemeriksaan HTTP dengan metrik seperti jumlah proses atau tingkat baris log.
Apakah saya memerlukan Prometheus untuk homelab kecil? Tidak. Uptime Kuma dan Beszel mencakup sebagian besar dari apa yang homelab kecil butuhkan. Prometheus menjadi berharga setelah Anda menginginkan riwayat panjang, query khusus, dan alert berbasis aturan pada metrik apa pun.
Apa opsi gratis terbaik? Uptime Kuma, Beszel, Dozzle, Glances, Prometheus, Grafana, Zabbix, dan Autoheal semuanya gratis dan open source. Uptime Kuma adalah jalur terpendek dari instalasi ke alert pertama.
Bisakah saya menggunakan ini di Windows? Ya. Setiap opsi di sini berjalan di Windows baik secara native maupun melalui Docker Desktop. Uptime Kuma, Beszel, Dozzle, Prometheus, dan Grafana biasanya dijalankan sebagai kontainer.
Bagaimana cara saya menghentikan masalah alert fatigue? Rutekan alert ke channel yang benar-benar Anda baca, atur escalation dari warning ke page setelah penundaan, dan lebih suka symptom alerts (pengguna tidak dapat login) daripada cause alerts (CPU adalah 85 persen). Setiap alat di atas mendukung pola ini.