📰 Laman Utama 🔒 Log Masuk Admin
Aug 5, 2026 ⏰ 9 min read

Memantau Pelayan Linux Anda Seperti Pro: Prometheus, Grafana & Amaran

Setiap sysadmin tahu perasaan itu: ia adalah 3:00 PG, telefon anda berdengung, dan pengguna bertanya mengapa tapak web tidak berfungsi — semasa anda berebut ke SSH ke pelayan yang telah merendahkan maruah secara senyap selama berjam-jam. Hakikat yang tidak selesa ialah kebanyakan gangguan tidak berlaku secara tiba-tiba. CPU menjalar ke atas, cakera diisi dengan perlahan, kebocoran memori dibina selama beberapa minggu. Satu-satunya sebab yang mereka rasa tiba-tiba ialah tiada siapa yang memerhati.

Di sinilah timbunan pemantauan yang betul mengubah segala-galanya. Daripada bertindak balas terhadap aduan, anda akan dimaklumkan apabila metrik melepasi ambang — selalunya sebelum seorang pengguna menyedari apa-apa yang salah. Dalam panduan ini, kami akan membina tindanan pemantauan lengkap untuk pelayan Linux anda menggunakan tiga alatan sumber terbuka yang bersama-sama membentuk standard industri: Prometheus untuk mengumpul dan menyimpan metrik, Grafana untuk papan pemuka yang cantik dan Pengurus Amaran untuk pemberitahuan penghalaan apabila berlaku masalah. Tiada lesen proprietari, tiada yuran setiap hos, hanya alat yang kukuh dan diuji pertempuran.

Mengapa Pemantauan Lebih Penting Daripada Sebelumnya

Infrastruktur moden lebih besar dan lebih banyak diedarkan berbanding sedekad yang lalu, tetapi asas untuk memastikan pelayan sentiasa sihat tidak berubah: anda perlu tahu apa yang berlaku, sekarang, pada setiap mesin yang anda jalankan. Pemantauan memberi anda tiga kuasa besar.

Pertama, pengesanan awal. Cakera pada 91% hari ini akan menjadi cakera pada 100% minggu depan. Peningkatan penggunaan memori secara beransur-ansur memberitahu anda bahawa proses bocor lama sebelum ia mencetuskan pembunuh OOM. Pemantauan mengubah bom masa senyap ini menjadi makluman rutin dan keutamaan rendah yang boleh anda betulkan semasa waktu bekerja.

Kedua, konteks sejarah. Apabila sesuatu rosak, soalan pertama sentiasa "apa yang berubah?" Dengan metrik yang disimpan dari semasa ke semasa, anda boleh menindih cap masa penggunaan pada graf anda dan menonton lonjakan lengkung memori tepat pada jam 14:32 — saat keluaran baharu disiarkan secara langsung. Ini menjadikan tekaan menjadi bukti.

Ketiga, perancangan kapasiti. "Berapa banyak RAM yang perlu kita tambah?" adalah mustahil untuk menjawab dari perasaan usus. Dengan sejarah metrik berbulan-bulan, anda boleh mengunjurkan kadar pertumbuhan, melihat corak bermusim dan membeli perkakasan atau mengubah saiz kejadian berdasarkan nombor nyata dan bukannya harapan.

The Stack: Prometheus, Grafana dan Alertmanager

Sebelum kita mengotorkan tangan kita, marilah kita memahami seni bina, kerana mengetahui mengapa setiap bahagian wujud menjadikan konfigurasi lebih mudah.

Prometheus ialah nadi kepada timbunan. Ia ialah pangkalan data siri masa yang menarik metrik daripada pelayan anda mengikut jadual (lalai ialah setiap 15 saat), dan bukannya menunggu pelayan menolak data kepadanya. Model tarik ini adalah masalah besar: anda boleh mengetahui sekilas pandang sama ada mesin masih hidup, kerana kikisan yang hilang itu sendiri adalah isyarat. Prometheus menyimpan segala-galanya dengan cap masa berketepatan tinggi dan dilengkapi dengan bahasa pertanyaan yang berkuasa dipanggil PromQL yang membolehkan anda memotong, mengagregat dan mengaitkan metrik dalam masa nyata.

nodeexporter ialah ejen kecil yang anda pasang pada setiap hos Linux yang anda mahu pantau. Ia mendedahkan beratus-ratus metrik sistem standard — CPU, memori, cakera, rangkaian, sistem fail dan banyak lagi — melalui titik akhir HTTP mudah pada port 9100. Prometheus mengikis titik akhir itu. Anda tidak perlu memasang apa-apa yang berat pada pelayan yang dipantau anda; nodeexporter ialah binari statik tunggal tanpa kebergantungan.

Grafana terletak di atas Prometheus dan menukar nombor mentah menjadi papan pemuka. Ia bersambung kepada Prometheus sebagai sumber data dan anda membina panel: graf garis, tolok, peta haba, kad statistik. Sebaik sahaja anda mempunyai papan pemuka yang anda suka, anda boleh berkongsi dengan pasukan anda atau mengeksportnya sebagai JSON dan mengimportnya pada contoh Grafana yang lain. Terdapat juga perpustakaan besar papan pemuka pra-bina dalam komuniti Grafana, jadi anda jarang bermula dari kanvas kosong.

Alertmanager mengendalikan "jadi apa?" sebahagian daripada pemantauan. Prometheus sendiri boleh menilai peraturan amaran terhadap metrik anda, tetapi apabila amaran berlaku, ia diserahkan kepada Alertmanager, yang bertanggungjawab untuk mengumpulkan, penyahduplikasian dan penghalaan pemberitahuan ke e-mel, Slack, Telegram atau mana-mana webhook. Ia juga menangani masalah perit keletihan amaran: jika lima makluman berkaitan menyala serentak, Alertmanager boleh mengumpulkannya ke dalam satu pemberitahuan dan bukannya menghantar spam kepada pasukan anda.

Berdiri Timbunan dalam Minit

Cara terpantas untuk menjalankan ketiga-tiga pada pelayan tunggal ialah dengan Docker Compose, yang sesuai untuk homelab atau persediaan pengeluaran kecil. Jika Docker bukan pilihan pada persekitaran anda, setiap komponen juga dipasang dengan bersih daripada pakej rasmi pada pengedaran keluarga Debian, Ubuntu dan RHEL.

Mulakan dengan mencipta direktori untuk timbunan dan fail `docker-compose.yml`. Perkhidmatan teras kelihatan seperti ini: bekas Prometheus yang memasang fail konfigurasi dan volum data, bekas Grafana yang mendedahkan port 3000 dan bekas nodeexporter yang memantau hos itu sendiri. Untuk mesin yang anda ingin tonton, sama ada jalankan nodeexporter sebagai perkhidmatan systemd atau tambahkannya sebagai bekas tambahan.

Inti konfigurasi ialah `prometheus.yml`. Di dalamnya anda tentukan sasaran kikis — senarai titik akhir yang harus dikumpulkan oleh Prometheus. Konfigurasi minimum mengisytiharkan selang scrape global, kemudian tugas penyenaraian bahagian `scrapeconfigs`. Setiap kerja mempunyai nama dan senarai sasaran statik; untuk nodeexporter pada mesin tempatan iaitu `localhost:9100`, dan untuk pelayan jauh anda tambahkan `server1.example.com:9100` dan seterusnya. Setiap sasaran yang anda tambahkan ialah satu lagi pelayan yang boleh anda lihat pada papan pemuka anda.

Setelah semuanya selesai, Grafana adalah bintang rancangan itu. Log masuk di `http://your-server:3000` dengan bukti kelayakan pentadbir lalai, tambah Prometheus sebagai sumber data (hanya tunjuk pada `http://prometheus:9090` jika kedua-duanya dijalankan di Docker), dan import papan pemuka komuniti. Salah satu yang paling popular ialah papan pemuka Penuh Pengeksport Node rasmi, yang memberikan anda CPU, memori, cakera dan panel rangkaian di luar kotak. Dalam masa kurang dari sepuluh minit anda beralih daripada sifar kepada gambaran keseluruhan menatal setiap pelayan yang anda uruskan secara langsung.

Perkara yang Perlu Dipantau Sebenarnya: Isyarat Emas

Timbunan pemantauan hanya sebaik metrik yang anda putuskan untuk menonton. Mengumpul segala-galanya adalah mudah; mengetahui apa yang penting ialah kerajinan. Industri ini telah bertumpu pada empat "isyarat emas" yang menangkap sebahagian besar masalah, ditambah dengan beberapa keperluan khusus Linux yang mesti ada.

CPU dan muat diutamakan. CPU tinggi tidak secara automatik teruk — ini mungkin bermakna pelayan anda bekerja keras dan melakukan kerja yang hebat. Perkara yang perlu diperhatikan ialah beban tinggi berkekalan tanpa ruang kepala terbiar, atau purata beban yang terus meningkat sementara daya pemprosesan kekal rata, yang biasanya menandakan proses lari atau kebocoran kolam benang.

Memori patut diberi amaran khas untuk pemula Linux: nombor "digunakan" arahan `percuma` mengelirukan kerana Linux cache secara agresif. Apa yang penting ialah metrik tersedia, penggunaan swap dan nombor `vmstat` untuk bertukar. Pelayan yang bertukar-tukar secara berterusan ialah pelayan yang meronta-ronta — tambahkan RAM atau cari kebocoran.

Ruang cakera dan I/O ialah pembunuh senyap klasik. Jejaki peratusan penggunaan sistem fail setiap lekapan, penggunaan inod (anda boleh kehabisan inod sementara ruang kelihatan baik!), dan I/O tunggu. Cakera pada 99% tidak gagal serta-merta — tetapi cakera penuh pada pelayan pangkalan data boleh merosakkan penulisan atau ranap aplikasi dengan cara yang paling teruk.

Rangkaian mengisyaratkan melengkapkan gambar: lebar jalur masuk dan keluar, kehilangan paket dan pembilang ralat. Lonjakan dalam penghantaran semula TCP selalunya merupakan petunjuk pertama bahawa suis gagal atau pautan tepu, lama sebelum ada yang mengadu tentang kelambatan.

Pada peringkat aplikasi, fikirkan dari segi isyarat emas: kependaman (berapa lama permintaan diambil), trafik (berapa banyak permintaan sesaat), ralat (berapa banyak yang gagal) dan tepu (berapa hampir dengan kapasiti anda). Malah pengeksport tersuai mudah yang mendedahkan "permintaan sesaat" dan "kiraan ralat" untuk apl web utama anda akan membayar sendiri dalam masa seminggu.

Makluman Selesai Betul: Elakkan Budak Yang Menangis Serigala

Inti dari latihan ini ialah telefon anda hanya perlu berdering apabila sesuatu benar-benar memerlukan anda. Amaran yang tidak baik — peraturan bising, samar-samar atau sentiasa menembak — adalah lebih teruk daripada tidak memberi amaran, kerana pasukan anda akan belajar untuk mengabaikan setiap pemberitahuan.

Mulakan dengan ambang yang bermakna. Makluman tentang keadaan berkekalan, bukan blips. Lonjakan CPU selama 30 saat ialah bunyi bising; CPU melebihi 90% selama 15 minit adalah cerita. Peraturan amaran Prometheus menyokong klausa `untuk` dengan tepat untuk ini: syarat mesti disimpan secara berterusan untuk tempoh yang ditentukan sebelum amaran berlaku. Gunakan secara bebas.

Tentukan tahap keterukan dan halakannya secara berasingan. Makluman kritikal — hos ke bawah, cakera penuh, perkhidmatan tidak dapat dicapai — harus halaman seseorang dengan segera melalui pemberitahuan push atau SMS. Makluman amaran — cakera melebihi 80%, muat naik arah aliran — boleh pergi ke saluran yang lebih senyap dan disemak pada siang hari. Jika semuanya kritikal, tiada yang kritikal.

Akhir sekali, terus memaklumkan peraturan dengan infrastruktur anda sebagai kod. Simpan `prometheus.yml` dan peraturan amaran anda dalam git, sama seperti kod aplikasi anda. Apabila rakan sekerja bertanya "mengapa kami mendapat halaman pada 4 PG?", anda boleh menunjuk pada peraturan tepat yang dicetuskan, ambangnya dan komitmen yang mengubahnya. Ini adalah perbezaan antara timbunan pemantauan dan budaya pemantauan.

Daripada Papan Pemuka kepada Keputusan

Berikut ialah gelung yang memisahkan sysadmin yang hebat daripada yang lain: anda tidak hanya melihat papan pemuka apabila sesuatu rosak — anda menggunakannya sebelum ia pecah dan anda menyemaknya selepas ia rosak.

Luangkan sepuluh minit setiap pagi untuk mengimbas papan pemuka anda: sebarang pancang baharu, sebarang lekapan yang menjalar ke arah penuh, sebarang baris gilir terbina. Lama kelamaan anda akan mempelajari "bentuk biasa" setiap pelayan, dan penyimpangan akan melompat keluar kepada anda serta-merta. Apabila insiden berlaku, tahan keinginan untuk memulakan semula semuanya secara membuta tuli. Buka metrik, cari saat lengkung berubah dan kaitkan dengan sejarah penggunaan anda. Sembilan kali daripada sepuluh, graf memberitahu anda dengan tepat perubahan yang menyebabkan masalah.

Dan apabila anda membetulkan sesuatu, tambahkan amaran untuknya. Itulah tabiat pengkompaunan: setiap kejadian yang anda alami menjadi peraturan yang menghalang kejadian seterusnya. Selepas beberapa bulan, timbunan anda bukan lagi hanya memantau pelayan anda — ia mengekod semua yang anda telah pelajari tentang mereka.

Kesimpulan

Anda tidak memerlukan platform perusahaan yang mahal untuk memantau pelayan Linux anda dengan betul. Prometheus, Grafana dan Alertmanager memberi anda pemerhatian gred industri secara percuma, dengan jejak yang kecil dan komuniti yang besar di belakangnya. Mulakan dengan kecil: satu hos, satu papan pemuka, dua peraturan amaran. Kemudian kembangkan apabila anda berasa selesa.

Kemenangan sebenar bukanlah graf - ia adalah ketenangan fikiran. Apabila telefon anda berdengung pada pukul 3:00 PG, ini adalah kerana sesuatu yang benar-benar memerlukan anda dan anda sudah tahu dengan tepat apa itu. Itulah yang dikatakan oleh operator pintar sebagai tidur malam yang nyenyak.

Infografik: Timbunan Pemantauan Pelayan Linux

Infografik: Timbunan Pemantauan Pelayan Linux

← Back to Homepage

💬 0 Comments

☕ Support Eismar Tech Hub

🌎 International

Beli kopi

Credit Card / PayPal accepted

💳 Local (Malaysia)

Touch N Go QR

Touch 'n Go / DuitNow QR