90% проблем с хостингом видно не в логах, а в метриках до инцидента.
Что стоит держать на панели каждый день:
— latency p95/p99, а не только среднее;
— error rate по 4xx/5xx в разрезе сервисов;
— CPU steal и iowait на виртуалках;
— RAM pressure и swap-in/out;
— заполнение дисков не в процентах, а в днях до отказа;
— RPS и время отклика на пиках, а не в спокойные часы.
Практика простая: если p95 вырос на 20–30% без роста нагрузки — это уже не «шум», а ранний сигнал. 📈
Если диск начинает расти быстрее 1–2% в сутки, у вас не запас, а отсроченная авария.
Лучший мониторинг — тот, где видно тренд, а не только падение сервиса. 🚨
Безопасность Серверов
@server_security_ru_n1k
90% проблем с хостингом видно не в логах, а в метриках до инцидента.
Этот пост опубликован в Telegram-канале Безопасность Серверов. Подписаться можно по ссылке: @server_security_ru_n1k.