80% проблем с инфраструктурой начинаются не с «падения сервера», а с пропущенных метрик.
Самые полезные цифры для хостинга — те, что видно раньше всех: CPU steal, I/O wait, latency диска, рост очереди запросов, уровень переполнения inode и p95 по отклику. Если смотреть только на загрузку CPU и RAM, можно пропустить деградацию, которая уже бьёт по пользователям.
Практика простая:
— держите базовую линию по каждой критичной метрике;
— ставьте алерты не на факт перегруза, а на отклонение от нормы;
— отдельно отслеживайте пики в 5–10 минут, а не только среднее за час.
Среднее «всё в зелёной зоне» часто маскирует 3 минуты простоя. А именно они потом превращаются в тикеты, отток и лишние часы на разборы 📈
Резервные Копии
@backup_strategy_ru_n1k
80% проблем с инфраструктурой начинаются не с «падения сервера», а с пропущенных метрик.
Этот пост опубликован в Telegram-канале Резервные Копии. Подписаться можно по ссылке: @backup_strategy_ru_n1k.