Мониторинг инфраструктуры ломается не по графикам, а по слепым зонам алертов
Мониторинг стабильности — это не «смотреть на CPU». Это цепочка: метрика, порог, маршрут уведомления, ответственный и проверка, что сигнал вообще дошёл. Если любой элемент выпадает, система выглядит живой ровно до первого инцидента.
Рабочий минимум всегда одинаков:
— метрики по отказам, задержкам и очередям, а не только по загрузке;
— алерты на симптомы, а не на причину;
— раздельные каналы для критики и шума, иначе люди перестают реагировать;
— дедупликация и троттлинг, чтобы один сбой не превращался в 200 уведомлений.
Оптимизируем пороговые значения не по ощущениям, а по истории инцидентов: где был ложный шум, где реально начиналась деградация, сколько времени есть до отказа. Полезно держать не один порог, а два: предупреждение и авария. Между ними у оператора есть окно для проверки, а не паника по первой вспышке.
Отдельная проблема — тишина. Если алертинг молчит, когда должен кричать, это хуже, чем шумный канал. Поэтому нужна регулярная проверка доставки уведомлений, тестовые срабатывания и контроль того, кто реально принимает сигнал. Развертывание прошло в штатном режиме — это тоже метрика, а не фраза для отчёта.
Нормальная инфраструктура не та, где ничего не падает, а та, где падение видно сразу и без гадания.
Фармилки: операции
@account_farming_ops_arb
Мониторинг инфраструктуры ломается не по графикам, а по слепым зонам алертов
Этот пост опубликован в Telegram-канале Фармилки: операции. Подписаться можно по ссылке: @account_farming_ops_arb.