Порядок действий в инциденте определяется заранее, потому что в момент аварии его никто не придумывает.
Первое — восстановление, а не поиск причины. Это неочевидно для инженера: хочется понять, что случилось. Пользователю нужно, чтобы работало, и откат к предыдущей рабочей версии почти всегда быстрее разбора.
Что стоит зафиксировать до того, как понадобится:
— кто принимает решение об откате и не требуется ли для этого чьё-то согласие;
— где лежит инструкция и работает ли она у человека, который её не писал;
— как сообщить пользователям, что проблема известна: молчание воспринимается хуже плохих новостей;
— что считать концом инцидента: не «стало лучше», а проверяемый признак.
После восстановления — разбор. Полезный разбор отвечает не на вопрос «кто виноват», а на вопрос «почему это стало возможным и что заметит проблему в следующий раз раньше».
Признак зрелого процесса простой: после каждого инцидента в мониторинге появляется новая проверка. Если не появляется, следующий раз пройдёт точно так же.
Мониторинг Сайта
@site_monitoring_n1k
Порядок действий в инциденте определяется заранее, потому что в момент аварии его никто не придумывает.
Этот пост опубликован в Telegram-канале Мониторинг Сайта. Подписаться можно по ссылке: @site_monitoring_n1k.