Логи собирают почти все, читает их почти никто, и обнаруживается это в момент аварии.
Проблема обычно не в объёме, а в структуре. Записи разного формата, без общего идентификатора запроса, с разным временем на разных машинах, вперемешку с отладочным мусором. В спокойный день это никому не мешает. В инцидент — превращает разбор в перебор.
Что имеет смысл привести в порядок заранее:
— единое время во всей инфраструктуре, желательно в одном поясе;
— сквозной идентификатор, по которому запрос прослеживается через все сервисы;
— разделение уровней: то, что сигнализирует о поломке, не должно тонуть в отладке;
— срок хранения и ротация, иначе логи однажды займут диск и уронят сервис сами.
Отдельная тема — что в журналы попадать не должно. Пароли, полные платёжные данные, содержимое личной переписки. Утечка через логи случается чаще, чем через взлом.
Полезная привычка: после каждого инцидента спрашивать себя, чего в логах не хватило. Обычно ответ есть, и он занимает полчаса работы.
Мониторинг Сайта
@site_monitoring_n1k
Логи собирают почти все, читает их почти никто, и обнаруживается это в момент аварии.
Этот пост опубликован в Telegram-канале Мониторинг Сайта. Подписаться можно по ссылке: @site_monitoring_n1k.