Внутренние метрики и внешняя проверка отвечают на разные вопросы, и подменять одно другим не получается.
Метрики изнутри говорят, что происходит с системой: нагрузка, очереди, память, время выполнения запросов. Они подробные, но у них есть неустранимый недостаток — их собирает та же инфраструктура, которая может лежать. Когда падает всё, метрики падают вместе со всем.
Внешняя проверка говорит только одно: доступен сервис снаружи или нет. Подробностей в ней почти нет, зато она независима.
Разумное разделение:
— наружу выносится факт: работает или нет, быстро или медленно;
— внутри остаётся диагностика: почему именно медленно;
— уведомления настраиваются на внешние признаки, потому что именно их чувствует пользователь;
— внутренние метрики нужны в момент разбора, а не в момент тревоги.
Отдельная деталь: система уведомлений должна жить отдельно от того, за чем следит. Иначе в момент аварии вместе с сайтом замолкает и тот, кто должен был о ней сообщить.
—
Если тема зашла, посмотри @site_speed_seo_n1k
Мониторинг Сайта
@site_monitoring_n1k
Внутренние метрики и внешняя проверка отвечают на разные вопросы, и подменять одно другим не получается.
Этот пост опубликован в Telegram-канале Мониторинг Сайта. Подписаться можно по ссылке: @site_monitoring_n1k.