Аномалии трафика ловятся не пиками, а отклонениями от базовой линии
Методология начинается не с алерта, а с вопроса: от чего считать норму. Для сетевого слоя это обычно профиль по времени суток, дням недели, типу узла и направлению трафика. Без этого любой всплеск превращается в шум, а любое падение — в ложный инцидент.
На практике работают три уровня проверки:
— абсолютные пороги для грубых отказов;
— относительные отклонения от медианы или скользящего окна;
— поведенческие признаки: рост ошибок, смена распределения портов, пакетов, RTT, retransmits.
Анализ показал, что один сигнал почти всегда недостаточен. Данные подтверждают следующую корреляцию: если объем трафика меняется, но latency и error rate стабильны, это может быть штатная переаллокация нагрузки. Если объем ровный, а растут потери и ретрансляции — ищем деградацию канала, очередей или промежуточного оборудования. Рекомендуется сопоставлять метрики в одном временном окне, а не по отдельности.
Хорошая схема обнаружения строится как слои: сначала baseline, затем фильтрация сезонности, потом корреляция с соседними узлами и сервисными метриками. Так снижается число ложных срабатываний и проще локализовать источник: клиентский сегмент, магистраль, балансировщик или прикладной сервис.
Если аномалия видна только в одной метрике, это повод для проверки, но не для вывода. Если она подтверждается несколькими независимыми признаками, инцидент уже можно считать вероятным.
Прокси-инфра
@proxy_infra_desk_arb
Аномалии трафика ловятся не пиками, а отклонениями от базовой линии
Этот пост опубликован в Telegram-канале Прокси-инфра. Подписаться можно по ссылке: @proxy_infra_desk_arb.