Аномалии в трафике ищутся не глазами, а сочетанием базовой линии, порогов и контекста
Анализ показал, что одиночная метрика почти всегда дает ложные срабатывания. Если смотреть только на RPS, можно принять плановый рост за инцидент. Если смотреть только на ошибки, пропустить деградацию латентности. Поэтому рабочая схема строится вокруг нескольких слоев наблюдения.
Сначала фиксируют базовую линию: суточная и недельная сезонность, p50/p95/p99, долю 4xx/5xx, retransmit, drop, queue depth. Затем сравнивают текущее поведение с ожидаемым профилем по тому же времени и тому же сегменту. Данные подтверждают следующую корреляцию: чем меньше разрезов, тем больше шум и тем хуже точность.
Дальше используют три методологии:
— пороговая: проста и надежна для грубых отказов;
— статистическая: подходит для плавных отклонений от нормы;
— поведенческая: ищет смену паттерна, а не абсолютное значение.
На практике их лучше комбинировать: порог ловит аварию, статистика — дрейф, поведение — скрытую деградацию.
Рекомендуется обратить внимание на метрику времени реакции: полезная детекция не должна быть медленнее самой проблемы. Если алерт срабатывает только после накопления очередей и ошибок, значит, модель слишком грубая или опорные метрики выбраны неверно.
Рассмотрим архитектурный срез по данному узлу. Чем чище сегментация по сервисам, регионам и типам запросов, тем раньше видно отклонение и тем меньше цена ложного тревожного сигнала.
Прокси-инфра
@proxy_infra_desk_arb
Аномалии в трафике ищутся не глазами, а сочетанием базовой линии, порогов и контекста
Этот пост опубликован в Telegram-канале Прокси-инфра. Подписаться можно по ссылке: @proxy_infra_desk_arb.