Прокси-инфра
Прокси-инфра
@proxy_infra_desk_arb

Метрики инфраструктуры: что собирать, чтобы видеть деградацию до инцидента

Метрики инфраструктуры: что собирать, чтобы видеть деградацию до инцидента

Сбор метрик без модели наблюдаемости быстро превращается в склад графиков. Анализ показал, что полезны не все числа, а только те, которые описывают три слоя: ресурс, сервис и пользовательский путь.

На уровне ресурса фиксируйте:
— загрузку CPU, память, диск, сеть;
— очередь I/O и latency по хранилищу;
— saturation узла, а не только utilization.

На уровне сервиса смотрите:
— latency по percentiles, а не среднее;
— rate ошибок, timeouts, retries;
— длину очередей, backlog, число активных соединений.

Визуализация должна отвечать на один вопрос: где ломается цепочка. Для этого держите рядом тренд, распределение и корреляцию. Один график скрывает причину, три графика обычно показывают узкое место. Рекомендуется обратить внимание на метрику, которая растет раньше остальных и лучше всего совпадает с жалобами пользователей.

Полезное правило простое: если метрика не помогает принять решение, ее не должно быть на дашборде. Система становится стабильнее не от количества панелей, а от точного набора сигналов, по которым можно вовремя увидеть деградацию.
Этот пост опубликован в Telegram-канале Прокси-инфра. Подписаться можно по ссылке: @proxy_infra_desk_arb.
tech

Свежие посты в категории «Tech Infrastructure»

Все каналы категории →

start

Готовы запустить рекламу через сеть public.tg?

Новый оффер, продукт, GEO, кейс, событие или партнёрский запуск — соберём маршрут под задачу и отдадим медиаплан.

Telegram для медиаплана: @AFFtop_connect. Быстрый тест: $20 за канал, $1000 за пакет по сети.