Метрики инфраструктуры: что собирать, чтобы видеть деградацию до инцидента
Сбор метрик без модели наблюдаемости быстро превращается в склад графиков. Анализ показал, что полезны не все числа, а только те, которые описывают три слоя: ресурс, сервис и пользовательский путь.
На уровне ресурса фиксируйте:
— загрузку CPU, память, диск, сеть;
— очередь I/O и latency по хранилищу;
— saturation узла, а не только utilization.
На уровне сервиса смотрите:
— latency по percentiles, а не среднее;
— rate ошибок, timeouts, retries;
— длину очередей, backlog, число активных соединений.
Визуализация должна отвечать на один вопрос: где ломается цепочка. Для этого держите рядом тренд, распределение и корреляцию. Один график скрывает причину, три графика обычно показывают узкое место. Рекомендуется обратить внимание на метрику, которая растет раньше остальных и лучше всего совпадает с жалобами пользователей.
Полезное правило простое: если метрика не помогает принять решение, ее не должно быть на дашборде. Система становится стабильнее не от количества панелей, а от точного набора сигналов, по которым можно вовремя увидеть деградацию.
Прокси-инфра
@proxy_infra_desk_arb
Метрики инфраструктуры: что собирать, чтобы видеть деградацию до инцидента
Этот пост опубликован в Telegram-канале Прокси-инфра. Подписаться можно по ссылке: @proxy_infra_desk_arb.