Отказы сети редко возникают в одном месте: ищем цепочку, а не виновника
Сетевая инфраструктура обычно падает не «вдруг», а через набор слабых сигналов. Анализ показал, что картина почти всегда начинается с одного из трёх уровней: физика, L2/L3 или контрольные плоскости. Если смотреть только на симптом, легко перепутать обрыв линка, петлю, перегрузку очередей и отказ соседнего узла.
Разбор инцидента строится от нижнего слоя вверх:
— проверить ошибки на интерфейсах, flaps, CRC, drops;
— сравнить состояние соседей по ARP, LLDP, BGP/OSPF;
— посмотреть, нет ли асимметрии маршрутов, роста латентности и джиттера;
— сопоставить время деградации с изменениями в конфигурации, нагрузкой и отказами питания.
Данные подтверждают следующую корреляцию: чем меньше телеметрии на входе, тем дольше локализация. Поэтому полезно заранее иметь базовые метрики по портам, очередям, таблицам маршрутизации и таймаутам протоколов. Если метрики не снимаются, инцидент превращается в ручной поиск по логам и догадкам. Рекомендуется обратить внимание на метрику доступности соседей и процент потерь на магистральных интерфейсах ⚙️
После локализации важно отделить первопричину от каскада. Одно отключение питания может вызвать переобучение маршрутов, переполнение таблиц и кратковременный отказ сервисов выше по стеку. Рассмотрим архитектурный срез по данному узлу: где отказ был первичным, а где система только усилила его эффект.
Вывод простой: стабильность сети держится не на отсутствии ошибок, а на том, насколько быстро они видны, классифицируются и изолируются.
Прокси-инфра
@proxy_infra_desk_arb
Отказы сети редко возникают в одном месте: ищем цепочку, а не виновника
Этот пост опубликован в Telegram-канале Прокси-инфра. Подписаться можно по ссылке: @proxy_infra_desk_arb.