Разбор отказов сети начинается не с коммутатора, а с границы влияния
Если линк «падает», сначала фиксируем не причину, а контур сбоя: один узел, стойка, сегмент, площадка или весь маршрут. Без этого легко перепутать локальный дефект с каскадной деградацией. Анализ показал, что половина ошибок в расследовании возникает на этапе неверной локализации.
Типовые группы причин выглядят так:
— физика: SFP, кабель, питание, перегрев, плохой контакт;
— L2/L3: петля, неверный VLAN, конфликт адресации, flap маршрута;
— управление: кривой change, рассинхрон конфигураций, потеря соседства;
— среда: перегрузка, broadcast storm, исчерпание таблиц, ошибки на аплинке.
Дальше смотрим не на один симптом, а на связку метрик: рост CRC, packet loss, смена состояния интерфейса, latency, reset счетчиков, события протоколов. Рекомендуется обратить внимание на метрику, которая меняется первой: она обычно ближе к первопричине, чем итоговый down.
Если причина не подтверждается логами и счетчиками, не надо «додумывать» ремонт. Сначала воспроизводимость, затем корреляция по времени, потом проверка на соседних узлах. Рассмотрим архитектурный срез по данному узлу: часто сбой оказывается не в самом устройстве, а в участке, где нет резервирования или контроля.
Практика простая: локализовать контур, собрать телеметрию, проверить изменения и только потом чинить. Так сеть перестает быть набором сюрпризов и становится системой с понятной причинностью.
Прокси-инфра
@proxy_infra_desk_arb
Разбор отказов сети начинается не с коммутатора, а с границы влияния
Этот пост опубликован в Telegram-канале Прокси-инфра. Подписаться можно по ссылке: @proxy_infra_desk_arb.