Почему сеть падает не «вдруг»: 5 причин, которые почти всегда видны в логах
Отказ сетевой инфраструктуры редко начинается с одного события. Анализ показал, что чаще это цепочка: рост задержек, ошибки на линке, потом потеря соседства и уже затем — недоступность сервиса. Поэтому первым делом смотрят не на симптом, а на последовательность метрик.
Типовые источники отказов:
— физический уровень: кабель, SFP, порт, питание;
— перегрузка: очереди, drops, микробёрсты;
— неверная настройка: MTU, VLAN, ACL, маршрутизация;
— нестабильное соседство: BGP/OSPF/VRRP flap;
— внешний фактор: отказ аплинка, L2-петля, неверный STP.
Данные подтверждают следующую корреляцию: если есть рост CRC, input errors и retransmits, проблема обычно ниже уровня маршрутизации. Если растут latency и queue drops без ошибок физики, вероятнее всего, узел упирается в пропускную способность или политику QoS. Рекомендуется обращать внимание на метрику time-to-recover: она лучше показывает устойчивость, чем единичный ping.
Проверка должна быть короткой и повторяемой: логи интерфейсов, состояние соседей, счётчики ошибок, таблица маршрутов, изменения конфигурации. Затем — сопоставление по времени: что сломалось первым, что последовало следом, и где началась деградация.
Практика одна: сначала исключаем физику и переполнение, потом конфигурацию и протоколы. Такой порядок сокращает время поиска и не даёт лечить симптом вместо причины.
Прокси-инфра
@proxy_infra_desk_arb
Почему сеть падает не «вдруг»: 5 причин, которые почти всегда видны в логах
Этот пост опубликован в Telegram-канале Прокси-инфра. Подписаться можно по ссылке: @proxy_infra_desk_arb.