Неверное делегирование DNS ломает зону тихо: инцидент начинается задолго до отказа
Давайте разберем флоу запроса. Родительская зона публикует NS для дочерней, резолвер идёт к ней по цепочке, и любая ошибка в делегировании превращается в странный симптом: часть клиентов получает ответ, часть — timeout, часть — старый кеш.
Типовые причины инцидентов:
— NS в родителе не совпадают с фактическими authoritative-серверами;
— glue-записи отсутствуют или указывают на невалидный адрес;
— у NS внутри дочерней зоны нет согласованного набора;
— DNSSEC подписан, но цепочка доверия рвётся на delegating point.
По журналам это выглядит грязно: SERVFAIL, внезапный рост NXDOMAIN, деградация только у отдельных рекурсоров. Проверим влияние на RTT и консистентность зон: один неверный NS может увеличить число обращений, а при split-horizon ошибка маскируется до первого внешнего запроса. Исключаем Human Error через автоматизацию: сравнение parent/child NS, валидатор glue, pre-deploy check для DS и SOA.
Если инцидент уже в проде, не «чините» его точечно через один резолвер. Сначала сверяйте делегирование целиком: родитель, дочерняя зона, glue, DNSSEC, TTL. Стабильность DNS — это фундамент, а не опция.
Управление DNS инфраструктурой
@dns_management_flow_arb
Неверное делегирование DNS ломает зону тихо: инцидент начинается задолго до отказа
Этот пост опубликован в Telegram-канале Управление DNS инфраструктурой. Подписаться можно по ссылке: @dns_management_flow_arb.