Один из самых дорогих провалов в инфраструктуре — это не падение железа, а ошибка в планировании отказоустойчивости.
Команда развернула сервис на двух серверах, оба в одном дата-центре, за одним коммутатором и с одним аплинком. На бумаге — «резервирование». На практике — одна точка отказа, спрятанная за красивыми словами. В день, когда у площадки начались проблемы с сетью, легли сразу оба узла. Пользователи видели таймауты, а инженеры — как очереди запросов растут быстрее, чем успевают открываться консоли.
Вывод простой: отказоустойчивость считается не по количеству серверов, а по количеству независимых доменов отказа. Разные стойки, разные сети, разные каналы, разные площадки — иначе это не HA, а иллюзия 🧩
И еще один урок: тестировать нужно не только бэкапы, но и сценарий «что будет, если исчезнет вся зона целиком». Именно такие проверки экономят недели простоя и тонны нервов.
CDN и Скорость
@cdn_speed_pro_n1k
Один из самых дорогих провалов в инфраструктуре — это не падение железа, а ошибка в планировании отказоустойчи
Этот пост опубликован в Telegram-канале CDN и Скорость. Подписаться можно по ссылке: @cdn_speed_pro_n1k.