Один из самых дорогих провалов в инфраструктуре обычно начинается с фразы: «Да у нас же всё бэкапится».
Команда подняла новый сервер, миграция прошла спокойно, мониторинг молчал, а в пике нагрузка выросла всего на 20%. Через пару часов выяснилось: старый диск на виртуалке деградировал, бэкап делался в тот же хостинг-кластер, а репликация была настроена только на видимость отказоустойчивости. В момент сбоя потеряли не только часть данных, но и несколько часов заказов.
Вывод неприятный, но полезный: резервная копия — это не бэкап, если она живёт рядом с основным сервисом. Отказоустойчивость проверяется не в документации, а при падении узла, сети и хранилища одновременно. И ещё один маркер зрелой инфраструктуры: если авария вскрыла сразу три «надежных» решения, значит, архитектура давно просила пересмотра.
Мониторинг Сайтов
@site_monitoring_ru_n1k
Один из самых дорогих провалов в инфраструктуре обычно начинается с фразы: «Да у нас же всё бэкапится».
Этот пост опубликован в Telegram-канале Мониторинг Сайтов. Подписаться можно по ссылке: @site_monitoring_ru_n1k.