Один из самых дорогих провалов в инфраструктуре обычно выглядит не как «катастрофа», а как маленькая сэкономленная настройка.
У клиента всё работало стабильно, пока не решили «чуть оптимизировать» хостинг: отключили лишние проверки, сократили мониторинг и перенесли бэкапы на тот же сервер, чтобы не платить за отдельное хранилище. Через неделю диск заполнился логами, служба резервного копирования не запустилась, а алерты молчали — их тоже убрали как шумные.
Итог: простой длился 7 часов, восстановление заняло почти сутки, а часть данных пришлось собирать вручную. 💥
Главный урок здесь простой: инфраструктура любит избыточность больше, чем «эффективность». Если мониторинг, бэкапы и основной сервис живут в одной точке отказа — это не оптимизация, а отложенный инцидент.
Безопасность Серверов
@server_security_ru_n1k
Один из самых дорогих провалов в инфраструктуре обычно выглядит не как «катастрофа», а как маленькая сэкономле
Этот пост опубликован в Telegram-канале Безопасность Серверов. Подписаться можно по ссылке: @server_security_ru_n1k.