Один из самых дорогих сбоев в инфраструктуре обычно выглядит буднично: «просто забыли про одну мелочь».
У нас это случилось с плановым переносом сайта на новый сервер. Виртуалка была мощнее, дисков хватало, бэкапы лежали отдельно. Но при миграции не проверили лимиты по inode — и через пару часов сайт начал падать без явных ошибок. Файлы создавались, а места, по сути, уже не было.
Итог: часть кэша не записалась, cron-задачи остановились, пользователи ловили 500-е. Восстановление заняло не так много времени, как разбор причин.
Что вынесли в список обязательных проверок:
— считать не только гигабайты, но и inode;
— тестировать перенос на копии перед боевым запуском;
— держать мониторинг не только нагрузки, но и доступности записи на диск.
В инфраструктуре ломает не всегда железо. Чаще — отсутствие одной строчки в чек-листе 🔧
Облачный Хостинг
@cloud_hosting_ru_n1k
Один из самых дорогих сбоев в инфраструктуре обычно выглядит буднично: «просто забыли про одну мелочь».
Этот пост опубликован в Telegram-канале Облачный Хостинг. Подписаться можно по ссылке: @cloud_hosting_ru_n1k.