Один из самых дорогих уроков в инфраструктуре мы получили не на апгрейде, а на мелочи.
Ночью всё выглядело идеально: CPU в норме, диски живы, сеть без скачков. Но один сервис начал отвечать с задержкой, потом — с редкими таймаутами. Дежурная проверка показала: проблема не в сервере, а в переполненных логах, которые за считаные часы забили раздел с временными файлами. В итоге посыпалась очередь задач, а за ней — часть клиентских запросов.
Парадокс в том, что железо было мощным, резервирование — правильным, мониторинг — тоже был. Не хватило одного простого правила: следить не только за загрузкой, но и за «мелкими» ресурсами, которые редко попадают в центр внимания.
После этого мы добавили алерты на место в файловых системах, лимиты на логи и отдельный контроль временных директорий. В инфраструктуре чаще падает не то, что самое сложное, а то, что забыли проверить.
Облачный Хостинг
@cloud_hosting_ru_n1k
Один из самых дорогих уроков в инфраструктуре мы получили не на апгрейде, а на мелочи.
Этот пост опубликован в Telegram-канале Облачный Хостинг. Подписаться можно по ссылке: @cloud_hosting_ru_n1k.