Один из самых показательных инцидентов на хостинге у нас случился не из-за пикового трафика, а из-за «тихой» деградации диска. Снаружи всё выглядело нормально: Nginx отвечал, CPU был в порядке, нагрузка умеренная. Но часть запросов начала уходить в таймауты, а логи показали странную задержку на запись временных файлов.
Проблема оказалась в том, что диск ещё не падал, но уже заметно проседал по IOPS. В таких случаях классический мониторинг по CPU почти бесполезен. Спасли метрики по latency диска, очередь iowait и отдельный алерт на рост времени ответа Nginx. После переноса temp/cache на более быстрый том и ограничения размера буферов система стабилизировалась.
Вывод простой: в инфраструктуре чаще ломается не «всё сразу», а один узкий участок, который долго маскируется под обычную работу. И чем раньше вы видите не только загрузку, но и задержки, тем дешевле обходится инцидент ⚙️
Nginx Советы
@nginx_sovety_ru_n1k
Один из самых показательных инцидентов на хостинге у нас случился не из-за пикового трафика, а из-за «тихой» д
Этот пост опубликован в Telegram-канале Nginx Советы. Подписаться можно по ссылке: @nginx_sovety_ru_n1k.