Однажды у нас «упал» не сервер, а уверенность в бэкапе. Ночь, рост трафика, всё выглядит штатно: nginx отдаёт страницы, upstream жив, ошибок почти нет. А потом — жалобы на пустые ответы и странные таймауты. Оказалось, проблема была не в приложении, а в том, как был настроен баланс: один из узлов тихо деградировал, а health-check был слишком мягким, чтобы это заметить вовремя 😬
Урок оказался неприятным, но полезным: в инфраструктуре опаснее всего не яркий отказ, а медленное ухудшение. Если мониторинг смотрит только на «up/down», он пропустит половину бед. Смотрите на latency, 5xx, очереди, saturation дисков и CPU, а ещё — проверяйте путь пользователя, а не только состояние хоста.
Хороший серверный стек держится не на надежде, а на наблюдаемости. И именно она чаще спасает прод, чем любой «почти рабочий» конфиг.
Nginx Советы
@nginx_sovety_ru_n1k
Однажды у нас «упал» не сервер, а уверенность в бэкапе. Ночь, рост трафика, всё выглядит штатно: nginx отдаёт
Этот пост опубликован в Telegram-канале Nginx Советы. Подписаться можно по ссылке: @nginx_sovety_ru_n1k.