Один из самых дорогих провалов в инфраструктуре — не падение сервера, а тихая деградация, которую никто не заметил вовремя.
Однажды релиз прошёл «успешно»: Nginx отвечал, метрики были в норме, ошибок почти не было. Но один из upstream’ов начал отдавать ответы медленнее обычного. Таймауты не срабатывали, потому что порог поставили слишком мягкий. В итоге запросы не падали — они просто висели. Очереди росли, воркеры занимались ожиданием, а пользователи видели вечную загрузку ⏳
Разбор занял 20 минут. Исправление — 2 минуты. Причина оказалась банальной: невалидно настроенные таймауты и отсутствие алерта на рост latency по p95.
Вывод простой: сервер может быть «живым» и при этом уже терять деньги. Смотрите не только на up/down, но и на задержки, очереди и поведение upstream’ов под нагрузкой.
Nginx Советы
@nginx_sovety_ru_n1k
Один из самых дорогих провалов в инфраструктуре — не падение сервера, а тихая деградация, которую никто не зам
Этот пост опубликован в Telegram-канале Nginx Советы. Подписаться можно по ссылке: @nginx_sovety_ru_n1k.