Один из самых неприятных инцидентов у нас начался с, казалось бы, обычной жалобы: «сайт иногда подвисает по вечерам». Логи были чистые, CPU в норме, диск не забит. Но при этом часть запросов уходила в таймаут.
Проблема оказалась не в самом сервере, а в соседнем сервисе в том же кластере. Он периодически съедал весь пул соединений к базе, и фронтенд просто ждал ответ. На графиках это выглядело как «плавающая нагрузка», хотя по сути это была нехватка ресурсов на уровне архитектуры. 🔧
После разделения пулов, лимитов и вынесения критичных сервисов на отдельные узлы таймауты исчезли. Вывод простой: если симптом выглядит как проблема хостинга, не спешите винить железо. В инфраструктуре чаще ломается не то, что громче шумит, а то, что тихо делит ресурсы с соседями.
Безопасность Серверов
@server_security_ru_n1k
Один из самых неприятных инцидентов у нас начался с, казалось бы, обычной жалобы: «сайт иногда подвисает по ве
Этот пост опубликован в Telegram-канале Безопасность Серверов. Подписаться можно по ссылке: @server_security_ru_n1k.