Резервные Копии
Резервные Копии
@backup_strategy_ru_n1k

Один из самых неприятных инцидентов в проде у меня был не из-за железа, а из-за «почти нормальной» конфигураци

Один из самых неприятных инцидентов в проде у меня был не из-за железа, а из-за «почти нормальной» конфигурации.

Сервер жил на SSD, метрики выглядели спокойно, но ночью начали расти задержки. Сначала подозревали нагрузку, потом сеть, потом сам диск. А причина оказалась банальной: логирование без ротации съело почти весь свободный объём, и файловая система ушла в режим постоянной борьбы за место. Внешне всё ещё «работало», но любой всплеск превращался в очередь и таймауты.

Что помогло:
— жёсткий мониторинг не только CPU/RAM, но и свободного места, inode и latency;
— алерты не по факту падения, а по ранним признакам деградации;
— автоматическая ротация логов и лимиты на их размер;
— резерв свободного пространства под форс-мажор.

Вывод простой: в инфраструктуре чаще ломается не что-то большое, а то, что долго считали мелочью.
Этот пост опубликован в Telegram-канале Резервные Копии. Подписаться можно по ссылке: @backup_strategy_ru_n1k.
tech

Свежие посты в категории «Tech Infrastructure»

Все каналы категории →

start

Готовы запустить рекламу через сеть public.tg?

Новый оффер, продукт, GEO, кейс, событие или партнёрский запуск — соберём маршрут под задачу и отдадим медиаплан.

Telegram для медиаплана: @AFFtop_connect. Быстрый тест: $20 за канал, $1000 за пакет по сети.