Безопасность Серверов

Один из самых неприятных инцидентов в моей практике случился не из-за взлома, а из-за «тихой» ошибки в инфраст

Один из самых неприятных инцидентов в моей практике случился не из-за взлома, а из-за «тихой» ошибки в инфраструктуре. После планового обновления один из серверов начал периодически терять соединение с дисковым массивом. В логах — почти тишина, нагрузка — в норме, алерты не срабатывают. Казалось, проблема мимолётная, но именно такие сбои чаще всего и приводят к простоям.

Разобрались только после сравнения метрик за несколько часов: оказалось, что контроллер RAID уходил в деградацию на пике I/O, а мониторинг смотрел лишь на состояние сервиса, не на задержки и ошибки чтения. Исправили схему наблюдения, добавили отдельные алерты по latency и SMART-показателям, а потом перенесли критичные данные на более надёжный контур 🔧

Вывод простой: стабильность сервера — это не только «жив/не жив». Настоящие проблемы часто начинаются там, где метрики выглядят спокойно.
Этот пост опубликован в Telegram-канале Безопасность Серверов. Подписаться можно по ссылке: @server_security_ru_n1k.
tech

Свежие посты в категории «Tech Infrastructure»

Все каналы категории →

start

Готовы запустить рекламу через сеть public.tg?

Новый оффер, продукт, GEO, кейс, событие или партнёрский запуск — соберём маршрут под задачу и отдадим медиаплан.

Telegram для медиаплана: @AFFtop_connect. Быстрый тест: $20 за канал, $1000 за пакет по сети.