95% инцидентов с доступностью можно увидеть заранее, если смотреть не только на аптайм, но и на метрики вокруг него.
Что важно держать в поле зрения на хостинге и серверах:
— p95/p99 latency, а не только среднее время ответа
— rate 5xx и 4xx по сервисам, а не общий счетчик
— saturation CPU, RAM, disk I/O и очереди на уровне 70–85%, а не после 100%
— объем TLS-handshake ошибок и рост renegotiation
— время DNS-ответа и долю таймаутов по резолверам
Практика показывает: если p99 растет на 20–30% в течение 10–15 минут, через короткое время часто следуют уже видимые сбои. 📈
Аптайм в 99,9% выглядит красиво, но это всего 43 минуты простоя в месяц. Для e-commerce этого достаточно, чтобы потерять трафик, заказы и доверие. Поэтому надежность — это не один процент, а набор сигналов, которые ловят деградацию до аварии.
SSL и HTTPS
@ssl_https_pro_n1k
95% инцидентов с доступностью можно увидеть заранее, если смотреть не только на аптайм, но и на метрики вокруг
Этот пост опубликован в Telegram-канале SSL и HTTPS. Подписаться можно по ссылке: @ssl_https_pro_n1k.