95% проблем с веб-хостингом не выглядят как «падение сервера» — чаще это медленные ответы, ошибки TLS и всплески по I/O, которые съедают запас по SLA задолго до полного отказа.
Что стоит держать на панели каждый день:
— p95/p99 latency, а не только среднее: среднее может быть 120 мс, а p99 — уже 2,4 c.
— uptime по сервисам, а не по ноде: 99,9% в месяц — это до 43 минут простоя.
— CPU steal и iowait: на виртуалках они часто важнее загрузки CPU.
— объём 5xx/4xx: рост 5xx на 1–2% уже заметен пользователю, а 4xx часто сигналит о проблеме на стыке приложения и CDN.
Если метрики не собираются в единый ряд, инфраструктура выглядит «здоровой» ровно до первого пика нагрузки. А потом оказывается, что узкое место было видно ещё вчера 📈
SSL и HTTPS
@ssl_https_pro_n1k
95% проблем с веб-хостингом не выглядят как «падение сервера» — чаще это медленные ответы, ошибки TLS и всплес
Этот пост опубликован в Telegram-канале SSL и HTTPS. Подписаться можно по ссылке: @ssl_https_pro_n1k.