У хорошего сервера есть три любимые цифры: latency, error rate и p95. Именно они быстрее всего показывают, что с хостингом что-то не так, пока пользователи ещё молчат.
Если p95 ответа вырос с 120 до 350 мс — это уже не «слегка нагрузило», а сигнал проверить кэш, БД и лимиты воркеров. Если error rate держится выше 0,5% хотя бы 5–10 минут, проблема почти всегда не случайная. А рост CPU до 90% сам по себе не страшен, если параллельно не растут очереди и время ответа.
Практика простая: не смотрите только на среднее. Среднее отлично маскирует боль. Смотрите на p95/p99, RPS, очередь соединений и saturation по диску. 📈
На сервере важно не «много ресурсов», а запас по ключевым метрикам. Когда запас уходит в ноль, инцидент уже идёт, просто вы ещё не получили алерт.
Nginx Советы
@nginx_sovety_ru_n1k
У хорошего сервера есть три любимые цифры: latency, error rate и p95. Именно они быстрее всего показывают, что
Этот пост опубликован в Telegram-канале Nginx Советы. Подписаться можно по ссылке: @nginx_sovety_ru_n1k.