Сервер упал, а Telegram молчит? Значит, мониторинг настроен для галочки
Для доступности нужен не «пинг раз в минуту», а цепочка проверок: ICMP для сети, TCP-порт для сервиса, HTTP-ответ для приложения. Если проверять только ping, можно не заметить, что веб уже мёртв, а SSH ещё жив. Для критичных узлов ставьте разные таймауты и 2–3 попытки подряд, иначе получите ложные срабатывания на кратких сетевых сбоях.
Алерт в Telegram должен приходить только после подтверждения проблемы. Схема простая: статус меняется на down, через 30–60 секунд повторная проверка, затем уведомление. Для восстановления тоже нужен отдельный alert, иначе оператор видит только падения и не понимает, когда инцидент закрыт. Сообщение делайте коротким: хост, сервис, время начала, код ошибки, ссылка на график. 📈
Не сваливайте все уведомления в один чат. Разделяйте prod, staging и системные события. Для Telegram-бота ограничьте права, храните токен вне репозитория и проверяйте исходящий трафик через firewall. Если серверов много, полезно делать дедупликацию: один инцидент = одно сообщение, а не спам каждые 10 секунд.
Отдельно следите за местом на диске, нагрузкой и ответом приложения. Доступность — это не только «жив/мертв», а способность сервера выполнять свою задачу. Стабильность — это отсутствие магии, только предсказуемая конфигурация.
Настройка серверов для маркетинга
@server_setup_guide_arb
Сервер упал, а Telegram молчит? Значит, мониторинг настроен для галочки
Этот пост опубликован в Telegram-канале Настройка серверов для маркетинга. Подписаться можно по ссылке: @server_setup_guide_arb.