Задача: Проработать и добавить мониторинг работы и производительности сайта
Проработать и добавить мониторинг работы и производительности сайта
03.10.2026haih.site
Подобрать и внедрить лёгковесный мониторинг сайта без Sentry: логи, метрики, дашборды и базовые алерты.
Цель
Добавить для сайта лёгковесную систему наблюдаемости, которая позволит быстро понимать:
- работает ли сайт и его ключевые сервисы;
- где возникают ошибки;
- как меняется производительность;
- есть ли деградация по времени ответа, нагрузке или ресурсам.
Ограничения и предпочтения
- Не использовать Sentry как основной инструмент.
- Избегать тяжёлой и избыточной инфраструктуры.
- Предпочтение простым, понятным и недорогим/self-hosted решениям.
- Рассмотреть стек уровня структурированные логи + Prometheus + Grafana и более лёгкие альтернативы, если они закроют задачу проще.
Что проработать
- Определить минимальный набор наблюдаемости для текущей архитектуры сайта.
- Настроить централизованный сбор и удобный просмотр логов приложения/веб-сервера.
- Добавить метрики как минимум по:
- доступности;
- HTTP status / доле ошибок;
- latency / времени ответа;
- request rate;
- CPU, RAM, disk и другим важным ресурсам хоста/контейнеров, если применимо.
- При необходимости добавить прикладные метрики для критичных операций сайта.
- Собрать компактный дашборд состояния и производительности.
- Добавить базовые алерты на явно аварийные состояния и заметную деградацию.
- Проверить влияние самого мониторинга на ресурсы и не допустить неоправданного усложнения эксплуатации.
Кандидаты
Базовый вариант для оценки:
- структурированные логи приложения/web server;
- Prometheus;
- exporters / приложение с
/metrics; - Grafana;
- при необходимости лёгкий backend для логов (например Loki или аналог), только если оправдан.
Допускается выбрать более простой стек, если он обеспечивает достаточную диагностируемость и меньшие эксплуатационные расходы.
Результат
- выбран и обоснован минимальный стек мониторинга;
- мониторинг развёрнут и подключён к сайту;
- доступны логи и основные метрики;
- есть дашборд с ключевыми показателями;
- настроены минимально необходимые алерты;
- описано, где смотреть состояние системы и как диагностировать типовые проблемы.