Nhiệm vụ: Nghiên cứu và bổ sung tính năng theo dõi hoạt động và hiệu suất của trang web

Nghiên cứu và bổ sung tính năng theo dõi hoạt động và hiệu suất của trang web

03.10.2026haih.site

Lựa chọn và triển khai hệ thống theo dõi trang web nhẹ không dùng Sentry: nhật ký (logs), số liệu (metrics), bảng điều khiển (dashboards) và cảnh báo cơ bản.

Mục tiêu

Bổ sung hệ thống quan sát (observability) trọng lượng nhẹ cho trang web, giúp nhanh chóng nắm bắt:

  • trang web và các dịch vụ cốt lõi có đang hoạt động không;
  • lỗi phát sinh ở đâu;
  • hiệu suất thay đổi như thế nào;
  • có sự suy giảm về thời gian phản hồi, tải hoặc tài nguyên hay không.

Hạn chế và ưu tiên

  • Không sử dụng Sentry làm công cụ chính.
  • Tránh hạ tầng cồng kềnh và dư thừa.
  • Ưu tiên các giải pháp đơn giản, dễ hiểu và chi phí thấp / tự lưu trữ (self-hosted).
  • Xem xét stack ở mức nhật ký có cấu trúc + Prometheus + Grafana và các giải pháp thay thế nhẹ hơn nếu chúng giải quyết bài toán đơn giản hơn.

Những việc cần nghiên cứu

  1. Xác định tập hợp quan sát tối thiểu cho kiến trúc trang web hiện tại.
  2. Cấu hình việc thu tập nhật ký tập trung và giao diện xem thuận tiện cho ứng dụng/máy chủ web.
  3. Thêm các số liệu ít nhất về:
    • tính khả dụng;
    • trạng thái HTTP / tỷ lệ lỗi;
    • độ trễ / thời gian phản hồi;
    • tần suất yêu cầu (request rate);
    • CPU, RAM, ổ đĩa và các tài nguyên quan trọng khác của máy chủ/container, nếu có.
  4. Thêm các số liệu ứng dụng cho các thao tác quan trọng của trang web khi cần thiết.
  5. Xây dựng bảng điều khiển gọn nhẹ về trạng thái và hiệu suất.
  6. Thêm các cảnh báo cơ bản cho các trạng thái sự cố rõ ràng và tình trạng suy giảm đáng kể.
  7. Kiểm tra ảnh hưởng của chính hệ thống giám sát đối với tài nguyên và tránh làm cho việc vận hành trở nên phức tạp một cách bất hợp lý.

Các ứng viên

Phương án cơ bản để đánh giá:

  • nhật ký ứng dụng / máy chủ web có cấu trúc;
  • Prometheus;
  • exporters / ứng dụng có endpoint /metrics;
  • Grafana;
  • backend nhẹ cho nhật ký nếu cần thiết (ví dụ Loki hoặc tương tự), miễn là có căn cứ hợp lý.

Cho phép chọn stack đơn giản hơn nếu nó đảm bảo khả năng chẩn đoán đầy đủ và chi phí vận hành thấp hơn.

Kết quả

  • đã chọn và đưa ra lý do cho stack giám sát tối thiểu;
  • hệ thống giám sát đã được triển khai và kết nối với trang web;
  • có sẵn nhật ký và các số liệu cơ bản;
  • có bảng điều khiển với các chỉ số chính;
  • đã cấu hình các cảnh báo tối thiểu cần thiết;
  • có tài liệu hướng dẫn nơi xem trạng thái hệ thống và cách chẩn đoán các sự cố thông thường.