Tình huống cho DevOps

Máy chủ sập thì gọi thẳng cho đúng người

Email và push thông thường quá dễ bị bỏ lỡ khi bạn đang ngủ hoặc tập trung sâu. Echobell biến sự kiện máy chủ sập thành cảnh báo bằng cuộc gọi tới iPhone, để có người nhận ra sự cố ngay lập tức.

Ý tưởng cốt lõi

Giữ nguyên hệ thống giám sát hiện có. Chỉ đổi lớp gửi thông báo. Grafana, Prometheus, UptimeRobot, Upptime hay bất kỳ dịch vụ nào gửi được webhook đều có thể đẩy dữ liệu vào Echobell và chỉ leo thang những sự cố xứng đáng với một cuộc gọi thật.

Ý tưởng cốt lõi
Grafana

Bộ công cụ gợi ý

Phần lớn các nhóm không cần thêm một sản phẩm giám sát mới. Họ cần con đường ngắn hơn từ lúc phát hiện sự cố tới lúc có người để mắt tới.

Prometheus + Alertmanager

Đưa các cảnh báo mức nghiêm trọng cao vào webhook của Echobell và chỉ dành cảnh báo cuộc gọi cho sự cố ảnh hưởng tới production.

Grafana Alerting

Dùng contact point dạng webhook, đưa ngữ cảnh dịch vụ và chỉ số vào payload, rồi gửi các chính sách nguy cấp tới một kênh đã bật cuộc gọi.

UptimeRobot hoặc Upptime

Nâng thông báo website sập đơn giản từ email hay webhook thành cảnh báo cuộc gọi khẩn tới iPhone khi một endpoint công khai không truy cập được.

Cách thiết lập cảnh báo cuộc gọi khi máy chủ sập

Việc thiết lập rất đơn giản: một kênh, một webhook và một quy tắc leo thang.

  1. 1

    Tạo một kênh riêng cho sự cố

    Dùng kênh riêng cho sự cố production, để loại thông báo, mẫu nội dung và danh sách đăng ký đều tập trung vào luồng trực on-call.

  2. 2

    Kết nối công cụ giám sát của bạn

    Gửi payload từ Grafana, Prometheus, UptimeRobot, Upptime hoặc một webhook thông thường vào kênh, kèm tên dịch vụ, mức nghiêm trọng và liên kết tới sự cố.

  3. 3

    Chỉ dùng cuộc gọi cho đúng điều kiện

    Kết hợp chế độ cuộc gọi với điều kiện theo mức nghiêm trọng, để chỉ sự cố thật mới làm điện thoại đổ chuông, còn cảnh báo mức thấp vẫn ở dạng thông thường hoặc khẩn cấp.

  4. Xong!

Vì sao cảnh báo cuộc gọi hiệu quả hơn thêm một push

Chúng xuyên qua giấc ngủ và chế độ Tập trung

Điều đó rất quan trọng khi máy chủ hỏng lúc 3 giờ sáng hoặc ngay trong khung giờ ra mắt hệ trọng.

Chúng tạo tín hiệu trực on-call rõ ràng hơn

Khi chỉ những sự cố nghiêm trọng nhất mới kích hoạt cuộc gọi, cả nhóm biết ngay rằng sự kiện này cần xử lý bây giờ, không phải để sau.

Chúng giữ nguyên bộ công cụ hiện có

Bạn không phải bỏ Grafana, Alertmanager hay các công cụ theo dõi uptime. Bạn chỉ cải thiện chặng cuối của việc gửi cảnh báo.

Câu hỏi thường gặp về cảnh báo máy chủ sập

Những câu hỏi thường gặp khi đưa sự cố uptime và giám sát thành cảnh báo bằng cuộc gọi.

Có. Echobell phát huy tốt nhất khi chỉ những điều kiện sự cố nghiêm trọng nhất mới leo thang thành cuộc gọi, còn cảnh báo và sự kiện mang tính thông tin thì giữ ở mức khẩn thấp hơn.

Grafana, Prometheus Alertmanager, UptimeRobot, Upptime, Uptime Kuma, GitHub Actions và bất kỳ hệ thống nào gửi được webhook hoặc email đều có thể dùng chung quy trình này.

Có. Hãy chia sẻ đăng ký kênh với cả nhóm, để nhiều người ứng cứu cùng nhận được ngữ cảnh sự cố mà không phải dựng tích hợp riêng cho từng người.

Biến sự cố tiếp theo thành một cuộc gọi, thay vì một push bị vùi lấp

Tải Echobell và thử một luồng sự cố production với công cụ giám sát bạn đang dùng.