กรณีใช้งานสาย DevOps

โทรหาคนที่ใช่ทันทีเมื่อเซิร์ฟเวอร์ล่ม

อีเมลและการแจ้งเตือนแบบพุชธรรมดาพลาดง่ายเกินไปตอนหลับหรือตอนจดจ่อกับงาน Echobell เปลี่ยนอีเวนต์เซิร์ฟเวอร์ล่มให้เป็นสายโทรเข้าบน iPhone จะได้มีคนรู้ตัวทันทีที่ระบบล่ม

แนวคิดหลัก

เก็บสแตกมอนิเตอร์เดิมของคุณไว้ แล้วเปลี่ยนแค่ชั้นการส่ง Grafana, Prometheus, UptimeRobot, Upptime หรือบริการใดก็ตามที่ส่ง webhook ได้ สามารถป้อนข้อมูลเข้า Echobell แล้วยกระดับเฉพาะเหตุขัดข้องที่สมควรได้รับสายโทรจริง ๆ

แนวคิดหลัก
Grafana

สแตกที่แนะนำ

ทีมส่วนใหญ่ไม่ได้ต้องการเครื่องมือมอนิเตอร์ตัวใหม่ แต่ต้องการเส้นทางที่เร็วกว่าจากการตรวจพบเหตุขัดข้องไปสู่ความสนใจของคนจริง ๆ

Prometheus + Alertmanager

ส่งการแจ้งเตือนระดับรุนแรงเข้า webhook ของ Echobell และสงวนการแจ้งเตือนแบบโทรเข้าไว้ให้เหตุที่กระทบโปรดักชัน

Grafana Alerting

ใช้ contact point แบบ webhook ใส่บริบทของบริการและเมตริกไว้ใน payload แล้วส่งนโยบายระดับวิกฤตเข้าช่องที่เปิดการโทร

UptimeRobot หรือ Upptime

อัปเกรดการแจ้งเตือนเว็บล่มจากอีเมลหรือ webhook ให้เป็นสายโทรเข้าด่วนบน iPhone เมื่อ endpoint สาธารณะใช้งานไม่ได้

วิธีตั้งค่าแจ้งเตือนเซิร์ฟเวอร์ล่มด้วยสายโทรเข้า

การตั้งค่าตรงไปตรงมา มีแค่หนึ่งช่อง หนึ่ง webhook และหนึ่งกฎการยกระดับ

  1. 1

    สร้างช่องเฉพาะสำหรับเหตุขัดข้อง

    ใช้ช่องแยกสำหรับเหตุขัดข้องบนโปรดักชัน ประเภทการแจ้งเตือน เทมเพลต และผู้ติดตามจะได้โฟกัสอยู่กับงานเวร on-call

  2. 2

    เชื่อมเครื่องมือมอนิเตอร์ของคุณ

    ส่ง payload จาก Grafana, Prometheus, UptimeRobot, Upptime หรือ webhook ทั่วไปเข้ามาที่ช่อง พร้อมชื่อบริการ ระดับความรุนแรง และลิงก์ของเหตุขัดข้อง

  3. 3

    ใช้การโทรเฉพาะกับเงื่อนไขที่ควรโทรจริง

    จับคู่การส่งแบบโทรเข้ากับเงื่อนไขตามระดับความรุนแรง เฉพาะเหตุล่มจริงเท่านั้นที่จะทำให้เครื่องดัง ส่วนคำเตือนยังเป็นการแจ้งเตือนแบบมาตรฐานหรือแบบสำคัญตามเวลา

  4. เสร็จแล้ว!

ทำไมสายโทรเข้าได้ผลกว่าการส่งพุชอีกครั้ง

มันเจาะผ่านการนอนหลับและโหมดโฟกัส

เรื่องนี้สำคัญมากเมื่อเซิร์ฟเวอร์ล่มตอนตีสาม หรือระหว่างช่วงเปิดตัวที่เดิมพันสูง

มันสร้างสัญญาณเวร on-call ที่สะอาดกว่า

เมื่อมีเพียงเหตุขัดข้องระดับรุนแรงที่สุดที่โทรออก ทีมจะรู้ทันทีว่าอีเวนต์นี้ต้องรีบดูตอนนี้ ไม่ใช่ไว้ทีหลัง

มันรักษาเครื่องมือเดิมของคุณไว้

คุณไม่ต้องรื้อ Grafana, Alertmanager หรือเครื่องมือเช็ก uptime ออก แค่ทำให้ช่วงสุดท้ายของการส่งดีขึ้นเท่านั้น

คำถามที่พบบ่อยเรื่องแจ้งเตือนเซิร์ฟเวอร์ล่ม

คำถามที่พบบ่อยเกี่ยวกับการส่งเหตุขัดข้องจากระบบมอนิเตอร์และ uptime ไปเป็นสายโทรเข้า

ได้ Echobell ทำงานได้ดีที่สุดเมื่อมีเพียงเงื่อนไขเหตุล่มระดับรุนแรงที่สุดที่ยกระดับเป็นสายโทรเข้า ส่วนคำเตือนและอีเวนต์เชิงข้อมูลยังอยู่ในระดับความเร่งด่วนที่ต่ำกว่า

Grafana, Prometheus Alertmanager, UptimeRobot, Upptime, Uptime Kuma, GitHub Actions และทุกระบบที่ส่ง webhook หรืออีเมลได้ ล้วนป้อนเข้าเวิร์กโฟลว์เดียวกันนี้ได้

ได้ แชร์การติดตามช่องให้ทีมของคุณ ผู้รับผิดชอบหลายคนจะได้รับบริบทของเหตุขัดข้องโดยไม่ต้องสร้างการเชื่อมต่อแยกรายคน

เปลี่ยนเหตุล่มครั้งหน้าให้เป็นสายโทรเข้า แทนพุชที่จมหายไป

ดาวน์โหลด Echobell แล้วทดสอบเวิร์กโฟลว์เหตุขัดข้องบนโปรดักชันหนึ่งชุดกับเครื่องมือมอนิเตอร์ที่คุณใช้อยู่