دستیار ارتباطات قطعی و حادثه
یک بررسی ناموفق، پیش از سیل تیکت پشتیبانی، به بهروزرسانی صفحه وضعیت و اطلاع به مشتری تبدیل میشود.
زیر نظر دارد
بررسیهای آنلاینبودن نقاط کلیدی سرویس شما
انجام میدهد
هنگام تکرار خطا، صفحه وضعیت را بهروز میکند و خودکار به مشتریان تحتتأثیر اطلاع میدهد
کِی اول از یک انسان میپرسد
شدت ۲ یا بالاتر فوراً کانال آمادهباش شما را پیج میکند — دستیار ارتباطات را مدیریت میکند، هرگز خود رفع قطعی زیرساخت را انجام نمیدهد. سرویسی که بهطور مکرر نوسان میکند — در یک بازه کوتاه چند بار سالم و دوباره قطع میشود — بهعنوان یک حادثه واحد و ادامهدار تشدید میشود، نه پیج تازه در هر نوسان، تا کانال آمادهباش با هشدارهای تکراری برای یک مشکل واحد غرق نشود.
چطور کار میکند
- 1نقاط پایانی را بررسی میکند
بررسیهای سلامت پیوسته روی آدرسها و سرویسهایی که مشخص میکنید اجرا میکند. این بررسیها بهطور پیشفرض از چند منطقه جغرافیایی مختلف اجرا میشوند، پس یک مشکل مسیریابی محلی در یک شبکه، هرگز با از کار افتادن واقعی سرویس شما در همهجا اشتباه گرفته نمیشود.
- 2پیش از هشدار تأیید میکند
منتظر N بار شکست متوالی (سقف شما) میماند پیش از آنکه یک نوسان را حادثه بداند — بدون خستگی از هشدار برای یک بررسی تک. این سقف به تفکیک هر نقطه پایانی قابلتنظیم است، نه یک عدد ثابت سراسری، پس یک API پرداخت که میخواهید از شکست دوم علامت بخورد، میتواند کنار یک صفحه تبلیغاتی باشد که به آن پنج فرصت میدهید.
- 3صفحه وضعیت را بهروز میکند
یک ورودی حادثه خودکار در صفحه وضعیت عمومی شما ثبت میکند تا مشتریان پیش از پرسیدن ببینند. این ورودی فقط همان بخش تحتتأثیر را نام میبرد — پرداخت، API، داشبورد — هرگز یک «سیستمها از کار افتاده» کلی که یک قطعی جزئی را بزرگتر از واقعیتش نشان دهد.
- 4مشتریان تحتتأثیر را باخبر میکند
اطلاعیه را به حسابهایی که از سرویس تحتتأثیر استفاده میکنند میفرستد، نه پیامی همگانی به همه مشتریان. بررسی میکند کدام حسابها واقعاً در بازه اخیر از همان بخش تحتتأثیر استفاده کردهاند، پس مشتریای که هرگز از آن ویژگی خاص استفاده نمیکند، اطلاعیه نگرانکنندهای درباره قطعی نامربوط دریافت نمیکند.
- 5حلقه را میبندد
وقتی بررسی دوباره سالم شود، یک بهروزرسانی حل و خلاصه مدت قطعی ثبت میکند — خود رفع مشکل همچنان با شماست. بازگشت به حالت سالم باید چند بررسی متوالی تمیز را پشت سر بگذارد پیش از اینکه پیام رفعشدن ثبت شود، پس سرویسی که سی ثانیه برمیگردد و دوباره قطع میشود، بهاشتباه حلشده علامت نمیخورد.
چه چیزی آن را فعال میکند
- · یک بررسی روی نقطه پایانی زیر نظر یکبار شکست میخورد
- · یک بررسی به تعداد N بار متوالی فراتر از سقف شما شکست میخورد
- · یک نقطه پایانی ناموفق دوباره بازمیگردد
- · یک حادثه از سطح شدت تعریفشده شما عبور میکند
چه چیزی دریافت میکنید
- · بهروزرسانی صفحه وضعیت، خودکار در شروع و پایان حادثه
- · اطلاعیه به مشتریان تحتتأثیر
- · هشدار داخلی به کانال آمادهباش شما (Slack/تلگرام)
- · خلاصه پس از حادثه با مدت زمان قطعی
مناسب شما نیست اگر
برای سایتهای تبلیغاتی استاتیک بدون سرویس حساس به آنلاینبودن مناسب نیست — چیزی اینجا ارزش یک صفحه وضعیت را ندارد. برای تیمی هم که از قبل یک مجموعه مدیریت حادثه اختصاصی (PagerDuty، Statuspage، چرخه آمادهباش SRE) دارد گزینه درستی نیست — این دستیار برای تیمی ساخته شده که هنوز چنین حلقهای ندارد و قرار است کل آن حلقه سبک را خودش تشکیل دهد، نه اینکه کنار یک سیستم تشدید از قبل موجود اضافه شود.
محاسبه
با حدود ۴ حادثه در ماه × ۲۰ دقیقه، این یعنی تقریباً ۱٫۳ ساعت در ماه — برآورد است، نه تضمین.
سوالات متداول
نه — تشخیص و ارتباطات را مدیریت میکند. رفع مشکل واقعی همچنان با کسی در تیم شماست.
بهاندازهای که هنگام راهاندازی فهرست کنید — قیمت با تعداد نقاط رصدشده و بازه بررسی متناسب است.
بله — هشدار داخلی و ارتباط با مشتری میتوانند همزمان به کانالهای مختلف بروند.
شما آستانهها را هنگام راهاندازی تعریف میکنید — معمولاً یک سرویس اصلی از کار افتاده در برابر یک سرویس کندشده اما فعال.
بله — یک سقف زمان پاسخ در کنار بررسی موفق/ناموفق اجرا میشود، پس صفحهای که بار میشود اما بهجای یک ثانیه، ده ثانیه طول میکشد، همچنان یک حادثه افت عملکرد را فعال میکند، نه فقط یک قطعی کامل.
آمادهاید دستیار ارتباطات قطعی و حادثه را به کار بگیرید؟
درباره زیرساخت فعلی خود بگویید، ظرف ۴۸ ساعت تأیید میکنیم که مناسب است.