Table of Contents

محیط های مدرن IT هشدارهایی را در هر لایه ایجاد می کنند – از فایروال های شبکه و ورودی های سرور گرفته تا مانیتور های عملکردی و سیستم عامل های SIEM بدون یک روال عمدی، تیم ها به سرعت غرق می شوند، سیگنال های بحرانی از دست می روند و واکنش های مکرر برای سه گانه، بررسی و پاسخ به هشدار به تبدیل صدا در هوش عملی، باعث کاهش زمان تشخیص (MTD1)، عدم اطمینان از طریق یک چارچوب ثابت و سازگاری می شود.

اجزای اصلی مدیریت هشدار موثر Routine

هشدار به Triage و Categorization

اولین گام این است که هشدارهای ورودی را با شدت، منبع و تاثیر بالقوه طبقه بندی کنیم.یک طرح عملی از سه یا چهار لایه استفاده می کند:

  • [P1) [FLT 1 ] - سیستم پایین، نفوذ امنیتی، زیان داده ها نیاز به پاسخ فوری و 24/7 دارد.
  • بالا (P2) - عملکرد رتبه بندی شده، چندین کاربر تحت تاثیر، شاخص های بالقوه نفوذ پاسخ در عرض 15 تا 30 دقیقه.
  • [P3] - مسئله کاربری واحد، هشدار غیر بحرانی، آستانه ظرفیت عبور می کند.
  • (P4) - اطلاع رسانی، لوازم آرایشی و یا اعلان های تعمیر و نگهداری برنامه ریزی شده در طول روز.

به عنوان مثال، تایپ کردن خودکار به همان اندازه که ممکن است با استفاده از قوانین همبستگی، تغذیه های اطلاعاتی تهدید و مدل های یادگیری ماشین که از تصمیمات گذشته یاد می گیرند، امکان پذیر است، به عنوان مثال، سیستم هشدار دهنده خود را با یک سیستم تشخیص (FLT:0) پیکربندی سریع تر - بنابراین غنی سازی موقعیت و هشدار دقیق تر - در حالی که سرکوب سر و صدای شناخته شده، ادغام می کند.

تعریف یک کادر نقد

یک فرکانس مرور را انتخاب کنید که با پروفایل ریسک محیط شما مطابقت دارد. عملیات سرعت بالا (تجارت، تجارت مالی) ممکن است نیاز به نظارت مداوم با یک بررسی ثانویه در هر ساعت داشته باشد. محیط های بحرانی کمتر می توانند با یک چرخه بررسی سه بار با دقت 1 سازگاری کار کنند: ایجاد بلوک تقویم، اجرا چرخش، و هرگز یک جلسه بررسی مشترک (شکل مستقیم) را لغو کنند که همه تغییرات ذخیره شده توسط یک تیم تجزیه و تحلیل منظم 1 را مشخص می کند.

پروتکل های پاسخ و Runbooks

دقیقاً چه کاری برای هر دسته از هشدارها انجام دهید.یک دفترچه باید شامل موارد زیر باشد:

  • گام های سه گانه [FLT 1] - بررسی هشدار مثبت کاذب نیست، بررسی log های مرتبط، تایید کاربران و یا سیستم های تحت تاثیر قرار دارد.
  • مسیر هدایت - چه کسی باید در صورت خروج از محدوده مهندس تماس بگیرد.
  • [در این باره]: [۱] اعمال کاهش یافته [[۱۰] [۱۰] [۱]] - کارهای فوری یا مراحل مهار کننده [۱]
  • [در این باره]، [و] [و] [و [از این رو] تأیید می کند که چگونه مسئله را به طور کامل حل و فصل و نظارت بهبود یابد.
  • [در این باره] [و] [[[۱]]] [۱]] [۱]] [۱]] [۱]] [۱] [۱]] [۱]] [۱] [۱]] [۱]] [۱]] [۱] [۱]] [۱]] [۱] [۱]] [۱] [۱] [۱] [۱]] [۱] [۱] [۵] [۱] [۵] [۱] [۵] [۵] [۱] [۱] [۱] [۱] [۱] [۵] [۵] [۱] [۱] [۱] [۱] [۱] [۱]]] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱]]] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱

کتاب های اجرا در یک پایگاه دانش مبتنی بر ویکی یا Directus به طوری که آنها همچنان نسخه کنترل شده و آسان به روز رسانی هستند، برای الهام، اطلسsian را ببینید (FLT:0guide برای اجرای بهترین شیوه های کتاب [FLT 1].در نظر بگیرید از جمله تصاویر، اسنیپت ها، و نمونه های خروجی انتظار می رود برای کاهش ابهام در طول حوادث فشار بالا.

استراتژی های اتوماسیون برای کاهش بار شناختی

هشدار هوشمند

بسیاری از هشدارها نشانه هایی از همان موتورهای ریشه هستند (به عنوان مثال، OpsGenie، PagerDuty یا رویدادهای گروه باز منبع جریانAlert) مربوط به یک حادثه واحد است.این مانع از هشدار هشدار هشدار های هشدار دهنده و پاسخ دهندگان می شود که به جای ده ها اعلان، پنجره های همبستگی که الگوهای شکست معمولی شما مطابقت دارند، به عنوان مثال، 5 بالاخصوصی برای استفاده از یک ساعت، هشدار داده های پیام رسانی های پیام رسانی به طور تدریجی (به عنوان مثال، به طور خودکار، به طور خودکار، هشدار داده های پیام رسانی های پیام رسانی های پیام رسانی های پیام رسانی های پیام رسانی های پیام رسانی به طور خودکار، به طور خودکار، به طور خودکار، به طور خودکار، به طور خودکار، به طور خودکار، به طور خودکار، به طور خودکار، به طور خودکار، به یک فایل های پیام رسانی های هشدار داده شده، به طور خودکار، به طور خودکار، به طور خودکار، به یک پیام رسانی های پیام رسانی های پیام رسانی های پیام رسانی های پیام رسانی های پیام رسانی های پیام رسانی های پیام رسانی های پیام رسانی های پیام رسانی های هشدار داده ها، به یک پیام رسانی های پیام رسانی های هشدار داده شده در یک پیام رسانی های پیام رسانی های پیام رسانی های پیام رسانی های پیام رسانی های هشدار

خودکارسازی و خود-Healing

برای کمترین میزان، هشدار تکراری، نوشتن اسکریپت های پاسخ خودکار.اگر یک آتش هشدار استفاده از دیسک، یک کار cron می تواند log های قدیمی را تمیز کند، اگر یک سرویس بدون پاسخ باشد، یک ارکستر کانتینر می تواند آن را دوباره راه اندازی کند، این "کتاب خودکار" شامل کار دستی و جلوگیری از خطای انسانی است.

کاهش و کاهش نویز

خستگی هشدار یک تهدید واقعی است. پیاده روی در هر منبع برای جلوگیری از یک جزء شکست خورده از سیل صف است، به عنوان مثال، اگر یک سرور واحد 100 هشدار دیسک را در 10 دقیقه تولید کند، آنها را به یک هشدار واحد هشدار داده شده با یک شمارش واحد: به طور مشابه، از پنجره های تعمیر و نگهداری برای سرکوب هشدار های ماده در طول زمان برنامه ریزی شده به طور منظم یک "بدون حسابرسی" را اجرا می کند و بیش از نظارت بر کتاب (RE).

نقش های تیمی و قابلیت پاسخگویی

پنجره های On-Call

همیشه سلسله مراتب شتاب بخش داشته باشید: یک پاسخ دهنده اولیه که بلافاصله هشدار P1-P2 را کنترل می کند و یک ثانویه که اگر اولیه اشغال شده باشد یا اگر مسئله شامل چندین دامنه باشد، چرخش برنامه با اقدامات جغرافیایی پیگیری می شود، یا هر گونه برنامه جداگانه ای که ممکن است به اشتراک بگذارد، باید به طور خودکار برنامه ریزی کند و اطمینان حاصل کند که همیشه به یک تخصص کلامی کوچکتر (برای مثال، به طور خلاصه، در مورد استفاده از سیستم های جداگانه) دسترسی داشته باشد.

معرفی بازی The Alert Owner (Daily/Weekly)

یک شخص یا یک تیم کوچک را برای انجام بررسی روزانه برای اقلام P3 و P4 اختصاص دهید، این نقش همچنین backlog هشدار را حفظ می کند - افشای مثبت کاذب، به روز رسانی کتاب های اجرا و الگوهای ضعیف که نیاز به توجه مهندسی دارند، مالک بررسی باید 30 دقیقه در همان زمان، بررسی داشبورد، و تداخل متقابل با هر مجموع خودکار، علاوه بر این، به طور خلاصه، به طور خلاصه، بررسی کند.

بازبینی شده در ۶ اکتبر ۲۰۱۱. ↑ «PIR» Responsibilities

پس از هر حادثه مهم (P1 یا تکرار P2)، یک بررسی پس از شناسایی را ظرف 48 ساعت برنامه ریزی کنید. PIR باید شامل مهندس در تماس، صاحب بررسی و سهامدار از خدمات آسیب دیده باشد؛ هدف این است که مشخص کنید چرا هشدار، چگونه پاسخ آشکار شد، و چه تغییراتی در فرآیندهای یا بازگشت اتوماسیون می تواند از نوشتن یافته های ابزار به اشتراک گذاشته شده جلوگیری کند؛ به دلیل ردیابی موارد، و دستورالعمل های سیستم عامل، باید به عنوان یک سیستم عامل قبلی، به طور واضح و مشخص شده توسط PIR به عنوان یک سیستم عامل ردیابی شود.

شاخص های عملکرد کلیدی برای اندازه گیری اثربخشی

معیارهای پیگیری برای اطمینان از اینکه روال شما کار می کند و برای شناسایی تنگناها:

  • زمان تصدیق (MTTA) - چگونه سریع یک انسان را به هشدار می رساند. هدف زیر 5 دقیقه برای P1، کمتر از 15 برای P2 است.
  • زمان برای حل و فصل (MTTR) - از تأیید به حل و فصل معیارهای متفاوت توسط صنعت، اما کاهش مداوم نشان می دهد بهبود.
  • نرخ مثبت - درصد هشدارها به عنوان سر و صدا رد می شوند.
  • (فَلَّهُمْهُمْهُمْهُمِهُمِهُمِهُمِهُمِهُمِهُمِهُواِهُواِهُمِهُواِهُمِهُواِهُمِهُواِهُمِهُواِهُواِهُواِهُمِهُوا مِهُمِهُوا مِهُوا مِهُمِهُمِهُوا مِهُوا مِنِنِنِنِنِنِنِنِهُواِنِنِنِنِنِنِنِنِنِنِنِنِهُوا مِنَهُوا مِنِنِنِنِنِنِنِنِنِنِنِنِنِنِنِنِنَهُمِنِنِنِنِنِنِنِنِنِنِنِنَهُوا م
  • [FLT: 1] - درصد هشدارها که در آن کتاب اجرا (با استفاده از logs حسابرسی) دنبال شد.

تجسم این KPI ها در داشبورد هفتگی.اگر MTTA شروع به صعود کند، فرآیند تماس ممکن است نیاز به تنظیم داشته باشد.اگر مثبت کاذب بیش از 40٪ باشد، یک کارگاه تنظیمی را نگه دارید و همچنین تعداد هشدارها را در هر منبع ردیابی کنید؛ یک جهش ناگهانی از یک منبع اغلب نشان دهنده یک مانیتور پیکربندی نادرست یا یک مسئله تکراری است که نیاز به تعمیر دائمی دارد.

قرص های معمول و چگونگی جلوگیری از آن

دانلود بازی Over-Alerting on Every Anomaly

تنظیم آستانه ها نیز به شدت باعث ایجاد سر و صدا می شود که مسائل واقعی را به جای آن، از پایه های آماری استفاده می کند: هشدار فقط زمانی که انحراف بیش از دو یا سه انحراف استاندارد است.یک ابزار مانند پروتوپر با هشدار دهنده می تواند "کارشناسان برای عدم وجود داده" و "کار برای افزایش ناگهانی" به طور همزمان، هشدار در مورد نرخ تغییر (به عنوان مثال، افزایش نرخ خطا در 5 دقیقه به جای تنظیم عادی ترافیک عادی) و جلوگیری از آن را در نظر بگیرد.

دانلود بازی کوتاه The Weekly Hygiene Review

بسیاری از تیم ها قوی شروع می کنند، اما اجازه دهید که حسابرسی هفتگی جلوگیری از این، بررسی بهداشت را در یک رویداد تکراری (به عنوان مثال، ایستاده تیم دوشنبه صبح) بلاک 30 دقیقه برای بررسی هشدار بسته، به روز رسانی کتاب ها و پیکربندی استال تکرار کنید: از این زمان برای بررسی اینکه آیا هر پنجره تعمیر و نگهداری برنامه ریزی شده منسوخ شده و بررسی قوانین جدید هشدار از هفته گذشته به اشتراک گذاشته شده است که هیچ گونه بررسی دقیق است: استفاده از شرح دقیق است.

نادیده گرفتن هشدارهای کم-استرس تا زمانی که آنها تبدیل به انتقادی شوند

هشدار P4 در مورد یک فایل به آرامی در حال رشد ممکن است برای هفته ها نادیده گرفته شود - تا زمانی که دیسک پر شود و خدمات را کاهش دهد.با هشدارهای کم هزینه به عنوان نشانه های تعمیر و نگهداری تماس بگیرید. Automate آسان (مانند چرخش log) و اختصاص جعبه های زمان کوچک برای بقیه در طول هر بار از طریق سرعت، برای هشدارها که نمی تواند خودکار باشد، یک "تقعهدنامه" اختصاصی ایجاد کنید، درست مانند بازپرداخت بدهی فنی، و حل کردن چند چیز از این قابلیت مشاهده و تنظیم آن.

عدم آموزش برای اعضای تیم جدید

هنگامی که یک مهندس جدید به هم پیوسته می پیوندد، آنها نیاز به تمرین دستی با بررسی و پاسخ هشدار دارند.آنها را با یک شکاف ارشد برای اولین تغییرات، استفاده از هشدارهای شبیه سازی شده در یک محیط مرحله بندی، و ارائه یک چک لیست مستند شده در زیر مجموعه، نمونه خوب است PagerDuty در راهنمای آموزش تماس علاوه بر این، ایجاد یک نوار نظارت بر محیط کارآموزان و هشدار های معمول است که در آن نقش اصلی بازی می تواند برجسته ای را اجرا کند.

مقیاس کردن روستین به عنوان سازمان شما رشد می کند

از تیم کوچک تا تیم عملیات کامل

با یک یا دو مهندس، مدیریت هشدار غیر رسمی است، زیرا سر شمارش رشد می کند، چرخش را رسمی می کند، در اتوماسیون سرمایه گذاری می کند و نقش "محافظه کارانه" اختصاصی ایجاد می کند.استفاده از ابزاری مانند Directus برای ساخت یک خط مشی مدیریت هشدار سفارشی که ارتباط با هم نظارت بر داده ها، مدیریت کتاب ها و جدول زمانی حادثه - به همه یک پنطاب شیشه ای واحد می دهد، زمانی که تیم از پنج عضو استفاده می کند، نیاز به بحث در مورد یک دوره های سطح مشترک در مورد توجه به اشتراک گذاری در مورد 2 درس های اطلاع رسانی دارد و هشدار در مورد توجه به اشتراک گذاری دقیق دارد:

هماهنگی Cross-Team

هنگامی که هشدارها به زیرساخت ها، برنامه ها و تیم های امنیتی مربوط می شود، یک سیستم طبقه بندی مشترک و یک کانال مشترک (به عنوان مثال Slack، Microsoft Teams) ایجاد می کند که در آن همه هشدارهای حیاتی پست می کنند، هر تیم هنوز کادر بررسی خود را مدیریت می کند، اما کانال تضمین می کند که هیچ هشداری وجود ندارد. Weekly Cross همگام سازی های متقاطع می توانند به اهداف سرویس مشخص شده (S) که باید برای هر کدام از آنها در هر گروه های پاسخ ماهانه استفاده کنند، و استفاده از آنها در هر کدام از آنها استفاده کنند.

ادغام با پلتفرم های مدیریت حوادث

روال هشدار خود را به یک جریان کار مدیریت حوادث گسترده تر متصل کنید، هنگامی که یک هشدار افزایش می یابد، به طور خودکار باید یک بلیط حادثه ایجاد کند، به ذینفعان اطلاع دهد و شروع زمان بندی برای بررسی پس از شناسایی ابزار مانند ServiceNow، Jira Service Management، یا FireHydrant می تواند این خط لوله را تنظیم کند. Check comparison از ابزارهای پاسخ حادثه]

ساخت فرهنگ مالکیت هشدار

یک روال تنها به اندازه افرادی که از آن پیروی می کنند قوی است. فاستر فرهنگی است که هر عضو تیم مسئول سلامت سیستم هشدار دهنده است. مهندسین را تشویق می کند تا پیشنهاد حذف یا اصلاحات برای قوانین هشدار دهند که دیگر به یک هدف عمل نمی کنند، زمانی که یک عضو تیم تقویت کننده نرخ های مثبت کاذب را کاهش می دهد یا یک پاسخ دستی را خودکار می کند، یک دستور کار را در گذشته که کسی تشخیص داده شده است، تقویت می کند و یا رفتار حساس را تقویت می کند.

حفظ مدت طولانی Routine

بررسی های دوره ای و تونس

هر ربع، یک حسابرسی کامل از تمام قوانین و آستانه های هشدار را اجرا کنید.هرگونه که در شش ماه اخراج نشده باشد (ممکن است ثابت باشد) تعداد هشدارها را در هر منبع به ده مورد اول ترین اعمال، کاهش دهید و از مقایسه قبلی و بعد از MTTA و نرخ مثبت برای تأیید تغییرات استفاده کنید.همچنین در برنامه پوشش چرخش فراخوانی را بررسی کنید: اطمینان حاصل کنید که ساعت های تجاری با استفاده از هرگونه تغییر پیگیری و یا هیچ گونه نتیجه ای در آن ها (به اشتراک گذاری شده است.

فرهنگ بهبود مستمر

هر عضو تیم را تشویق کنید تا بهبود روال را پیشنهاد دهد، اگر کسی 30 دقیقه به صورت دستی در حال بررسی مثبت کاذب تکراری باشد، به آنها برای خودکارسازی اصلاحات پاداش دهید. بررسی های پس از شناسایی باید به صراحت از آن سوال کند: "چه تغییری در روال هشدار ما انجام شده است؟" ثبت این تغییرات در یک سند زنده. حفظ یک "پیشرفت بهبود معکوس" که در آن اعضای تیم می توانند بازخوردهای بالا را در کاهش دهند.

استفاده از Directus برای یک کنسول فرماندهی مرکزی

از آنجا که Directus یک CMS و داده انعطاف پذیر است، می تواند به عنوان ستون فقرات از مدیریت هشدار شما عمل کند. اتصال آن به API های نظارت خود (داده، پروکاروس، Grafana) و ایجاد یک رابط سفارشی که نشان می دهد زمان واقعی هشدار، حساب های مدیریت، برنامه های تماس، و روند تاریخی است. هر عضو تیم می تواند وارد و دقیقاً ببیند که چه نیاز دارد، و چه چیزی را با توجه مستقیم می تواند به طور چشمگیری در کنترل این لینک های صفحه کلید کار کند، حتی می تواند به طور چشمگیری از لینک های صفحه کلید دسترسی به طور مستقیم و یا جزئیات دسترسی داشته باشد.

نتیجه گیری

پیاده سازی یک روال رسمی برای بررسی و پاسخ به هشدارها یک پروژه یک بار نیست - این یک عمل در حال تحول است.شروع با سه برابر کردن موجودی هشدار خود، خودکار کردن دردناک ترین مراحل و ایجاد یک کادر آموزشی است که متناسب با واقعیت تیم شما، پیشرفت سریع، و آن را با یک روال جامد در محل، تیم شما زمان کمتری را صرف می کند، و تنظیم دقیق تر به عنوان سیستم های نظارت مستمر، و نظارت مستمر است.