Table of Contents
Môi trường IT hiện đại tạo ra cảnh báo tại mọi lớp từ tường lửa mạng và máy chủ cho đến nền tảng hiệu suất ứng ứng ứng dụng và hệ thống SIEM. Không có một chương trình thường xuyên, các đội nhanh chóng trở nên quá tải, các tín hiệu chỉ trích bị bỏ sót, và các sự cố xảy ra bị mất đi. Một tiến trình nhất quán, có ghi chép cho việc thu thập thông tin, duyệt và phản hồi để cảnh báo nhiễu có thể hoạt động. Nó giảm thời gian có nghĩa là nhận ra (MTTD), thời gian ngắn có nghĩa là trả lời (MTTR), và giúp tổ chức duy trì các khuôn khổ như 2.01, và N. Khi thiết lập một nhóm rõ ràng, xây dựng một hệ thống văn hóa không có vết nứt.
Thành phần lõi của một hệ thống quản lý cảnh báo có hiệu quả
Cảnh báo 3 giai đoạn và phân loại
Bước đầu tiên là phân loại những cảnh báo đến gần bằng sự nghiêm trọng, nguồn lực và tiềm năng tác động.
- Chỉ trích (P1) ) – Hệ thống đã bị hỏng, dữ liệu bị mất. Cần thiết ngay lập tức, 24/7 trả lời.
- Cao (P2)) – hiệu suất bị hạ cấp, nhiều người dùng bị ảnh hưởng, chỉ thị vi phạm tiềm năng. Trả lời trong vòng 15–30 phút.
- Medium (P3)) – vấn đề người dùng độc thân, không phải là lời cảnh báo nghiêm trọng, ngưỡng vượt qua. Trả lời trong vòng 4–8 giờ.
- Low (P4)) – Infoal, thẩm mỹ, hoặc những thông báo bảo trì đã định. Hãy xem lại trong ngày nghỉ.
Việc phân loại tự động càng nhiều càng tốt bằng cách sử dụng các quy tắc tương quan, nguồn tin tình báo đe dọa, và mô hình máy học tập từ những quyết định trước đó. Chẳng hạn, việc tổng hợp hệ thống cảnh báo của Sumo logic [FLT: 0] để báo động với các tính năng hữu ích [FLT: 1] [FLT: 1] có thể giúp bề ngoài các mẫu thật khác thường trong khi ngăn chặn tiếng ồn đã biết. Hơn nữa, hệ thống cảnh giác của bạn với cơ sở dữ liệu xử lý âm thanh (bộ máy) để làm giàu có sự chú ý về mặt tài sản, địa điểm, địa điểm, sự lựa chọn và độ chính xác hơn.
Định trước sự học hỏi lại
Hãy chọn một tần số duyệt qua tương ứng với hồ sơ rủi ro của môi trường. Hoạt động tính năng cao trên lịch (evycommerce, giao dịch tài chính) có thể cần phải liên tục kiểm tra lại với một bản đánh giá thứ hai. Ít môi trường quan trọng có thể hoạt động với ba thời gian phân tích của môi trường. Chìa khóa là nhất quán: tạo các khối lịch, xác định các phiên chạy và không bao giờ hủy bỏ phiên chạy. Hãy dùng bảng điều khiển chung (Grafa, Kibana, Kibana, hoặc một tổ chức trực tiếp điều khiển (chỉ định) hiển thị mọi việc phân tích công cụ thể được sắp xếp bởi độ nghiêm ngặt và các nhóm khác nhau. Đối với nhiều người thay đổi, một bản ghi chú từ tài liệu được bảo đảm bảo mỗi vị trí đã được bảo tồn tại.
Giao thức và Sổ tay ứng dụng
Tài liệu chính xác cần làm gì cho mỗi loại cảnh báo. Một tập tin nên có:
- Các bước ba thời gian ) – Kiểm tra cảnh báo không phải là tích cực, kiểm tra các bản ghi liên quan, xác nhận ảnh hưởng đến người dùng hay hệ thống.
- Đường dẫn ) – Ai sẽ liên lạc nếu vấn đề này nằm ngoài phạm vi của kỹ sư điện thoại.
- Hành động định hướng ) – làm việc ngay lập tức hoặc ngăn chặn bước.
- Xác nhận ) – Làm thế nào để xác định vấn đề này được giải quyết hoàn toàn và giám sát việc phục hồi.
- Ghi chú ) – Nơi cần đăng nhập để phân tích sau này.
Lưu trữ sách trong cơ sở kiến thức mã cấu trúc mã cấu hình hay chỉ thị dựa trên mã định dạng mã hóa (TB) nên chúng vẫn còn được điều khiển và dễ dàng cập nhật. Để được soi dẫn, xem sách Atlassian [FLT: 0]], hãy thử chạy sách ). Hãy xem xét cả hình chụp màn hình, đoạn trích dẫn và kết xuất để giảm độ mơ hồ trong các sự kiện áp đặt cao.
Động cơ tự động để giảm tải liên kết
Comment
Nhiều báo động là triệu chứng của cùng nguyên nhân gốc. Động cơ phụ (v. d., Opsgenie, PagerDuty, hoặc opensource Alert) là triệu chứng của một sự cố xảy ra. Việc này ngăn chặn bão báo động và cho phép người phản ứng tập trung vào một nguyên nhân thay vì hàng chục thông báo. Cấu hình cửa sổ tương quan khớp với mẫu lỗi điển hình của bạn ví dụ, 5 phút cho các cột mạng, 1 giờ cho sự rò rỉ bộ nhớ chậm. Hơn nữa, hãy sử dụng cơ quan phụ thuộc (v. d., dịch vụ trong Datadog) để tự động báo động từ các dịch vụ dòng chảy và dịch vụ dòng chảy xuống mặt đất. Khi cơ sở dữ liệu cảnh báo cháy, nó tự động nên giảm bớt các dịch vụ phụ thuộc vào cơ sở dữ liệu cần thiết bị rò rỉ (cơ quan hệ thống tập tin gốc).
Tự trị và tự chữa lành
Để có tốc độ thấp, hãy lặp lại cảnh báo, hãy ghi các tập lệnh trả lời tự động. Nếu một công cụ cảnh báo sử dụng đĩa, công việc của « bin » có thể làm sạch các bản ghi cũ. Nếu dịch vụ không hoạt động lại, một bộ điều khiển hộp có thể khởi động lại nó. Những bộ phận này “tự động mở ra các tập tin tự động giảm tải công việc bằng tay và ngăn chặn lỗi của con người. Hãy dùng công cụ như Stacks hay Rundeck để điều kiện chuỗi hành động. Tài liệu mỗi cuốn sách để khi một người xem xét bản ghi chú, hành động tự động tự động được giải mã và kiểm tra lại có thể tự động. Việc tự động kiểm tra tự động có thể kiểm tra tự động bao gồm thông báo cho một nhóm thông báo có liên kết với hành động, để giữ lại các chi tiết trong vòng lặp và tự động.
Giảm nhiễu
Sự mệt mỏi là mối đe dọa thật sự. Việc tăng cường nguồn điện theo đơn vị truy cập để ngăn chặn một yếu tố làm ngập hàng đợi. Chẳng hạn, nếu một máy chủ tạo ra 100 cảnh báo trong 10 phút, than đá cho chúng vào một cảnh giác với số đếm số lượng. Tương tự, hãy dùng các cửa sổ bảo trì để ngăn chặn sự cảnh giác trong thời gian xuống. Thường xuyên chạy một “sự kiểm tra kỹ thuật cao để tìm và điều chỉnh các màn hình đĩa. Tài nguyên như sách Google [FL: 0] để kiểm tra [FL: 0] tương tự, việc kiểm tra [FL: 1] cung cấp các tổ hợp chất đặc để thiết kế các nếp gấp.
Vai trò chung và trách nhiệm
Tiểu học và Thứ hai khi gọi điện thoại
Luôn luôn có một hệ thống phân cấp vượt quá tiêu chuẩn: một người phản ứng chính theo dõi P1–P2 lập tức, và một người phụ trách việc kiểm soát nếu người nguyên bản bận rộn hoặc nếu vấn đề này có nhiều lãnh thổ khác nhau. Hãy xem xét một hệ thống nhỏ hơn mà hai kỹ sư chia sẻ thông tin địa lý và có thể chia sẻ với nhau về việc phân công việc dựa trên chuyên môn (v. d. một trong các ứng dụng, tài liệu rõ ràng: thủ tục chính nên kết thúc hoặc chỉ ra các vấn đề chính.
Cảnh báo Sở hữulaque
Chỉ định một người hay một nhóm nhỏ để thực hiện đánh giá thông báo cảnh giác hàng ngày về mục P3 và P4. Vai trò này cũng bảo trì bản tóm tắt báo động bằng các bản tóm tắt lỗi, cập nhật sổ tay, và đánh dấu các mẫu cần thiết sự chú ý kỹ thuật. Người chủ duyệt nên chặn mỗi ngày 30 phút cùng lúc, xem lại bảng điều khiển, và vượt qua các bản tóm tắt tự động. Hơn nữa, họ nên kiểm tra tất cả các sự kiện P1-P2 xảy ra ngày trước đó có các tác vụ đánh dấu sau. Hãy thay đổi quyền sở hữu này để ngăn chặn sự sở hữu này trong vòng một nhóm và lan rộng kiến thức. Việc di chuyển để lại tóm tắt các xu hướng tới người chủ.
Tờ PostCoptic Review (PIR) Trả thù
Sau bất kỳ sự kiện quan trọng (P1, hoặc một lần lặp lại P2), lên lịch duyệt lại sau 48 giờ. PIR nên bao gồm kỹ sư điện thoại trên mạng, người chủ duyệt, và người giữ nó từ dịch vụ bị ảnh hưởng. Mục tiêu là xác định tại sao cảnh báo đã xảy ra, phản ứng được mở ra như thế nào, và những thay đổi nào để tiến trình hoặc tự động hóa có thể ngăn chặn sự tái phát hiện. Ghi ra những kết quả trong tài liệu chung; xem nó như một công cụ học, không phải là một bài tập. Hành động từ dự án này nên được theo dõi trong hệ thống quản lý của bạn với người chủ và ngày tháng rõ ràng.
Chỉ thị hiệu quả khóa để đo lường hiệu quả
Theo dõi các số liệu để đảm bảo thói quen của bạn đang hoạt động và để xác định các cổ chai:
- Thời gian để xác nhận [MTTA] ) – làm thế nào nhanh một người nhận cảnh báo. mục tiêu dưới 5 phút cho P1, dưới 15 cho P2.
- Thời gian để giải quyết (MTTR) ) – Từ nhận biết đến độ phân giải. Benchmarks khác nhau về mặt công nghiệp, nhưng nhất quán cho thấy sự cải thiện.
- Tốc độ tích cực ) – tỷ lệ báo động bị bỏ qua là tiếng ồn.
- Tuổi ) – Bao lâu thì sự cảnh giác thấp sẽ được ngồi trước khi xem xét.
- Ứng dụng Giao thức tái lập ) – Phần trăm cảnh báo nơi tập tin chạy được theo (xem bằng bản ghi kiểm tra). Hướng tới những thứ lớn hơn 90%.
Hãy hình dung những KPI này trên bảng điều khiển hàng tuần. Nếu mục đích của hệ thống thông tin liên lạc qua mạng Internet, có thể cần điều chỉnh. Nếu dương tính sai hơn 40%, hãy tổ chức một xưởng điều chỉnh. Cũng hãy theo dõi số cảnh báo mỗi nguồn mỗi ngày; một sự tăng đột ngột từ một nguồn thường ám chỉ một màn hình không được cấu hình kỹ hoặc một vấn đề tái diễn cần sửa chữa thường xuyên.
Những cạm bẫy thông thường và làm sao tránh chúng
Tha thứ mọi chứng rối loạn tâm lý
Đặt ngưỡng quá chặt có thể tạo ra tiếng ồn gây ra vấn đề thật, thay vào đó, hãy dùng các đường cơ bản thống kê: cảnh giác khi đi lệch hai hoặc ba chiều chuẩn. Một công cụ như bộ quản lý của ban quản lý xe có thể thực hiện “không có dữ liệu và“ cố gắng đột ngột tăng tốc độ đột ngột đột ngột của sự thay đổi (v.g., tỷ lệ lỗi tăng 50% trong 5 phút) thay vì giữ yên tĩnh.
Bỏ qua cuộc thảo luận hàng tuần
Nhiều đội khởi động mạnh mẽ nhưng hãy để cho việc này ngăn chặn việc này. Để ngăn chặn việc này, hãy kết hợp việc duyệt vệ sinh lại trong một sự kiện tái diễn (v. d., đội ngũ sáng thứ hai đứng lên). Chặn 30 phút để xem lại cảnh báo đóng cửa, cập nhật sách báo động, cập nhật và cấu hình gấp rút. Hãy dùng thời gian này để kiểm tra xem có cửa sổ bảo trì lịch nào bị lỗi thời và xem xét lại các quy tắc cảnh báo mới từ tuần trước. Danh sách kiểm tra về vệ sinh có chắc chắn không: kiểm tra tất cả các mô tả cảnh báo cảnh giác đều chính xác, kiểm tra một vài cuốn sách về chế độ bảo mật tự động, và xác định trên các phiên bản quay đang quay đang đến tuần.
Bỏ qua những cảnh giác thấp kém cho đến khi chúng trở nên nghiêm trọng
Báo động P4 về một tập tin ghi nhật ký đang tăng dần có thể bị bỏ qua nhiều tuần cho đến khi đĩa được nạp đầy và hạ dịch vụ. Điều trị những thông báo về sự kiên trì thấp như là dấu hiệu bảo trì. Hãy tự động kéo một vài vật dễ dàng (như quay bản ghi) và phân phát những hộp thời gian nhỏ cho mỗi lần chạy trong mỗi lần chạy nước rút. Để cảnh báo rằng không thể tự động, hãy tạo một “ món nợ riêng như món nợ phải trả, như là một món nợ kỹ thuật, kéo một vài món nợ, rồi giải quyết một số món nợ trên bảng để duy trì và giải quyết.
Thiếu sự huấn luyện cho các thành viên mới trong nhóm
Khi một kỹ sư mới tham gia, họ cần phải có tay tập luyện để xem xét và đáp ứng nhanh chóng. Hãy mời họ đến với một người cao tuổi trong vài ca đầu tiên, dùng cảnh giác giả lập trong một môi trường có thể xoay, và cung cấp một bảng kiểm tra ghi chép trên tàu.
Hãy xem xét kỹ càng các phép lạ khi tổ chức của bạn phát triển
Từ nhóm nhỏ đến nhóm hoạt động đầy đủ
Khi lượng đầu tư được tăng trưởng, tính toán độ xoay, đầu tư vào tự động và tạo một vai trò riêng biệt “có thể kiểm soát được ”.
Hội nghị qua hội nghị
Khi cảnh báo về cơ sở hạ tầng, đội an ninh và cơ sở hạ tầng, thiết lập hệ thống phân loại chung và một kênh chung (v. d., Slack, Microsoft Team) nơi mà tất cả các trạm thông báo cấp độ quan trọng, nơi mà mỗi đội vẫn quản lý khả năng kiểm tra lại mức độ, nhưng các kênh bảo đảm không có sự báo động nào bị mất điện. Mỗi nhóm phải có sự giải quyết chính thức và thông báo cho mỗi đội.
Kết hợp với nền tảng quản lý chống đối
Kết nối thói quen cảnh báo của bạn với một hoạt động quản lý sự cố rộng hơn. Khi cảnh báo tăng cường, nó sẽ tự động tạo một vé sự cố, thông báo các đối tượng bị hạn chế. Công cụ như Dịch vụ Dịch vụ Giờ, Jira Service Management, hoặc FireHdrant có thể sắp xếp đường ống này. Kiểm tra [FLT: 0] hỗ trợ các công cụ đáp ứng ngẫu nhiên [FLT: 1] để chọn kích cỡ của bạn. Bảo đảm rằng sự kết hợp là song phương: đóng vé cảnh báo gốc, và độ nghiêm ngặt nên tăng cường để tránh sự cố này và duy trì một nguồn dữ liệu riêng lẻ.
Xây dựng văn hóa của quyền sở hữu cảnh giác
Một thói quen chỉ mạnh như những người theo nó. Phát triển một nền văn hóa nơi mà mỗi thành viên trong nhóm cảm thấy có trách nhiệm về sức khỏe của hệ thống cảnh báo. Khuyến khích các kỹ sư đề nghị xóa hoặc sửa đổi đề nghị các quy tắc cảnh báo mà không còn phục vụ một mục đích. Hãy chú ý khi một thành viên nhóm giảm tỷ lệ tích cực hoặc tự động hóa một phản ứng bằng tay. Hãy cảnh báo vệ sinh một mục đang đứng trong việc xem lại mục nghị sự cảnh giác. Khi một ai đó được nhận diện để bắt một thông báo sớm hơn, nó sẽ được nhấn mạnh trong một email hay chat rộng rãi - tăng cường tính năng tích cực - tăng cường hành vi mong muốn. Hơn thời gian này, giảm số thư viện trợ giúp và tăng độ tin tưởng hệ thống.
Duy trì sự hứa hẹn lâu dài
Phát tiếng nói định kỳ và điều chỉnh
Mỗi quý, kiểm tra đầy đủ các quy tắc và ngưỡng cảnh báo. Bỏ đi những gì chưa được bắn ra trong sáu tháng (có thể là lỗi thời). Giảm số cảnh giác trên mỗi nguồn có thể. Dùng trước khi sử dụng tính toán và sau khi so sánh với MTTA và tỷ lệ dương để xác thực thay đổi. Cũng xem lại lịch quay điện thoại: đảm bảo sự canh giữ theo giờ và không có quá tải (v. d. không có hơn 7 ngày liên tiếp của cuộc gọi chính). Tài liệu tài liệu cho kết quả thanh toán và chia sẻ chúng để mua các quy tắc hay sửa đổi.
Tiếp tục cải tiến văn hóa
Nếu một người dành 30 phút để điều tra một điều tích cực được lặp đi lặp lại, hãy tự động kiểm tra lại.
Name
Vì Directus là một nền tảng dữ liệu và hệ thống đứng đầu linh hoạt, nó có thể phục vụ như cột sống của buồng lái cảnh báo. Kết nối nó với bộ quản lý API (DAB, cộng tác, cộng tác, Grafana) và xây dựng một giao diện riêng cho thấy thời gian chạy thật, tập chạy, trên lịch trình liên lạc, và các xu hướng lịch sử. Mỗi thành viên có thể đăng nhập vào và xem chính xác những gì cần thiết, với văn cảnh và liên kết hành động. Việc tập trung này giảm đáng kể các giá trị của bảng điều khiển và tính riêng. Bạn có thể tạo ra ngay cả một sự cố nhỏ, các mô- đun cảnh giác để ghi chú ý đến các mô- đun sau khi kiểm tra lại, kiểm tra trực tiếp các dự án trực tiếp, cũng có thể chạy trực tiếp hoặc sửa đổi các chức năng của mình.
Kết luận
Thực hiện một thói quen chính thức để xem xét và đáp ứng cho thực tế của đội không phải là một dự án phát triển thời gian. Bắt đầu bằng cách kiểm tra lại những bước cảnh giác, tự động tạo ra những bước đau đớn nhất, và xây dựng một sự chú ý phù hợp với thực tế của họ. Việc đo lường sự tiến bộ, ăn mừng chiến thắng nhanh chóng, và lặp lại. Với một thói quen vững chắc ở chỗ, nhóm của bạn sẽ dành ít thời gian hơn để chết đuối trong thông báo và giải cứu thời gian hơn, và thực hiện các hệ thống an toàn.