Phát hiện bất thường (Anomaly Detection)
1. Tổng quan
A. Định nghĩa và bối cảnh ra đời
Phát hiện bất thường (Anomaly Detection) là kỹ thuật phân tích dữ liệu nhằm nhận diện các quan sát (giá trị bất thường, Anomaly/Outlier) lệch một cách đáng kể khỏi phân phối và mẫu hình do dữ liệu bình thường tạo ra; dựa trên giả định về tính mất cân bằng và hiếm gặp — rằng phần lớn dữ liệu là bình thường và bất thường thì hiếm — nó học ranh giới của cái bình thường và phát hiện những gì nằm ngoài ranh giới đó.
Giám sát dựa trên luật truyền thống phụ thuộc vào các điều kiện do con người định trước, kiểu như "vượt ngưỡng thì cảnh báo". Tuy nhiên, khi chuyển đổi số khiến máy chủ, mạng, cảm biến IoT và giao dịch tài chính tạo ra hàng chục nghìn nhật ký và chuỗi thời gian mỗi giây, việc con người liệt kê mọi mẫu hình bình thường thành luật đã gặp giới hạn. Bản thân trạng thái bình thường thay đổi theo thời gian, tải và tính mùa vụ, còn kẻ tấn công và kẻ gian lận thì tiến hóa để né tránh các luật đã biết.
Phát hiện bất thường tái định hình vấn đề này: thay vì liệt kê "cái gì là bất thường", nó học "cái gì là bình thường" từ dữ liệu và định lượng mức độ lệch khỏi mô hình bình thường đó (điểm bất thường, Anomaly Score). Khả năng nắm bắt cả mối đe dọa chưa biết (zero-day), sự cố và gian lận là điểm khác biệt quyết định so với phương pháp dựa trên luật. Việc trong thực tế phần lớn được tiếp cận theo hướng không giám sát (Unsupervised) hoặc bán giám sát (Semi-supervised), nơi nhãn khan hiếm, cũng là đặc điểm phân biệt nó với bài toán phân loại (Classification) thông thường.
B. Sự cần thiết và đặc điểm
Phát hiện bất thường cần thiết vì tổn thất do một sự kiện bất thường gây ra lớn một cách bất đối xứng. Bắt được một giao dịch thẻ gian lận, một bất thường rung động nhỏ trong thiết bị sản xuất, hay một luồng lưu lượng bất thường ở giai đoạn đầu của một cuộc xâm nhập sẽ phòng ngừa được sự cố lớn, nhưng bỏ sót thì thiệt hại về tiền bạc, an toàn và uy tín sẽ dây chuyền. Ngược lại, nhầm bình thường thành bất thường (dương tính giả, False Positive) đẩy người vận hành vào mệt mỏi cảnh báo (Alert Fatigue), khiến họ bỏ qua cả cảnh báo thật. Do đó, phát hiện bất thường lấy sự cân bằng giữa âm tính giả (False Negative) và dương tính giả làm mục tiêu thiết kế cốt lõi.
Đặc điểm có thể tóm gọn ở ba điểm. Thứ nhất, mất cân bằng lớp cực đoan: bất thường thường chiếm 0,1–1%, nên độ chính xác (Accuracy) là vô nghĩa và cần các chỉ số như precision, recall, PR-AUC. Thứ hai, sự khan hiếm nhãn thực tế (ground-truth), khiến khó áp dụng trực tiếp học có giám sát. Thứ ba, tính phụ thuộc ngữ cảnh: cùng một giá trị có thể là bình thường hay bất thường tùy thời gian và hoàn cảnh xung quanh (ví dụ: một khoản thanh toán lớn lúc 3 giờ sáng).
Vì những đặc tính này, phát hiện bất thường phải được tiếp cận khác với bài toán dự đoán và phân loại thông thường ngay từ khâu định nghĩa vấn đề. Nếu phân loại hỏi "dữ liệu này là A hay B", thì phát hiện bất thường gần với bài toán tập mở (Open-set) hỏi "dữ liệu này có thuộc thế giới bình thường đã học hay không". Vì phải nắm bắt cả những bất thường mới, chưa được định nghĩa, nên việc ước lượng ranh giới của cái bình thường tinh vi đến đâu sẽ chi phối hiệu năng, và điều đó quy về vấn đề tính đại diện của dữ liệu và chất lượng thiết kế đặc trưng.
2. Các loại bất thường và quy trình phát hiện
Để thiết kế phát hiện bất thường, trước hết phải quy định bản chất của bất thường mục tiêu. Bất thường được chia rộng thành ba loại. Bất thường điểm (Point Anomaly) là khi một quan sát riêng lẻ lệch một mình khỏi phân phối tổng thể — chẳng hạn một khoản thanh toán 5 triệu won đột ngột giữa lịch sử thanh toán ở mức 50.000 won. Bất thường ngữ cảnh (Contextual Anomaly) là khi bản thân giá trị nằm trong phạm vi bình thường nhưng bất thường trong một ngữ cảnh cụ thể — lượng điện tiêu thụ bình thường vào mùa hè bị coi là bất thường nếu xuất hiện lúc nửa đêm mùa đông. Bất thường tập thể (Collective Anomaly) là khi các giá trị riêng lẻ bình thường nhưng toàn bộ mẫu hình liên tiếp lại bất thường — trường hợp điển hình là điện tâm đồ trong đó từng dạng sóng nằm trong phạm vi bình thường nhưng mẫu nhịp trên một đoạn cho thấy rối loạn nhịp tim.
Sự phân biệt này quan trọng vì kỹ thuật phù hợp và thiết kế đặc trưng (Feature) khác nhau theo từng loại. Bất thường điểm được bắt bằng phân phối của chính các giá trị, nhưng bất thường ngữ cảnh phải mô hình hóa kèm các biến ngữ cảnh như thời gian và vị trí, còn bất thường tập thể đòi hỏi học biểu diễn ở cấp chuỗi/cửa sổ. Định nghĩa sai loại thì dù thuật toán tốt đến đâu cũng bỏ sót.
Toàn bộ đường ống phát hiện tạo thành một cấu trúc tuần hoàn duy nhất từ thu thập dữ liệu đến ứng phó. Sơ đồ cấu trúc dưới đây cho thấy một vòng lặp kín học mô hình bình thường, tính điểm bất thường, quyết định qua ngưỡng, rồi cập nhật mô hình bằng phản hồi của người vận hành.
flowchart LR
A["Thu thập dữ liệu(nhật ký·chuỗi thời gian·giao dịch)"] --> B["Tiền xử lý·chuẩn hóa·xử lý thiếu"]
B --> C["Trích xuất đặc trưng(Feature Engineering)"]
C --> D["Huấn luyện mô hình bình thường"]
D --> E["Tính điểm bất thường(Anomaly Score)"]
E --> F["Ngưỡng·quyết định"]
F --> G["Cảnh báo·trực quan hóa·ứng phó"]
G --> H["Phản hồi người vận hành·gán nhãn"]
H --> D
| Loại bất thường | Định nghĩa | Ví dụ | Điểm thiết kế then chốt |
|---|---|---|---|
| Bất thường điểm | Một giá trị đơn lệch khỏi phân phối | Thanh toán đơn lẻ giá trị cao | Mô hình phân phối·mật độ giá trị |
| Bất thường ngữ cảnh | Bất thường về mặt ngữ cảnh | Lưu lượng lớn lúc nửa đêm | Biến ngữ cảnh như thời gian·vị trí |
| Bất thường tập thể | Mẫu hình·chuỗi bất thường | Sóng rối loạn nhịp, độ trễ tăng dần | Biểu diễn cửa sổ·chuỗi |
Ở khâu tiền xử lý, chuẩn hóa (scaling) và xử lý giá trị thiếu cùng nhiễu đặc biệt quan trọng. Các kỹ thuật dựa trên khoảng cách và mật độ nhạy với thang đo, nên nếu không chuẩn hóa, các biến có thang đo lớn sẽ chi phối phép tính khoảng cách. Ở khâu trích xuất đặc trưng, với chuỗi thời gian là trung bình trượt, tốc độ thay đổi và thành phần chu kỳ (FFT), còn với nhật ký là thống kê tổng hợp theo phiên hay thực thể, sẽ quyết định năng lực phát hiện.
3. Phân loại các kỹ thuật phát hiện bất thường
Các kỹ thuật phát hiện bất thường có thể được chia — theo cách biểu diễn cái bình thường — thành dựa trên thống kê, dựa trên khoảng cách/mật độ, dựa trên cây, và dựa trên học sâu. Kiến trúc chi tiết dưới đây cho thấy một cấu trúc thực tiễn kết hợp nhiều bộ phát hiện (Detector) theo kiểu tập hợp (ensemble) trong một hệ thống và tích hợp điểm của chúng để quyết định.
flowchart TB
subgraph Input["Đầu vào"]
X["Vector đặc trưng đã chuẩn hóa"]
end
subgraph Detectors["Tập hợp bộ phát hiện"]
S1["Thống kê(Z-score·IQR)"]
S2["Khoảng cách·mật độ(kNN·LOF)"]
S3["Cây(Isolation Forest)"]
S4["Học sâu(Autoencoder·LSTM)"]
end
X --> S1
X --> S2
X --> S3
X --> S4
S1 --> AGG["Tích hợp·chuẩn hóa điểm"]
S2 --> AGG
S3 --> AGG
S4 --> AGG
AGG --> T["Quyết định theo ngưỡng·thứ hạng"]
T --> O["Danh sách bất thường·giải thích(XAI)"]
A. Kỹ thuật dựa trên thống kê
Kỹ thuật dựa trên thống kê giả định dữ liệu tuân theo một phân phối cụ thể (chủ yếu là chuẩn) và coi những vùng thưa về mặt xác suất trong phân phối đó là bất thường. Đơn giản nhất, Z-score tính một điểm lệch khỏi trung bình bao nhiêu lần độ lệch chuẩn và thường gắn cờ bất thường khi giá trị tuyệt đối vượt 3 (khoảng 0,13% trên/dưới cùng). Khi phân phối lệch và trung bình/độ lệch chuẩn bị các giá trị cực đoan bóp méo, phương pháp IQR (khoảng tứ phân vị) dùng trung vị và các tứ phân vị sẽ vững chắc hơn. IQR quy định dưới Q1-1,5×IQR hoặc trên Q3+1,5×IQR là bất thường.
Điểm mạnh của kỹ thuật thống kê là tính toán nhẹ và ý nghĩa thống kê của ngưỡng rõ ràng, giúp dễ dàng đáp ứng quy định và kiểm toán. Trên thực tế, bộ lọc giai đoạn một của hệ thống phát hiện gian lận tài chính (FDS) hay biểu đồ kiểm soát (Control Chart, ±3σ) của quy trình sản xuất là các ví dụ tiêu biểu. Tuy nhiên, chúng dễ tổn thương trước các quan hệ đa biến/phi tuyến hoặc dữ liệu mà giả định phân phối bị phá vỡ, nên với dữ liệu phức tạp như nhật ký chiều cao hay hình ảnh, phải dùng song song với các kỹ thuật mô tả bên dưới.
Một lưu ý ở đây là luôn phải kiểm chứng giả định phân phối có đúng hay không. Ví dụ, kích thước gói mạng hay thời gian đáp ứng phần lớn là phân phối đuôi dài (đuôi phải kéo dài), nên áp dụng Z-score giả định phân phối chuẩn sẽ gắn cờ nhầm hàng loạt phần đuôi bình thường. Trong trường hợp này, hãy áp dụng sau khi biến đổi log hoặc chuyển sang kỹ thuật dựa trên phân vị.
B. Kỹ thuật dựa trên khoảng cách/mật độ
Kỹ thuật dựa trên khoảng cách/mật độ hình thức hóa trực giác rằng "giá trị bất thường nằm xa cụm bình thường hoặc ở vùng mật độ thấp". Cách dựa trên kNN lấy khoảng cách đến láng giềng gần thứ k làm điểm bất thường, coi khoảng cách lớn là bất thường bị cô lập. LOF (Local Outlier Factor) tiến thêm một bước, tính tỷ lệ mật độ của chính điểm đó so với mật độ của các láng giềng, qua đó bắt các điểm có mật độ thấp một cách cục bộ chứ không phải toàn cục. Trên dữ liệu thực có mật độ không đồng đều (ví dụ mật độ mẫu thanh toán khác nhau giữa nội đô và ngoại ô), LOF vượt trội so với các kỹ thuật khoảng cách toàn cục.
Điểm mạnh của họ này là hoạt động chỉ từ cấu trúc hình học của dữ liệu, không cần giả định phân phối. Mặt khác, điểm yếu là lời nguyền của chiều (Curse of Dimensionality), nơi khái niệm khoảng cách trở nên vô nghĩa ở chiều cao, và khối lượng tính toán lên tới O(n²) khi tính khoảng cách mọi cặp. Do đó, ở quy mô lớn hàng triệu bản ghi hoặc hàng trăm chiều, nó được kết hợp với giảm chiều (PCA·autoencoder) hoặc chỉ mục láng giềng gần xấp xỉ (ANN).
Ví dụ áp dụng thực tế, trong phát hiện gian lận chuyển vùng (roaming) của nhà mạng viễn thông, việc vector hóa mẫu sử dụng của từng thuê bao và áp dụng LOF có thể bắt các đợt tăng vọt sử dụng khác biệt cục bộ so với thông lệ. Ở đây việc chọn k (số láng giềng) rất nhạy — quá nhỏ dễ tổn thương với nhiễu, quá lớn thì mất tính cục bộ — nên được tinh chỉnh bằng dữ liệu kiểm định.
C. Kỹ thuật dựa trên cây (cô lập)
Isolation Forest khai thác tính chất rằng các giá trị bất thường "bị cô lập dễ dàng chỉ với ít lần phân tách". Khi các cây nhị phân được dựng lặp lại bằng cách chọn ngẫu nhiên đặc trưng và điểm phân tách, các giá trị bất thường bị tách riêng ở độ sâu nông hơn các điểm bình thường, nên độ dài đường đi trung bình của chúng ngắn. Độ dài đường đi được chuẩn hóa trở thành điểm bất thường. Sự chuyển đổi tư duy then chốt là nó trực tiếp cô lập bất thường mà không cần mô hình hóa vùng dày đặc của cái bình thường.
Sức hấp dẫn thực tiễn của Isolation Forest là khả năng mở rộng gần tuyến tính O(n), không cần giả định phân phối, và tính vững chắc tương đối ở chiều cao. Nó hoạt động tốt chỉ với việc lấy mẫu (sub-sampling), nên được dùng rộng rãi để sàng lọc bước đầu dữ liệu nhật ký và giao dịch quy mô lớn. Tuy nhiên, vì chỉ phân tách song song với trục, nó chật vật với các ranh giới phức tạp xiên so với trục, khi đó được bổ sung bằng Extended Isolation Forest hoặc kỹ thuật học sâu.
D. Kỹ thuật dựa trên học sâu/học máy
Với dữ liệu phi tuyến, chiều cao và chuỗi thời gian phức tạp, các kỹ thuật dựa trên học biểu diễn rất mạnh. Autoencoder được huấn luyện chỉ trên dữ liệu bình thường để nén đầu vào xuống chiều thấp rồi tái tạo, sau đó các đầu vào có sai số tái tạo (Reconstruction Error) lớn vì tái tạo kém sẽ bị đánh giá là bất thường. Vì chỉ học cái bình thường, nó không thể tái tạo tốt các mẫu bất thường chưa từng thấy — đó là nguyên lý. Với chuỗi thời gian, các mô hình dự đoán/tái tạo dựa trên LSTM/Transformer dự đoán giá trị kế tiếp và gắn cờ các đoạn có sai số dự đoán lớn là bất thường. Với hình ảnh và kiểm tra công nghiệp, các phương pháp học phân phối hình ảnh bình thường rồi phát hiện độ lệch được sử dụng.
Họ này có ưu thế nắm bắt các mẫu phức tạp (bao gồm bất thường tập thể) mà con người không cần thiết kế đặc trưng thô. Đổi lại, nó đòi hỏi nhiều dữ liệu huấn luyện và tính toán, và khó giải thích vì sao một thứ là bất thường, nên cần kết hợp với các kỹ thuật XAI (AI giải thích được). One-Class SVM thuộc họ bán giám sát học ranh giới tối thiểu bao quanh dữ liệu bình thường và coi bên ngoài ranh giới là bất thường, hiệu quả với tập bình thường quy mô vừa và nhỏ.
Cũng có những ứng dụng của mô hình sinh. Phát hiện bất thường dựa trên GAN (họ AnoGAN) học phân phối sinh của dữ liệu bình thường, rồi tìm vector tiềm ẩn tái tạo đầu vào tốt nhất và lấy chênh lệch tái tạo đó làm điểm bất thường; gần đây, nghiên cứu dùng mô hình khuếch tán (Diffusion) để tái tạo cái bình thường và bắt độ lệch cũng đang sôi động. Tuy nhiên, mô hình càng cao cấp thì gánh nặng về ổn định huấn luyện, khả năng diễn giải và chi phí tính toán càng lớn, nên tránh phức tạp thái quá xét theo độ khó của bài toán và ràng buộc vận hành là nguyên tắc thực tiễn. Nghĩa là chiến lược phân tầng — xử lý phần lớn bằng kỹ thuật thống kê/cô lập và chỉ triển khai học sâu một cách chọn lọc cho các bất thường phức tạp, chuỗi thời gian mà chúng bỏ sót — mới hiệu quả về chi phí.
4. So sánh kỹ thuật và các trường hợp áp dụng
Việc chọn kỹ thuật được quyết định không phải bởi "cái nào hiệu năng cao nhất" mà tại giao điểm của các ràng buộc: quy mô dữ liệu, số chiều, sự hiện diện của nhãn, yêu cầu giải thích và nhu cầu thời gian thực. Kỹ thuật thống kê nhẹ và dễ giải thích nhưng năng lực biểu đạt thấp; kỹ thuật khoảng cách/mật độ phản ánh cấu trúc tốt nhưng yếu với dữ liệu chiều cao/quy mô lớn. Isolation Forest mạnh về khả năng mở rộng và không cần giả định nhưng hạn chế với ranh giới phức tạp, còn học sâu có năng lực biểu đạt cao nhất nhưng đòi hỏi lớn về tài nguyên, khả năng giải thích và dữ liệu. Sự khác biệt này nảy sinh vì mỗi kỹ thuật biểu diễn "cái bình thường" theo một cách khác nhau (phân phối, khoảng cách, cô lập, tái tạo).
| Kỹ thuật | Cần nhãn | Chiều cao | Khả năng mở rộng | Khả năng giải thích | Ứng dụng tiêu biểu |
|---|---|---|---|---|---|
| Thống kê(Z·IQR) | Không cần | Thấp | Rất cao | Cao | Biểu đồ kiểm soát, bộ lọc giai đoạn một |
| Khoảng cách·mật độ(LOF) | Không cần | Thấp | Thấp(O(n²)) | Trung bình | Bất thường cục bộ, quy mô vừa/nhỏ |
| Isolation Forest | Không cần | Trung bình | Cao(O(n)) | Trung bình | Sàng lọc quy mô lớn |
| Autoencoder/LSTM | Bán giám sát | Cao | Trung bình | Thấp | Chuỗi thời gian·hình ảnh·mẫu phức tạp |
| One-Class SVM | Bán giám sát | Trung bình | Thấp | Trung bình | Tập bình thường vừa/nhỏ |
Trường hợp thứ nhất là phát hiện gian lận tài chính (FDS). Các công ty thẻ ở Hàn Quốc thường dùng cấu trúc nhiều giai đoạn: một bộ lọc giai đoạn một dựa trên luật sàng lọc các bất thường rõ ràng để giảm dương tính giả, tiếp theo là mô hình giai đoạn hai bằng học máy (Isolation Forest·autoencoder) để bắt các mẫu gian lận tinh vi. Với tỷ lệ gian lận dao động quanh 0,1%, cực kỳ mất cân bằng, mấu chốt là tinh chỉnh ngưỡng để nâng recall trong khi kìm hãm việc chặn các giao dịch bình thường (gây bất tiện cho khách hàng) do dương tính giả.
Trường hợp thứ hai là bảo trì dự đoán (PdM) cho thiết bị sản xuất. Bằng cách học các mẫu vận hành bình thường từ chuỗi thời gian cảm biến rung động, nhiệt độ và dòng điện với autoencoder hoặc LSTM, một đợt tăng vọt sai số tái tạo có thể nắm bắt các dấu hiệu sự cố sớm như mòn vòng bi trước hàng ngày đến hàng tuần. Trên thực tế, phát hiện sớm bất thường thiết bị cho phép chuyển sang bảo trì có kế hoạch, giảm đáng kể thời gian ngừng máy ngoài kế hoạch (downtime).
Trường hợp thứ ba là vận hành CNTT và giám sát an ninh (AIOps·UEBA). Áp dụng phát hiện bất thường cho các chỉ số máy chủ, nhật ký và hành vi người dùng (UEBA) nắm bắt các đợt tăng vọt lưu lượng, đăng nhập bất thường và mối đe dọa nội bộ. Ví dụ, nếu một tài khoản thường chỉ kết nối trong giờ làm việc từ một IP cụ thể lại thử tải xuống hàng loạt từ một IP nước ngoài lúc nửa đêm, nó bị bắt như một bất thường ngữ cảnh và được ứng phó tự động qua SIEM/SOAR.
Bài học chung xuyên suốt ba trường hợp này là, thay vì tìm một thuật toán vạn năng duy nhất, việc thiết kế đặc trưng bằng tri thức miền và kết hợp nhiều bộ phát hiện theo phân tầng/tập hợp thì vững chắc hơn. Bộ lọc nhiều giai đoạn của FDS, sự kết hợp các mô hình theo từng cảm biến của PdM, và việc song song luật+ML của giám sát đều tuân theo cùng một nguyên lý. Hơn nữa, cả ba trường hợp đều cho thấy đặc điểm chung rằng, hơn cả bản thân việc phát hiện, vòng lặp kín gồm rà soát của người vận hành, tích lũy nhãn và cập nhật mô hình sau phát hiện mới chi phối hiệu năng dài hạn.
5. Chuyên sâu: Xu hướng mới nhất và chiến lược đánh giá
Các xu hướng gần đây hướng theo ba chiều. Thứ nhất, sử dụng học sâu và mô hình nền tảng: các mô hình kiểm tra công nghiệp học phân phối hình ảnh bình thường, Transformer cho chuỗi thời gian, và phát hiện bất thường dựa trên mạng nơ-ron đồ thị (GNN) cho mạng tài chính và mạng xã hội đang lan rộng. Đặc biệt, các cách tiếp cận tận dụng biểu diễn đã tiền huấn luyện để nâng hiệu năng phát hiện ngay cả với ít dữ liệu đang thu hút chú ý. Thứ hai, kết hợp khả năng giải thích (XAI): ở các ngành chịu quản lý (tài chính, y tế), phải trình bày "vì sao là bất thường", nên cơ sở phát hiện được cung cấp kèm theo thông qua SHAP, phân tích đóng góp của sai số tái tạo và tương tự. Thứ ba, xử lý luồng thời gian thực và ứng phó với trôi dạt khái niệm (Concept Drift): vì các mẫu bình thường thay đổi theo thời gian, học trực tuyến và đường ống tái huấn luyện mô hình (MLOps) đã trở thành thiết yếu.
Việc thiết kế các chỉ số đánh giá quyết định thành bại trong phát hiện bất thường. Vì các lớp cực kỳ mất cân bằng, độ chính xác gây hiểu lầm (dự đoán tất cả đều bình thường vẫn cho 99%). Thay vào đó, hãy dùng precision, recall, F1 và PR-AUC, ưu tiên recall ở những miền không được phép bỏ sót (an toàn·an ninh) và precision ở những miền mà mệt mỏi cảnh báo nghiêm trọng. Trong chuỗi thời gian, vì bất thường tồn tại dưới dạng "các đoạn", hãy xem xét đánh giá cấp đoạn hoặc độ trễ phát hiện (Detection Delay) kèm theo thay vì các chỉ số cấp điểm. Ngoài ra, ngưỡng được đặt không phải như một giá trị cố định mà từ góc nhìn nhạy chi phí (Cost-sensitive) phản ánh chi phí vận hành (chi phí xử lý dương tính giả so với tổn thất do âm tính giả).
6. Cân nhắc và hàm ý
Từ góc nhìn của Kỹ sư chuyên nghiệp, việc áp dụng phát hiện bất thường là một quyết định chiến lược trải rộng qua dữ liệu, vận hành và quản trị, vượt trên việc chọn thuật toán. Thứ nhất, chiến lược nhãn và chất lượng dữ liệu. Nhãn bất thường khan hiếm và bị trễ (hàng tháng cho đến khi gian lận được xác nhận), nên một lộ trình thực tế là bắt đầu không giám sát, tích lũy nhãn qua phản hồi của người vận hành, và dần nâng cấp lên bán giám sát và học chủ động. Việc làm sạch dữ liệu ban đầu phải tiến hành song song để các bất thường lẫn trong dữ liệu bình thường không làm nhiễm bẩn quá trình học.
Thứ hai, quản lý dựa trên chi phí đối với đánh đổi dương tính giả/âm tính giả. Vì một ngưỡng duy nhất khiến hai loại lỗi tỷ lệ nghịch với nhau, hãy định nghĩa một hàm mất mát theo từng miền để đặt ngưỡng và hấp thụ dương tính giả bằng cấu trúc nhiều giai đoạn (luật → ML → con người rà soát). Để giảm mệt mỏi cảnh báo, việc phân cấp cảnh báo theo mức độ nghiêm trọng và tương quan/tổng hợp các cảnh báo tương tự là mấu chốt của thành công vận hành.
Thứ ba, khả năng giải thích và đáp ứng quy định/kiểm toán. Ở các miền tài chính, y tế và dữ liệu cá nhân, việc trình bày cơ sở cho các quyết định tự động và một quy trình khiếu nại là bắt buộc. Do đó, thay vì một hộp đen hiệu năng cao, hãy chọn một mô hình có thể trình bày cơ sở hoặc một cấu trúc kết hợp XAI, và lưu giữ lịch sử quyết định, phiên bản mô hình và phả hệ dữ liệu theo cách có thể kiểm toán.
Thứ tư, tính liên tục vận hành và các công nghệ liên đới. Việc hoàn thiện vòng lặp kín "từ phát hiện đến ứng phó" thông qua một đường ống tái huấn luyện ứng phó với trôi dạt khái niệm (MLOps·giám sát trôi dạt mô hình), xử lý luồng thời gian thực (Kafka·Flink), và liên kết với ứng phó tự động sau phát hiện (SOAR) mới đem lại giá trị thực. Ngoài ra, để chuẩn bị cho né tránh đối kháng (Adversarial Evasion), nên tập hợp nhiều bộ phát hiện đa dạng và định kỳ kiểm tra các kịch bản né tránh phát hiện. Nhìn về phía trước, các mô hình nền tảng và học tự giám sát sẽ làm dịu vấn đề thiếu nhãn, và phát hiện bất thường sẽ tích hợp với khả năng quan sát (Observability) và khả năng quan sát dữ liệu (Data Observability) để tự khẳng định như một thành phần tiêu chuẩn của độ tin cậy hệ thống.
Tài liệu tham khảo
- Chandola, Banerjee, Kumar, "Anomaly Detection: A Survey", ACM Computing Surveys, https://dl.acm.org/doi/10.1145/1541880.1541882
- scikit-learn, "Novelty and Outlier Detection", https://scikit-learn.org/stable/modules/outlier_detection.html
- Liu, Ting, Zhou, "Isolation Forest", https://ieeexplore.ieee.org/document/4781136
Tóm tắt một câu: Phát hiện bất thường học "cái bình thường" từ dữ liệu để phát hiện các quan sát hiếm, bất thường nằm ngoài ranh giới của nó, và chỉ đem lại giá trị thực tiễn khi các loại bất thường điểm/ngữ cảnh/tập thể và các kỹ thuật thống kê/khoảng cách/cô lập/học sâu được kết hợp phù hợp với ràng buộc dữ liệu và chi phí, đồng thời sự cân bằng dương tính giả/âm tính giả, khả năng giải thích và một vòng lặp kín vận hành được thiết kế cùng nhau.