Các chỉ số hiệu năng Học máy (Machine Learning)
1. Tổng quan
A. Định nghĩa
Là các chỉ số dùng để đo lường và so sánh định lượng hiệu năng dự đoán của mô hình đã huấn luyện; cần lựa chọn chỉ số phù hợp theo loại bài toán (phân loại/hồi quy) và mục đích kinh doanh.
Chỉ số hiệu năng tóm tắt mức độ "dự đoán đúng đến đâu" của mô hình thành một con số, cung cấp tiêu chí phán đoán cho việc huấn luyện và lựa chọn. Tuy nhiên, một con số đơn lẻ luôn nén thông tin và che giấu điều gì đó. Ví dụ, nếu chỉ nhìn vào độ chính xác (Accuracy), khi dữ liệu mất cân bằng, nó có thể che đậy sự kém cỏi thực sự của mô hình. Do đó, điều cốt lõi là hiểu vì sao và khi nào dùng một chỉ số, và xem xét nhiều chỉ số cùng lúc.
B. Bối cảnh ra đời và sự cần thiết
Phát triển mô hình là chuỗi vô số quyết định như huấn luyện, tinh chỉnh siêu tham số, lựa chọn mô hình, và để so sánh chúng một cách khách quan cần một thước đo chung. Ngoài ra, cùng là phân loại sai nhưng chi phí khác nhau. Giống như cái giá của việc bỏ sót ung thư (FN) khác với chẩn đoán nhầm người bình thường thành bệnh nhân (FP), chỉ số cần tối ưu thay đổi theo mục đích kinh doanh. Chỉ số hiệu năng cho phép tối ưu hóa theo từng mục đích như vậy, đồng thời là căn cứ để chẩn đoán các vấn đề như mất cân bằng dữ liệu, quá khớp (overfitting) và đánh giá hiệu năng tổng quát hóa của mô hình.
2. Hệ thống phân loại chỉ số
flowchart TB
M[Chỉ số hiệu năng học máy] --> C[Phân loại Classification]
M --> R[Hồi quy Regression]
C --> CM["Dựa trên ma trận nhầm lẫn<br/>Accuracy · Precision · Recall · F1"]
C --> PR["Dựa trên xác suất·thứ hạng<br/>ROC-AUC · PR-AUC"]
R --> E["Dựa trên sai số<br/>MAE · MSE · RMSE · MAPE · R²"]
style M fill:#e8f0fe,stroke:#2f6fed,stroke-width:2px
Chỉ số hiệu năng được chia thành chỉ số phân loại và chỉ số hồi quy tùy theo đối tượng dự đoán là lớp (class) hay giá trị liên tục. Chỉ số phân loại lại được chia thành chỉ số dựa trên ma trận nhầm lẫn — đếm xem dự đoán có đúng hay không — và chỉ số dựa trên xác suất·thứ hạng — xem xét năng lực xếp hạng của mô hình không phụ thuộc vào ngưỡng. Chỉ số hồi quy tổng hợp độ lớn sai số giữa giá trị dự đoán và giá trị thực theo nhiều cách khác nhau.
3. Ma trận nhầm lẫn (Confusion Matrix)
Phần lớn chỉ số phân loại được dẫn xuất từ ma trận nhầm lẫn. Ma trận nhầm lẫn là bảng 2×2 chia tổ hợp giữa dự đoán và thực tế thành bốn ô; hiểu được quan hệ giữa TP, FP, FN, TN rút ra từ đây là có thể suy ra mọi chỉ số phân loại. Nếu đối ứng FP với sai lầm loại I của thống kê (đánh giá nhầm bình thường thành dương tính) và FN với sai lầm loại II (bỏ sót dương tính), bản chất của phân loại sai sẽ trở nên rõ ràng.
| Phân loại | Thực tế Positive | Thực tế Negative |
|---|---|---|
| Dự đoán Positive | TP (True Positive) | FP (False Positive, sai lầm loại I) |
| Dự đoán Negative | FN (False Negative, sai lầm loại II) | TN (True Negative) |
4. Chỉ số hiệu năng phân loại (Classification)
Mỗi chỉ số khác nhau ở chỗ nhấn mạnh phần nào của ma trận nhầm lẫn. Độ chuẩn xác (Precision) xem xét "trong số dự đoán là dương tính, bao nhiêu là dương tính thật" nên quan trọng khi chi phí của dương tính sai (FP) lớn; độ phủ (Recall) xem xét "tỷ lệ không bỏ sót trong số dương tính thật" nên quan trọng khi chi phí bỏ sót (FN) lớn. F1 là trung bình điều hòa của hai chỉ số này, và vì giá trị giảm mạnh khi lệch về một phía, nó phù hợp để đánh giá sự cân bằng trên dữ liệu mất cân bằng.
| Chỉ số | Công thức | Ý nghĩa | Tình huống sử dụng |
|---|---|---|---|
| Độ chính xác Accuracy | (TP+TN) / Tổng |
Tỷ lệ dự đoán đúng trên toàn bộ | Dữ liệu cân bằng lớp |
| Độ chuẩn xác Precision | TP / (TP+FP) |
Tỷ lệ đúng thực tế trong các dự đoán Positive | Khi chi phí FP lớn (phân loại spam) |
| Độ phủ Recall (độ nhạy) | TP / (TP+FN) |
Tỷ lệ không bỏ sót Positive thực tế | Khi chi phí FN lớn (chẩn đoán ung thư) |
| Độ đặc hiệu Specificity | TN / (TN+FP) |
Tỷ lệ nhận đúng Negative thực tế | Khi việc nhận diện bình thường quan trọng |
| F1 Score | 2·(P·R) / (P+R) |
Trung bình điều hòa của độ chuẩn xác·độ phủ | Dữ liệu mất cân bằng, cân bằng P·R |
| ROC-AUC | Diện tích dưới đường cong ROC | Năng lực phân loại trên toàn dải ngưỡng (0,5~1) | Đánh giá tổng hợp độc lập ngưỡng |
| PR-AUC | Diện tích đường cong Precision-Recall | Hiệu năng trên lớp thiểu số | Dữ liệu mất cân bằng nghiêm trọng |
Precision-Recall Trade-off: Hạ ngưỡng phân loại (threshold) khiến nhiều mẫu hơn bị đánh giá là dương tính nên độ phủ↑·độ chuẩn xác↓, còn nâng ngưỡng thì độ chuẩn xác↑·độ phủ↓. Hai chỉ số về căn bản mâu thuẫn nhau, nên việc xác định điểm cân bằng (ngưỡng) phù hợp với mục đích là cốt lõi của thực tiễn.
ROC-AUC và PR-AUC tóm tắt hiệu năng thành một giá trị trên toàn bộ dải ngưỡng chứ không phải tại một ngưỡng cụ thể. ROC-AUC hữu ích cho đánh giá tổng hợp độc lập với ngưỡng, nhưng trên dữ liệu mất cân bằng nghiêm trọng với số mẫu âm tính áp đảo, nó có thể trông lạc quan, khi đó PR-AUC trở thành chỉ số trung thực hơn.
Đường cong ROC (ví dụ)
{
"type": "line",
"data": {
"datasets": [
{
"label": "ROC của mô hình (AUC ≈ 0.9)",
"data": [{"x":0,"y":0},{"x":0.05,"y":0.55},{"x":0.1,"y":0.72},{"x":0.2,"y":0.85},{"x":0.4,"y":0.93},{"x":0.6,"y":0.97},{"x":1,"y":1}],
"borderColor": "#2f6fed",
"backgroundColor": "rgba(47,111,237,0.12)",
"fill": true,
"tension": 0.3
},
{
"label": "Đường cơ sở ngẫu nhiên (AUC = 0.5)",
"data": [{"x":0,"y":0},{"x":1,"y":1}],
"borderColor": "#9aa4b2",
"borderDash": [6, 4],
"pointRadius": 0,
"fill": false
}
]
},
"options": {
"plugins": { "legend": { "position": "bottom" }, "title": { "display": true, "text": "Đường cong ROC — càng gần góc trên bên trái càng tốt" } },
"scales": {
"x": { "type": "linear", "min": 0, "max": 1, "title": { "display": true, "text": "FPR (1 − độ đặc hiệu)" } },
"y": { "min": 0, "max": 1, "title": { "display": true, "text": "TPR (độ phủ)" } }
}
}
}
Đường cong ROC biểu diễn quan hệ giữa độ phủ (TPR) và tỷ lệ dương tính giả (FPR) khi thay đổi ngưỡng liên tục; đường cong càng gần góc trên bên trái thì càng tốt. Diện tích dưới đường cong (AUC) bằng 0,5 là mức đoán ngẫu nhiên, càng gần 1 thì càng gần phân loại hoàn hảo.
5. Chỉ số hiệu năng hồi quy (Regression)
Tính chất của chỉ số hồi quy khác nhau ở cách xử lý sai số. MAE lấy trung bình giá trị tuyệt đối của sai số nên bền vững trước ngoại lai và diễn giải trực quan, trong khi MSE·RMSE bình phương sai số để phạt nặng hơn các sai số lớn nên nhạy cảm với ngoại lai. Vì vậy, nếu đặc biệt muốn tránh sai số lớn thì xem RMSE, còn nếu muốn giảm ảnh hưởng của ngoại lai thì xem MAE.
| Chỉ số | Công thức (khái niệm) | Đặc điểm |
|---|---|---|
| MAE (sai số tuyệt đối trung bình) | `mean( | y − ŷ |
| MSE (sai số bình phương trung bình) | mean((y − ŷ)²) |
Phạt nặng sai số lớn, nhạy với ngoại lai |
| RMSE (căn bậc hai sai số bình phương trung bình) | √MSE |
Khôi phục về đơn vị gốc, chỉ số tiêu chuẩn trong thực tế |
| MAPE (sai số phần trăm tuyệt đối trung bình) | `mean( | y − ŷ |
| R² (hệ số xác định) | 1 − SS_res/SS_tot |
Khả năng giải thích (0~1), càng gần 1 càng tốt |
RMSE lấy căn bậc hai nên quay về cùng đơn vị với đối tượng dự đoán, được dùng như tiêu chuẩn trong thực tế, còn R² biểu thị mức độ mô hình giải thích phương sai của dữ liệu trong khoảng 0~1, hữu ích khi so sánh các bài toán có thang đo khác nhau.
6. Lưu ý và hàm ý (hướng dẫn lựa chọn chỉ số)
Từ góc độ Kỹ sư chuyên nghiệp, lựa chọn chỉ số hiệu năng là công việc dịch cấu trúc chi phí kinh doanh thành công thức. Chọn sai chỉ số sẽ dẫn đến triển khai một mô hình vô dụng nhưng trông như dự đoán tốt.
- Khi dữ liệu mất cân bằng, Accuracy bị méo mó nên dùng F1·PR-AUC (ví dụ: phát hiện gian lận với 99% là bình thường).
- Lĩnh vực có chi phí FN lớn (y tế·bảo mật) ưu tiên Recall để giảm bỏ sót.
- Lĩnh vực có chi phí FP lớn (spam·gợi ý) ưu tiên Precision để giảm cảnh báo sai.
- Nếu cần đánh giá tổng hợp độc lập với ngưỡng thì xem ROC-AUC.
- Với hồi quy, xem đồng thời RMSE (nhạy) và MAE (bền vững), và dùng R²·MAPE để so sánh giữa các thang đo.
- Tuyệt đối không tin mù quáng vào một chỉ số duy nhất; phải đối chiếu chéo nhiều chỉ số và xác nhận hiệu năng tổng quát hóa bằng kiểm định chéo (cross-validation).
Tóm tắt một câu: Chỉ số hiệu năng được chia thành phân loại (dựa trên ma trận nhầm lẫn + dựa trên xác suất·thứ hạng) và hồi quy (dựa trên sai số), và điều cốt lõi là chọn chỉ số phù hợp với đặc tính dữ liệu và cấu trúc chi phí của phân loại sai, đồng thời đối chiếu chéo nhiều chỉ số.