← Về danh sách
AI & Dữ liệu
#XAI#설명가능성#LIME#SHAP#Grad-CAM#AI신뢰성
Cập nhật lần cuối · 2026-09-02

Trí tuệ nhân tạo có thể giải thích (XAI, eXplainable AI)

1. Tổng quan

Định nghĩa: Trí tuệ nhân tạo có thể giải thích (XAI) là tên gọi chung cho các công nghệ và phương pháp luận trình bày căn cứ·yếu tố đóng góp·quá trình ra quyết định đối với kết quả dự đoán của mô hình hộp đen (Black-box) — có hoạt động bên trong không minh bạch như học sâu — dưới dạng con người có thể hiểu được, nhằm bảo đảm tính minh bạch (Transparency)·độ tin cậy (Trust)·trách nhiệm giải trình (Accountability) của mô hình.

Đằng sau sự nổi lên của XAI là sự đánh đổi căn bản giữa việc nâng cao hiệu năng học sâu và khả năng diễn giải. Các mô hình có cấu trúc đơn giản như hồi quy tuyến tính·cây quyết định cho phép con người đọc trực tiếp quy tắc của chúng nhưng khả năng biểu đạt bị hạn chế. Ngược lại, mạng nơ-ron sâu với hàng trăm triệu đến hàng trăm tỷ tham số đạt độ chính xác cao, nhưng khó giải thích vì sao lại đi đến kết luận đó chỉ bằng các trọng số bên trong. Quan hệ tương quan nghịch này — hiệu năng càng cao thì khả năng diễn giải càng thấp — là động lực bậc một thúc đẩy nghiên cứu XAI.

Động lực thứ hai là quy định và thể chế. GDPR của EU quy định quyền của chủ thể dữ liệu được yêu cầu giải thích đối với quyết định tự động (cái gọi là "quyền được yêu cầu giải thích"), và EU AI Act có hiệu lực năm 2024 áp đặt nghĩa vụ minh bạch·lưu hồ sơ·giám sát của con người đối với hệ thống AI rủi ro cao (High-risk). Tại Hàn Quốc, trách nhiệm giải thích thuật toán cũng đang có xu hướng được tăng cường trong các lĩnh vực ảnh hưởng nghiêm trọng đến quyền lợi cá nhân như tài chính·y tế·tuyển dụng. Tức là XAI đã trở thành yêu cầu bắt buộc để đáp ứng đòi hỏi pháp lý·đạo đức, không phải sự tiện lợi kỹ thuật.

Động lực thứ ba là nhu cầu thực tiễn. Trong chẩn đoán y khoa, chỉ một con số "xác suất ung thư 92%" thì bác sĩ khó chấp nhận phán đoán đó; phải đồng thời chỉ ra vùng tổn thương nào trên ảnh là căn cứ thì mới có thể áp dụng lâm sàng. Trong thẩm định cho vay, nếu không đưa ra được lý do từ chối thì không tránh khỏi tranh chấp với người tiêu dùng và tranh cãi về phân biệt đối xử. Do đó, XAI trở thành nền tảng niềm tin của hệ thống hỗ trợ ra quyết định (Human-in-the-loop) trong đó con người và AI hợp tác. Trong bài làm, hợp lý khi định nghĩa XAI không phải là công cụ trực quan hóa đơn thuần mà là "trục cốt lõi hiện thực độ tin cậy AI (Trustworthy AI)".

2. Cấu trúc tổng thể và khái niệm của XAI

XAI có thể được hiểu là một tầng nhận đầu vào là mô hình đã huấn luyện và dự đoán của nó, rồi tạo ra lời giải thích theo dạng mà các bên liên quan như người dùng·cơ quan quản lý·nhà phát triển yêu cầu. Sơ đồ khái niệm dưới đây thể hiện khung xương tổng thể nối dữ liệu·mô hình·giải thích·các bên liên quan.

flowchart TB
    DATA["Dữ liệu huấn luyện"] --> MODEL["Mô hình đã huấn luyện(hộp đen)"]
    MODEL --> PRED["Kết quả dự đoán"]
    PRED --> XAI["Tầng giải thích XAI"]
    MODEL --> XAI
    XAI --> WHY["Vì sao ra quyết định này(căn cứ)"]
    XAI --> FEAT["Đặc trưng nào đóng góp(mức độ quan trọng)"]
    XAI --> VIS["Đã nhìn vào đâu(trực quan hóa)"]
    WHY --> USER["Các bên liên quan(người dùng·quản lý·nhà phát triển)"]
    FEAT --> USER
    VIS --> USER
    USER -->|"Phản hồi·kiểm chứng"| MODEL

Các câu hỏi mà XAI muốn trả lời chia lớn thành ba loại. Thứ nhất là "vì sao ra quyết định này", là giải thích cục bộ (local) đưa ra căn cứ của một dự đoán cụ thể. Thứ hai là "nhìn chung mô hình đã học được gì", là giải thích toàn cục (global) tóm tắt dạng thức hành vi của toàn mô hình. Thứ ba là "làm thế nào để kết quả thay đổi", là giải thích phản thực tế (counterfactual) chỉ ra cần thay đổi đầu vào thế nào để ra kết luận khác.

Ở đây cần phân biệt khả năng diễn giải (Interpretability) và khả năng giải thích (Explainability). Cái trước chỉ tính chất mà bản thân cấu trúc mô hình minh bạch, con người có thể nắm trực tiếp quan hệ nhân quả bên trong (ví dụ: cây quyết định), còn cái sau gần với hoạt động tái cấu trúc hậu kiểm căn cứ cho đầu ra của mô hình hộp đen. Trong thực tế, cách tiếp cận hậu kiểm (post-hoc) — giữ nguyên mô hình hiệu năng cao đã triển khai và gắn thêm lời giải thích — được dùng rộng rãi, vì thế XAI mang tính thỏa hiệp nhằm "bảo đảm niềm tin mà không hy sinh độ chính xác".

3. Các loại kỹ thuật XAI và quy trình hoạt động

Kỹ thuật XAI được phân loại theo thời điểm áp dụng (nội tại/hậu kiểm), phạm vi áp dụng (cục bộ/toàn cục), mức độ phụ thuộc mô hình (đặc thù mô hình/bất khả tri mô hình). Sơ đồ dưới đây cho thấy từ góc độ quy trình cách các kỹ thuật tiêu biểu được bố trí theo các trục này.

flowchart LR
    START["Phát sinh yêu cầu giải thích"] --> Q1{"Có thể thay đổi<br/>cấu trúc mô hình không"}
    Q1 -->|"Có(giai đoạn thiết kế)"| INTR["Mô hình diễn giải nội tại<br/>(cây quyết định·tuyến tính·GAM)"]
    Q1 -->|"Không(sau triển khai)"| POST["Giải thích hậu kiểm"]
    POST --> Q2{"Phạm vi giải thích"}
    Q2 -->|"Dự đoán riêng lẻ"| LOCAL["Cục bộ: LIME · SHAP · Grad-CAM"]
    Q2 -->|"Toàn mô hình"| GLOBAL["Toàn cục: PDP · mức quan trọng hoán vị · mô hình thay thế"]
    LOCAL --> OUT["Trình bày giải thích cho các bên liên quan"]
    GLOBAL --> OUT
    INTR --> OUT

LIME (Local Interpretable Model-agnostic Explanations) tạo các mẫu bằng cách nhiễu loạn (perturbation) nhẹ xung quanh điểm dữ liệu cần giải thích, quan sát phản hồi của mô hình hộp đen, rồi xấp xỉ vùng cục bộ đó bằng mô hình tuyến tính. Hệ số của mô hình tuyến tính thu được trở thành mức đóng góp cục bộ của từng đặc trưng. Về nguyên lý, đây là phương thức bất khả tri mô hình (model-agnostic) không cần biết bên trong mô hình nên phạm vi áp dụng rộng, nhưng có hạn chế là lời giải thích dao động theo cách nhiễu loạn và định nghĩa lân cận nên khả năng tái lập thấp.

SHAP (SHapley Additive exPlanations) mượn giá trị Shapley (Shapley Value) của lý thuyết trò chơi hợp tác, coi mỗi đặc trưng là "người tham gia trò chơi" và tính mức đóng góp sao cho phần thưởng là giá trị dự đoán được phân chia công bằng cho các đặc trưng. Vì lấy trung bình đóng góp biên khi có và không có đặc trưng đó trên mọi tập con đặc trưng, về lý thuyết nó thỏa mãn tính nhất quán·độ chính xác cục bộ. Tuy nhiên, khi số đặc trưng tăng, số tổ hợp tăng theo hàm mũ khiến khối lượng tính toán lớn, nên thường dùng kèm các phép xấp xỉ như thuật toán tốc độ cao chuyên cho mô hình cây (TreeSHAP).

Grad-CAM (Gradient-weighted Class Activation Mapping) dùng gradient của lớp tích chập cuối cùng đối với lớp được dự đoán trong CNN phân loại ảnh để hiển thị bằng bản đồ nhiệt (heatmap) vùng nào của ảnh đầu vào đã đóng góp vào phán đoán. Nó cho phép xác nhận bằng mắt "khi mô hình phân loại con chó là chó, nó thực sự nhìn vào thân con chó hay nhìn vào bãi cỏ phía sau", đặc biệt hữu ích để phát hiện thiên lệch dữ liệu hoặc học sai theo manh mối (shortcut learning).

Về giải thích toàn cục, có phụ thuộc từng phần (PDP) vẽ sự thay đổi của trung bình dự đoán khi thay đổi giá trị đặc trưng, mức quan trọng hoán vị (Permutation Importance) đo mức quan trọng bằng mức suy giảm hiệu năng khi xáo trộn ngẫu nhiên một đặc trưng, mô hình thay thế (Surrogate Model) mô phỏng hành vi của mô hình phức tạp bằng một mô hình đơn giản có thể diễn giải, v.v.

4. So sánh kỹ thuật và tình huống áp dụng

Không kỹ thuật nào là vạn năng, và lựa chọn thay đổi theo đối tượng giải thích·dạng dữ liệu·ngân sách tính toán·mức tin cậy yêu cầu. Phần so sánh dưới đây tổng hợp cả nguồn gốc khác biệt của các kỹ thuật tiêu biểu lẫn hàm ý thực tiễn.

Kỹ thuật Phạm vi Phụ thuộc mô hình Nguyên lý cốt lõi Ưu điểm Hạn chế
LIME Cục bộ Bất khả tri Xấp xỉ tuyến tính cục bộ Áp dụng cho mọi mô hình Tái lập·ổn định thấp
SHAP Cục bộ+toàn cục Bất khả tri (có bản tốc độ cao chuyên dụng) Phân chia giá trị Shapley Nhất quán về lý thuyết Chi phí tính toán lớn
Grad-CAM Cục bộ Đặc thù CNN Vùng kích hoạt dựa trên gradient Trực quan về thị giác Giới hạn ở ảnh·CNN
Cây quyết định/GAM Toàn cục Nội tại Cấu trúc minh bạch Diễn giải được về căn bản Hạn chế khả năng biểu đạt·độ chính xác

Cốt lõi của so sánh là đánh đổi tam giác "độ chính xác-khả năng diễn giải-chi phí tính toán". Mô hình diễn giải nội tại có lời giải thích hoàn chỉnh nhưng thiếu hiệu năng ở bài toán khó, SHAP ưu việt về lý thuyết nhưng tốn kém với dữ liệu lớn, LIME rẻ và đa dụng nhưng độ tin cậy thấp. Do đó, kết hợp dựa trên mục đích là thực tế: bố trí SHAP cho lĩnh vực coi trọng tính nhất quán của giải thích như tuân thủ quy định, LIME cho chẩn đoán khám phá nhanh, Grad-CAM cho đọc ảnh.

Một ví dụ cụ thể là chẩn đoán hình ảnh y khoa. Có nghiên cứu được báo cáo rằng khi áp dụng Grad-CAM cho CNN phân loại viêm phổi trên X-quang ngực, phát hiện ra mô hình đã học lấy manh mối là thủy vân ảnh do thiết bị chụp của một bệnh viện cụ thể để lại, chứ không phải tổn thương. Nếu chỉ nhìn chỉ số độ chính xác thì đạt mức 90% rất tốt, nhưng nếu không có XAI thì mô hình đã được triển khai mà không phát hiện ra tương quan giả (spurious correlation) này. Điều này cho thấy XAI là công cụ kiểm chứng mô hình làm lộ ra rủi ro bị các chỉ số hiệu năng che khuất. Trong lĩnh vực tài chính, các trường hợp dựa vào mức đóng góp SHAP để đưa ra lý do khi từ chối cho vay như "tỷ lệ nợ trên thu nhập và lịch sử quá hạn gần đây tác động lớn nhất đến quyết định", đồng thời đáp ứng cả tuân thủ quy định lẫn giải thích cho người tiêu dùng, cũng đang lan rộng.

5. Chuyên sâu: XAI trong thời đại LLM và xu hướng mới nhất

Cùng với sự lan rộng của mô hình ngôn ngữ lớn (LLM), đối tượng và phương pháp của XAI cũng đang thay đổi. Các kỹ thuật mức quan trọng đặc trưng hiện có được tối ưu cho dữ liệu có cấu trúc, nên có giới hạn trong việc giải thích "vì sao sinh ra câu trả lời này" của mô hình tạo sinh hàng trăm tỷ tham số. Theo đó, các cách tiếp cận được chú ý như xem quan hệ tham chiếu giữa các token bằng trực quan hóa attention (Attention Visualization), hoặc làm lộ đường suy luận bằng ngôn ngữ tự nhiên qua prompting chuỗi suy nghĩ (Chain-of-Thought) — phơi bày quá trình suy nghĩ từng bước. Tuy nhiên, những phê bình đang được thảo luận sôi nổi là khó khẳng định trọng số attention chính là nhân quả của lời giải thích, và không có bảo đảm CoT phản ánh trung thực phép tính bên trong thực tế (vấn đề tính trung thực của giải thích, faithfulness).

Một dòng chảy khác là khả năng diễn giải cơ chế (Mechanistic Interpretability) — mổ xẻ biểu diễn bên trong mạng nơ-ron ở cấp mạch (circuit). Đây là nghiên cứu nhằm làm rõ chức năng mà từng nơ-ron·đầu attention đảm nhận, là cách tiếp cận căn bản hơn một bậc so với XAI hiện có vốn xấp xỉ mô hình theo kiểu hậu kiểm. Trên bình diện quốc tế, chương trình XAI của DARPA (Mỹ) đã khởi động nghiên cứu có hệ thống trong lĩnh vực này, và Khung quản lý rủi ro AI (AI RMF) của NIST, các thảo luận tiêu chuẩn hóa về tính minh bạch AI của ISO/IEC đang thể chế hóa XAI thành yêu cầu của quản trị độ tin cậy.

Dưới góc nhìn Kỹ sư chuyên nghiệp, các hướng ra đề dự kiến đáng chú ý là ▲so sánh kỹ thuật XAI (LIME vs SHAP) và tiêu chí lựa chọn ▲liên kết với độ tin cậy AI·các quy định như EU AI Act ▲các điểm cần cân nhắc khi áp dụng cho các miền rủi ro cao như y tế·tài chính ▲giới hạn của chính XAI như tính trung thực·ổn định của giải thích. Khi cấu trúc bài làm, chiến lược ghi điểm cao là không dừng ở "liệt kê kỹ thuật" mà trình bày đồng thời góc nhìn đánh đổi và kiểm chứng.

6. Các điểm cần cân nhắc và hàm ý

Dưới góc nhìn Kỹ sư chuyên nghiệp, các điểm cần cân nhắc khi đưa XAI vào như sau.

  • Kiểm chứng tính trung thực của giải thích: Phải kiểm chứng riêng xem lời giải thích trông hợp lý có khớp với căn cứ bên trong thực tế của mô hình hay không. Lời giải thích sai ngược lại dẫn người dùng tới sự tin tưởng sai lầm (ảo giác giải thích), nên cần song hành thủ tục đánh giá định lượng tính ổn định·nhất quán của bản thân lời giải thích.
  • Phân biệt giải thích theo đối tượng người nghe: Dạng và độ sâu của giải thích mà cơ quan quản lý·người dùng cuối·nhà phát triển mô hình yêu cầu là khác nhau. Với nhà phát triển thì phù hợp mức đóng góp đặc trưng và phân tích mạch, với người dùng thì phù hợp giải thích phản thực tế·ngôn ngữ tự nhiên, nên cần thiết kế giải thích dựa trên vai trò.
  • Quản lý chiến lược đánh đổi hiệu năng-khả năng diễn giải: Thay vì ép buộc vô điều kiện mô hình có thể diễn giải, hợp lý hơn là áp dụng phân biệt dựa trên rủi ro theo cấp độ rủi ro: lĩnh vực rủi ro cao bố trí mô hình nội tại hoặc giải thích hậu kiểm mạnh, lĩnh vực rủi ro thấp bố trí giải thích nhẹ.
  • Phù hợp với quản trị·quy định: Liên kết với EU AI Act, NIST AI RMF, Luật cơ bản về AI·chứng nhận độ tin cậy của Hàn Quốc, v.v. để lưu các sản phẩm giải thích dưới dạng có thể ghi lại·kiểm toán, bảo đảm trách nhiệm giải trình (Accountability).
  • Tích hợp pipeline và chi phí vận hành: XAI không phải sản phẩm một lần mà phải được tích hợp vào pipeline MLOps và cập nhật mỗi khi huấn luyện lại·trôi dạt dữ liệu, đồng thời song hành chiến lược lấy mẫu·xấp xỉ có tính đến gánh nặng tính toán của các kỹ thuật chi phí cao như SHAP.

XAI là cơ chế hồi sinh trên toàn vòng đời AI các giá trị niềm tin·minh bạch·trách nhiệm vốn bị che khuất bởi mục tiêu duy nhất là độ chính xác. Trong tương lai, hướng thiết kế để có thể giải thích ngay từ đầu (interpretable-by-design) vượt ra ngoài giải thích hậu kiểm, kết hợp với khả năng diễn giải cơ chế làm rõ bên trong LLM ở cấp mạch, được kỳ vọng sẽ phát triển thành AI thế hệ mới đáp ứng đồng thời hiệu năng và niềm tin.


Tóm tắt một câu: XAI là công nghệ trình bày căn cứ dự đoán của mô hình hộp đen theo cách con người hiểu được (LIME·SHAP·Grad-CAM, v.v.) để bảo đảm tính minh bạch·độ tin cậy·trách nhiệm giải trình, điều phối đánh đổi độ chính xác-khả năng diễn giải-chi phí dựa trên mục đích·rủi ro và tạo nên trục cốt lõi của độ tin cậy AI và tuân thủ quy định.