Mối đe dọa bảo mật AI: tấn công đối kháng và lỗ hổng của AI tạo sinh
1. Tổng quan
A. Định nghĩa
Mối đe dọa bảo mật AI là loại mối đe dọa bảo mật mới xuất hiện cùng với việc mở rộng ứng dụng trí tuệ nhân tạo, bao gồm tấn công đối kháng (Adversarial Attack) nhắm trực tiếp vào quá trình huấn luyện và suy luận của học máy, cùng các lỗ hổng đặc thù của AI tạo sinh tiêu biểu là mô hình ngôn ngữ lớn (LLM).
Điểm khác biệt căn bản giữa bảo mật AI và bảo mật thông tin truyền thống là 'chính mô hình trở thành cả mục tiêu lẫn con đường tấn công'. Nếu hacking truyền thống khai thác lỗ hổng mã của hệ điều hành, mạng, ứng dụng (tràn bộ đệm, SQL injection…), thì tấn công AI không nhắm vào khiếm khuyết của mã mà thao túng tinh vi ranh giới phán đoán thống kê mà mô hình học được từ dữ liệu. Ví dụ như làm ô nhiễm dữ liệu huấn luyện, hoặc thêm nhiễu cực nhỏ vào đầu vào trông bình thường với mắt người để AI đưa ra kết luận hoàn toàn khác.
Ví dụ nổi tiếng nhất là nghiên cứu dán vài miếng dán trông như hình vẽ nguệch ngoạc với mắt người lên biển báo dừng (Stop sign), khiến mô hình nhận dạng của xe tự hành phân loại sai thành 'biển giới hạn tốc độ'. Ở mức điểm ảnh đó là thay đổi rất nhỏ, nhưng đủ để vượt qua ranh giới quyết định của mô hình. Khi AI đảm nhận các phán đoán liên quan đến an toàn và tài sản của con người như xe tự hành, chẩn đoán hình ảnh y tế, phát hiện giao dịch bất thường trong tài chính, giám sát an ninh, những trục trặc như vậy lập tức dẫn tới thiệt hại vật chất và xã hội. Thêm vào đó, sau ChatGPT, khi AI tạo sinh được đại chúng hóa, các mối đe dọa đặc thù của giao diện ngôn ngữ tự nhiên như chiếm quyền chỉ thị qua prompt, vượt rào cơ chế an toàn (jailbreak), tạo nội dung độc hại hàng loạt đã được bổ sung.
B. Bối cảnh ra đời và sự cần thiết
AI càng tham gia sâu vào hạ tầng cốt lõi và việc ra quyết định thì sức lan tỏa của các cuộc tấn công gây trục trặc cho nó càng lớn. Nếu trước đây bảo mật là vấn đề 'bảo vệ hệ thống', thì nay có thêm vấn đề 'có thể tin vào phán đoán đã học hay không'. Đặc biệt, khi AI tạo sinh thâm nhập vào nghiệp vụ doanh nghiệp (viết mã, tóm tắt tài liệu, chăm sóc khách hàng), dữ liệu, công cụ và quyền hạn nội bộ gắn với mô hình đã trở thành bề mặt tấn công (attack surface) mới.
Theo đó, quy định và tiêu chuẩn của các nước cũng đang nhanh chóng được hoàn thiện. OWASP công bố Top 10 cho ứng dụng LLM để hệ thống hóa các lỗ hổng AI tạo sinh, MITRE đưa ra cơ sở tri thức ATLAS tổng hợp chiến thuật và kỹ thuật tấn công AI, và NIST đưa ra Khung quản lý rủi ro AI (AI RMF) cùng hệ phân loại học máy đối kháng. Điều này cho thấy bảo mật AI không còn là ứng phó một lần mà đã trở thành nhiệm vụ thường trực cần được nội tại hóa trong toàn bộ vòng đời AI (Secure AI by Design).
2. Bức tranh tổng thể về mối đe dọa bảo mật AI
Trước hết, nếu vẽ bản đồ tổng thể xem mối đe dọa nhắm vào điểm nào của vòng đời AI, vị trí của từng cuộc tấn công và điểm phòng thủ sẽ trở nên rõ ràng.
flowchart TB
T["Mối đe dọa bảo mật AI"] --> ML["Tấn công đối kháng học máy"]
T --> LLM["Lỗ hổng LLM tạo sinh"]
ML --> P["Poisoning (đầu độc dữ liệu huấn luyện)"]
ML --> E["Evasion (nhiễu loạn đầu vào)"]
ML --> I["Inversion (trích xuất thông tin)"]
ML --> X["Extraction (đánh cắp mô hình)"]
LLM --> PI["Prompt injection"]
LLM --> JB["Vượt rào (Jailbreak)"]
LLM --> DL["Rò rỉ dữ liệu"]
LLM --> HA["Ảo giác (Hallucination)"]
style T fill:#fef3f2,stroke:#e11d48,stroke-width:2px
style ML fill:#eef6ff,stroke:#2f6fed
style LLM fill:#fff7ed,stroke:#d97706
Nhìn tổng quát, mối đe dọa có hai nhánh. Một là tấn công đối kháng học máy nhắm vào mọi mô hình phân loại, dự đoán; hai là lỗ hổng đặc thù của LLM tạo sinh nhận chỉ thị bằng ngôn ngữ tự nhiên. Tiếp theo, từng nhánh được giải thích bằng văn xuôi từ góc độ nguyên lý và phòng thủ.
3. Bốn loại tấn công đối kháng học máy và phòng thủ
Tấn công đối kháng được hiểu một cách hệ thống khi phân loại theo 'nhắm vào giai đoạn nào của vòng đời AI, với mục tiêu gì'. Nhắm vào giai đoạn huấn luyện là đầu độc, nhắm vào giai đoạn suy luận là né tránh, lấy ra thông tin chứa trong mô hình là đảo ngược, sao chép chính mô hình là trích xuất.
A. Đầu độc (Poisoning) — làm ô nhiễm dữ liệu huấn luyện
Đầu độc là tấn công trộn mẫu độc hại vào dữ liệu mà mô hình học, làm sai lệch phán đoán của mô hình hoàn chỉnh ngay từ đầu. Nó lợi dụng ngược việc huấn luyện là quá trình 'quy nạp quy tắc từ dữ liệu'. Dạng đặc biệt nguy hiểm là tấn công cửa hậu (Backdoor): mô hình chỉ trục trặc khi có một trigger nhất định (ví dụ: một mẫu nhỏ ở góc ảnh), còn bình thường hoạt động đúng nên khó phát hiện.
Tấn công này càng nguy hiểm trong môi trường thu thập dữ liệu hàng loạt từ bên ngoài. Hệ thống gợi ý hay chatbot liên tục huấn luyện lại từ phản hồi người dùng, và mô hình nền tảng (foundation model) học từ dữ liệu thu thập công khai trên web trở thành mục tiêu. Cốt lõi của phòng thủ là đặt kiểm chứng nguồn gốc dữ liệu (provenance), phát hiện giá trị ngoại lai và làm sạch dữ liệu trước khi huấn luyện, đồng thời đưa kiểm tra toàn vẹn dữ liệu và theo dõi thay đổi vào pipeline huấn luyện lại để lọc mẫu bị đầu độc.
B. Né tránh (Evasion) — nhiễu loạn đầu vào khi suy luận
Né tránh là tấn công với mô hình đã triển khai, biến đổi đầu vào ở mức rất nhỏ mà con người khó nhận ra (adversarial perturbation) để gây phân loại sai. Miếng dán trên biển báo dừng nói trên, hoặc ví dụ kinh điển thêm nhiễu không nhìn thấy vào ảnh khiến 'gấu trúc' bị phân loại thành 'vượn', thuộc loại này. Nó khai thác tính chất ranh giới quyết định của mô hình dễ bị tổn thương một cách bất ngờ trong không gian nhiều chiều.
Né tránh có thể được dùng để trực tiếp vô hiệu hóa các mô hình bảo mật như vượt bộ lọc thư rác, vượt phát hiện mã độc, vượt xác thực sinh trắc học, nên mức nguy hiểm cao. Phòng thủ tiêu biểu là huấn luyện đối kháng (Adversarial Training), cố ý đưa ví dụ đối kháng vào dữ liệu huấn luyện để tăng độ vững chắc (robustness) của mô hình. Ngoài ra còn kết hợp chuẩn hóa/tiền xử lý đầu vào, ensemble nhiều mô hình, chưng cất phòng thủ (defensive distillation)… Tuy nhiên, phòng thủ hoàn toàn là khó và đây là lĩnh vực tấn công-phòng thủ liên tục tiến hóa, nên đánh giá độ vững chắc liên tục thực tế hơn là tuyên bố 'đã giải quyết'.
C. Đảo ngược (Inversion) và suy luận thành viên — trích xuất thông tin
Đảo ngược mô hình (Model Inversion) là tấn công quan sát và phân tích lặp lại đầu ra của mô hình (xác suất, độ tin cậy) để khôi phục ngược dữ liệu nhạy cảm dùng trong huấn luyện. Suy luận thành viên (Membership Inference) liên quan tìm ra 'dữ liệu của một cá nhân cụ thể có nằm trong tập huấn luyện hay không', tự nó đã xâm phạm quyền riêng tư. Ví dụ, từ mô hình chẩn đoán y tế có thể suy ra thông tin nhạy cảm của một bệnh nhân cụ thể.
Tấn công này trầm trọng hơn khi mô hình 'ghi nhớ' quá mức dữ liệu huấn luyện, nên phòng thủ xoay quanh các kỹ thuật bảo toàn quyền riêng tư. Dùng quyền riêng tư vi sai (Differential Privacy) thêm nhiễu có kiểm soát vào quá trình huấn luyện để làm mờ ảnh hưởng của từng dữ liệu riêng lẻ, hạn chế mức chi tiết của đầu ra (lộ giá trị xác suất), và khi cần thì dùng học liên kết (Federated Learning) để không tập trung dữ liệu gốc về trung tâm.
D. Trích xuất (Extraction) — đánh cắp mô hình
Trích xuất (Model Extraction/Stealing) là tấn công gửi vô số truy vấn đến API dự đoán công khai, thu thập các cặp đầu vào-đầu ra để sao chép một mô hình thay thế hoạt động tương tự bản gốc. Đây vừa là hành vi đánh cắp trái phép tài sản trí tuệ của mô hình đã tốn chi phí khổng lồ để huấn luyện, vừa có thể là bàn đạp để thiết kế tấn công né tránh bằng mô hình sao chép.
Cốt lõi phòng thủ là kiểm soát ở cấp API. Ngăn chặn trích xuất hàng loạt bằng giới hạn tần suất truy vấn (rate limiting), phát hiện mẫu truy vấn bất thường, chèn watermark vào đầu ra, và tối thiểu hóa thông tin độ tin cậy trả về. Bảng sau là tài liệu bổ trợ tổng hợp bốn loại tấn công theo giai đoạn nhắm tới và góc độ phòng thủ.
| Tấn công | Giai đoạn nhắm tới | Mục tiêu | Phòng thủ tiêu biểu |
|---|---|---|---|
| Đầu độc (Poisoning) | Huấn luyện | Làm sai lệch phán đoán, cửa hậu | Kiểm chứng nguồn gốc, làm sạch dữ liệu, phát hiện bất thường |
| Né tránh (Evasion) | Suy luận | Gây phân loại sai | Huấn luyện đối kháng, chuẩn hóa đầu vào, ensemble |
| Đảo ngược (Inversion) | Suy luận (quan sát) | Khôi phục dữ liệu huấn luyện, thông tin cá nhân | Quyền riêng tư vi sai, hạn chế đầu ra |
| Trích xuất (Extraction) | Suy luận (API) | Sao chép, đánh cắp mô hình | Giới hạn truy vấn, watermarking, phát hiện bất thường |
4. Lỗ hổng bảo mật của mô hình ngôn ngữ tạo sinh (LLM)
Do đặc tính 'nhận chỉ thị bằng ngôn ngữ tự nhiên và trả lời bằng ngôn ngữ tự nhiên', AI tạo sinh có những lỗ hổng mà phần mềm truyền thống không có. Cốt lõi là ranh giới giữa lệnh (chỉ thị của nhà phát triển) và dữ liệu (đầu vào từ người dùng, bên ngoài) mơ hồ. Tính chất này là gốc rễ chung của các mối đe dọa dưới đây. Sau đây là sơ đồ kiến trúc chi tiết thể hiện luồng dữ liệu và các điểm đe dọa của ứng dụng LLM.
flowchart LR
U["Đầu vào người dùng"] --> GI["Guardrail đầu vào"]
DOC["Tài liệu, web bên ngoài (RAG)"] --> GI
GI --> M["Mô hình LLM"]
M --> TOOL["Công cụ, API, DB được kết nối"]
M --> GO["Guardrail đầu ra, kiểm chứng"]
GO --> R["Phản hồi"]
U -. "Prompt injection/jailbreak" .-> M
DOC -. "Injection gián tiếp" .-> M
TOOL -. "Lạm dụng quyền quá mức" .-> DOC
style M fill:#fff7ed,stroke:#d97706,stroke-width:2px
style GI fill:#eef6ff,stroke:#2f6fed
style GO fill:#eef6ff,stroke:#2f6fed
A. Prompt injection (tiêm lệnh qua prompt)
Prompt injection là tấn công dùng đầu vào độc hại để vô hiệu hóa hoặc chiếm quyền chỉ thị gốc (system prompt) do nhà phát triển thiết lập, được OWASP LLM Top 10 xếp là mối đe dọa hàng đầu. Có injection trực tiếp — đưa thẳng vào kiểu "Bỏ qua mọi chỉ thị trước đó và …" — và injection gián tiếp (Indirect Injection) — giấu chỉ thị độc hại trong trang web, tài liệu, email bên ngoài mà mô hình đọc vào. Loại sau đặc biệt nguy hiểm khi mô hình tin tưởng và xử lý nội dung bên ngoài như RAG, tóm tắt tự động hay agent, và có thể gây ra hành động người dùng hoàn toàn không mong muốn (rò rỉ dữ liệu, lạm dụng quyền).
Về căn bản, phòng thủ là 'tách lệnh khỏi dữ liệu', nhưng do đặc tính ngôn ngữ tự nhiên, việc tách hoàn toàn là khó — đây là bài toán nan giải của lĩnh vực này. Trên thực tế, người ta kết hợp kiểm tra và lọc đầu vào, cô lập nội dung bên ngoài bằng ranh giới tin cậy, tối thiểu hóa quyền cấp cho mô hình (least privilege), và xác nhận của con người trước hành động nhạy cảm (human-in-the-loop).
B. Vượt rào (Jailbreak) và rò rỉ dữ liệu
Vượt rào là tấn công dùng prompt tinh vi để vượt qua căn chỉnh an toàn (safety alignment) của mô hình, lôi ra các đầu ra lẽ ra phải bị từ chối như cách chế tạo chất nổ hay mã độc. Cách làm là bắt mô hình nhập vai (roleplay) hoặc dựng tình huống giả định để lách cơ chế an toàn, và các kỹ thuật vượt rào mới cùng bản vá ngăn chặn chúng lặp đi lặp lại không ngừng. Rò rỉ dữ liệu có hai hướng: một là mô hình nhả ra thông tin nhạy cảm đã ghi nhớ trong huấn luyện (thông tin cá nhân, khóa API), hai là bí mật nội bộ người dùng nhập vào cuộc trò chuyện bị lộ ra ngoài qua log hoặc huấn luyện lại. Thực tế, khi có báo cáo về trường hợp nhân viên dán mã nguồn hoặc biên bản họp vào chatbot bên ngoài làm lộ bí mật, nhiều doanh nghiệp đã đưa vào chính sách sử dụng nội bộ và che giấu dữ liệu (masking).
C. Ảo giác (Hallucination) và lạm dụng
Ảo giác là hiện tượng mô hình bịa ra nội dung không có thật một cách rất thuyết phục; tiêu biểu là trích dẫn bài báo, án lệ, API không tồn tại như thể có thật. Đây không phải tấn công ác ý, nhưng trong các lĩnh vực mà độ chính xác là sống còn như y tế, pháp luật, tài chính, nếu thông tin sai được dùng nguyên vẹn cho việc ra quyết định sẽ dẫn đến thiệt hại nghiêm trọng. Lạm dụng là dùng AI tạo sinh để tạo hàng loạt email lừa đảo (phishing), hỗ trợ viết mã độc, sản xuất deepfake, nâng năng suất của kẻ tấn công và làm tăng mức đe dọa trên toàn xã hội. Bảng sau là tài liệu bổ trợ tổng hợp các lỗ hổng LLM chính.
| Lỗ hổng | Nội dung | Ứng phó tiêu biểu |
|---|---|---|
| Prompt injection | Chiếm quyền, vượt chỉ thị (trực tiếp/gián tiếp) | Kiểm tra đầu vào, tối thiểu hóa quyền, cô lập nội dung |
| Vượt rào (Jailbreak) | Vượt cơ chế an toàn để tạo đầu ra độc hại | Tăng cường căn chỉnh an toàn, lọc đầu ra, red team |
| Rò rỉ dữ liệu | Lộ thông tin nhạy cảm từ huấn luyện, hội thoại | Che giấu dữ liệu, chính sách sử dụng, kiểm soát log |
| Ảo giác (Hallucination) | Tạo thông tin sai lệch | RAG, đưa ra căn cứ, kiểm chứng sự thật, con người rà soát |
| Lạm dụng | Phishing, mã độc, deepfake | Giám sát sử dụng, watermarking, chính sách và pháp chế |
5. Phương án ứng phó — phòng thủ nhiều lớp (Defense in Depth)
Phòng thủ không phải là một biện pháp đơn lẻ tại một thời điểm, mà là phòng thủ nhiều lớp trải dài toàn bộ vòng đời AI. Ở giai đoạn huấn luyện, làm cho chính mô hình vững chắc bằng kiểm chứng nguồn gốc/làm sạch dữ liệu và huấn luyện đối kháng; ở giai đoạn triển khai và suy luận, đặt guardrail kiểm tra đầu vào/đầu ra và giới hạn truy vấn API. Với prompt injection thì ứng phó bằng kiểm tra đầu vào và tách quyền (tối thiểu hóa công cụ, dữ liệu mà mô hình truy cập); với ảo giác thì dùng RAG để trả lời dựa trên tài liệu căn cứ, kèm kiểm chứng sự thật và ghi nguồn. Ở giai đoạn vận hành, giám sát MLOps theo dõi thường xuyên thay đổi phân phối đầu vào (drift) và truy vấn bất thường, đồng thời chủ động phát hiện các kỹ thuật vượt rào mới qua diễn tập AI red team định kỳ và quản trị. Chỉ khi chồng các lớp phòng ngừa-phát hiện-ứng phó lên nhau như vậy thì dù một lớp bị xuyên thủng, toàn bộ cũng không sụp đổ.
6. Chuyên sâu — xu hướng tiêu chuẩn, quy định và áp dụng thực tế
Bảo mật AI đã bước vào giai đoạn được thể chế hóa thành khung tiêu chuẩn và quy định, vượt ra ngoài các kỹ thuật riêng lẻ. OWASP LLM Top 10 tổng hợp từ góc nhìn nhà phát triển các mối đe dọa tiêu biểu của ứng dụng AI tạo sinh như prompt injection, xử lý đầu ra không an toàn, ủy quyền quá mức (Excessive Agency), và được dùng như danh sách kiểm tra thực tế của ngành. MITRE ATLAS tích lũy các chiến thuật, kỹ thuật tấn công AI đã quan sát thực tế theo định dạng ATT&CK để cung cấp tình báo mối đe dọa, còn NIST AI RMF đưa ra thủ tục quản lý rủi ro cho AI đáng tin cậy. Về quy định, EU AI Act bắt buộc các yêu cầu về độ vững chắc, độ chính xác và bảo mật đối với AI rủi ro cao, cho thấy bảo mật đang trở thành đối tượng tuân thủ (compliance).
Trục áp dụng thực tế là 'hòa bảo mật đặc thù AI vào quy trình bảo mật và phát triển hiện có'. Ví dụ, ngành tài chính bắt buộc đặt guardrail đầu vào/đầu ra và che giấu thông tin cá nhân cho tư vấn khách hàng dựa trên LLM, và với hệ thống RAG xử lý tài liệu nội bộ thì cô lập nội dung bên ngoài bằng ranh giới tin cậy để chặn prompt injection gián tiếp. Ngoài ra, khi việc lạm dụng AI tạo sinh gia tăng, đầu tư vào ghi nhận nguồn gốc nội dung (watermarking, xác thực nguồn gốc như C2PA) và công nghệ phát hiện để đối phó phishing, deepfake đang mở rộng. Cốt lõi là xem mô hình như một tài sản mới đồng thời là bề mặt tấn công, và nội tại hóa bảo mật từ giai đoạn thiết kế ở mọi tầng dữ liệu-mô hình-ứng dụng-vận hành (Secure AI by Design).
7. Các điểm cần cân nhắc và hàm ý
Nội tại hóa bảo mật trong mọi giai đoạn vòng đời AI (Secure AI by Design) là nguyên tắc. Mỗi giai đoạn thu thập dữ liệu, huấn luyện, triển khai, vận hành đều có mối đe dọa riêng (đầu độc→né tránh→đảo ngược/trích xuất), nên phải tích hợp bảo mật từ đầu giai đoạn thiết kế chứ không phải kiểm tra sau, và chồng các biện pháp kiểm soát theo từng giai đoạn.
Cuộc đua 'giáo và khiên' ứng phó tấn công tự động hóa, tinh vi hóa bằng AI sẽ khốc liệt hơn. Khi AI tạo sinh khiến tấn công tinh vi và quy mô hơn, phòng thủ cũng phải đối đầu bằng phát hiện bất thường và ứng phó tự động dựa trên AI. Tuy nhiên, độ vững chắc đối kháng là lĩnh vực khó giải quyết hoàn toàn, nên phải quản lý rủi ro với tiền đề đánh giá và cải tiến liên tục chứ không phải 'phòng thủ hoàn hảo'.
Cần hợp nhất AI đáng tin cậy (an toàn, vững chắc, quyền riêng tư) với bảo mật. Bảo mật AI phải được xử lý tổng thể, vượt khỏi phòng chống hacking đơn thuần, kết hợp các vấn đề độ tin cậy như thiên lệch, ảo giác và bảo vệ thông tin cá nhân. Đặc biệt, đảo ngược và suy luận thành viên mang tính hai mặt: vừa là vấn đề bảo mật vừa là vấn đề quyền riêng tư.
Phải tối thiểu hóa quyền được kết nối và bề mặt tấn công (Least Privilege). Khi LLM kết nối với công cụ, DB, API bên ngoài, 'ủy quyền quá mức' đã trở thành rủi ro cốt lõi mới. Phải tối thiểu hóa quyền và dữ liệu truy cập cấp cho mô hình, và đặt xác nhận của con người cho hành động nhạy cảm để khoanh vùng phạm vi thiệt hại của prompt injection.
Phải có hệ thống thường trực về quản trị, tiêu chuẩn và tuân thủ quy định. Tham chiếu các khung như OWASP, MITRE ATLAS, NIST AI RMF, EU AI Act để tài liệu hóa phân loại mối đe dọa-kiểm soát-kiểm toán, và vận hành AI red team cùng kiểm tra định kỳ như quy trình thường trực ở cấp tổ chức.
Tài liệu tham khảo
- OWASP Top 10 for LLM Applications — https://owasp.org/www-project-top-10-for-large-language-model-applications/
- MITRE ATLAS (Adversarial Threat Landscape for AI Systems) — https://atlas.mitre.org/
- NIST AI Risk Management Framework — https://www.nist.gov/itl/ai-risk-management-framework
Tóm tắt một câu: Mối đe dọa bảo mật AI bao gồm tấn công đối kháng nhắm vào huấn luyện và suy luận (đầu độc, né tránh, đảo ngược, trích xuất) và lỗ hổng LLM tạo sinh (prompt injection, vượt rào, rò rỉ dữ liệu, ảo giác, lạm dụng), và được ứng phó bằng phòng thủ nhiều lớp (Secure AI by Design) chồng huấn luyện đối kháng, guardrail, tối thiểu hóa quyền và quản trị lên mọi tầng dữ liệu-mô hình-ứng dụng-vận hành.