← Về danh sách
Bảo mật & Quyền riêng tư
#생성형AI#보안위협#프롬프트인젝션#정보유출#챗GPT#133회
Cập nhật lần cuối · 2026-09-30

Hướng dẫn bảo mật AI tạo sinh

1. Tổng quan

A. Khái niệm AI tạo sinh

AI tạo sinh (Generative AI) là AI học các mẫu thống kê của dữ liệu huấn luyện thông qua LLM (mô hình ngôn ngữ lớn), mô hình khuếch tán (Diffusion) và tương tự, rồi tự tạo ra nội dung mới—văn bản, hình ảnh, âm thanh, mã nguồn, v.v. Năm 2023, Trung tâm An ninh mạng Quốc gia (NCSC) trực thuộc Cơ quan Tình báo Quốc gia của Hàn Quốc đã ban hành "Hướng dẫn bảo mật khi sử dụng AI tạo sinh như ChatGPT", trình bày các nguyên tắc sử dụng an toàn cho khu vực công và doanh nghiệp.

Điểm khác biệt căn bản giữa AI tạo sinh và các hệ thống CNTT truyền thống nằm ở tính không thể dự đoán của hành vi. Phần mềm truyền thống hoạt động một cách tất định theo logic đã định, nên ranh giới giữa đầu vào và đầu ra rõ ràng, và các biện pháp kiểm soát dựa trên ranh giới như tường lửa và kiểm soát truy cập rất phù hợp. Tuy nhiên, AI tạo sinh tạo đầu ra bằng cách dự đoán token tiếp theo theo xác suất, nên có thể đưa ra câu trả lời khác nhau cho cùng một đầu vào, và ngay cả định nghĩa "đầu ra sai" cũng mơ hồ. Nghĩa là ngôn ngữ tự nhiên ở đầu vào vừa là lệnh vừa là dữ liệu, và tính chính xác của đầu ra không thể bảo đảm trước—tính bất định kép này tạo ra bề mặt tấn công mới.

Hơn nữa, việc nội dung người dùng nhập bằng ngôn ngữ tự nhiên có thể chảy thẳng vào huấn luyện mô hình, nhật ký và bộ nhớ đệm là điều chí mạng dưới góc độ an toàn thông tin. Trong hệ thống truyền thống, "đầu vào" là dữ liệu có cấu trúc đã qua kiểm tra biểu mẫu, nhưng ở AI tạo sinh, một khối mã nguồn mà lập trình viên dán vào hay toàn văn khiếu nại khách hàng mà nhân viên chuyển lại đều trở thành prompt. Kết quả là các mối đe dọa mới phát sinh trên toàn tuyến đầu vào–mô hình–đầu ra, nên các biện pháp kiểm soát cũ lấy phòng thủ ranh giới làm trung tâm là không đủ, và cần một hướng dẫn riêng phù hợp với mô hình đe dọa đặc thù của AI tạo sinh.

B. Bối cảnh ra đời và sự cần thiết

Bối cảnh căn bản khiến hướng dẫn trở nên cần thiết là tốc độ áp dụng AI đã vượt tốc độ hoàn thiện hệ thống bảo mật. Chỉ vài tháng sau khi ChatGPT ra mắt cuối năm 2022, AI tạo sinh đã thâm nhập công việc văn phòng, phát triển và tư vấn, nhưng phần lớn tổ chức sử dụng nó trong tình trạng không có chính sách về "được nhập gì" hay "tin đầu ra đến đâu". Việc áp dụng tự phát không kiểm soát (Shadow AI) sớm dẫn tới các sự cố như rò rỉ thông tin mật, vi phạm bản quyền và đưa thông tin sai vào công việc.

Động lực thứ hai là sự cụ thể hóa của quy định và trách nhiệm. Khi EU AI Act, Luật khung về AI của Hàn Quốc và các văn bản khác áp đặt nghĩa vụ minh bạch và quản lý rủi ro đối với AI rủi ro cao, việc sử dụng AI tạo sinh không còn là vấn đề tiện lợi mà là vấn đề tuân thủ pháp lý (Compliance). Tổ chức phải chứng minh được "ai đã dùng gì, dưới sự kiểm soát nào", và để làm vậy, các chỉ dẫn sử dụng và bảo mật được chuẩn hóa phải đi trước.

C. Ví dụ dịch vụ đang sử dụng

Hướng dẫn cần thiết trên thực tế vì AI tạo sinh đã được dùng rộng rãi trong công việc, và do đó làm tăng các điểm mà thông tin mật có thể bị lộ. Mỗi lĩnh vực dưới đây có một hồ sơ đe dọa khác nhau. Ví dụ, rủi ro cốt lõi ở mảng phát triển là rò rỉ mã nguồn, còn ở điểm tiếp xúc khách hàng là rò rỉ dữ liệu cá nhân và prompt injection.

Lĩnh vực Ví dụ Rủi ro chính
Năng suất Tóm tắt/soạn tài liệu, dịch, biên bản họp Nhập bí mật kinh doanh/thông tin chưa công bố
Phát triển Sinh/review mã, tự động hóa kiểm thử Rò rỉ mã nguồn/thông tin xác thực (Secret)
Tiếp xúc khách hàng Chatbot tư vấn, tự động trả lời FAQ Rò rỉ dữ liệu cá nhân, prompt injection
Sáng tạo/Marketing Sinh hình ảnh/thiết kế/copy Vi phạm bản quyền, lạm dụng deepfake

Vì tính chất rủi ro khác nhau theo lĩnh vực, một chính sách đồng nhất kiểu "cấm toàn bộ" hay "cho phép toàn bộ" đều không phù hợp. Cấm hoàn toàn lại cổ vũ Shadow AI (sử dụng lén lút), còn cho phép hoàn toàn tạo ra khoảng trống kiểm soát. Do đó, cách tiếp cận dựa trên rủi ro—đánh giá mức độ rủi ro theo từng mảng công việc và phân hóa phạm vi cho phép cùng cường độ kiểm soát—trở thành điểm khởi đầu của hướng dẫn.

2. Cấu trúc tổng thể của các mối đe dọa bảo mật AI tạo sinh

Các mối đe dọa của AI tạo sinh trở nên dễ hiểu một cách hệ thống khi được sắp xếp quanh ba điểm của luồng dữ liệu (đầu vào, mô hình/dịch vụ, đầu ra) và lớp quản trị bao quanh chúng. Sơ đồ cấu trúc dưới đây cho thấy mỗi mối đe dọa phát sinh ở đâu chỉ trong một cái nhìn.

flowchart LR
  subgraph GOV["Quản trị (chính sách·đào tạo·kiểm toán)"]
    subgraph FLOW["Luồng dữ liệu"]
      I["Đầu vào (prompt)"] --> P["Mô hình/Dịch vụ"]
      P --> O["Đầu ra (nội dung sinh)"]
    end
  end
  I -.nhập thông tin nhạy cảm.-> R1["Rò rỉ thông tin"]
  I -.chỉ thị độc hại.-> R2["Prompt injection"]
  P -.làm sai lệch huấn luyện·RAG.-> R3["Đầu độc dữ liệu"]
  P -.truy vấn lặp·lộ API.-> R5["Đánh cắp·suy ngược mô hình"]
  O -.giới hạn tính đúng thật.-> R4["Ảo giác"]
  O -.lạm dụng khả năng sinh.-> R6["Sinh nội dung độc hại"]

Ở đầu vào, nếu người dùng đưa thông tin mật hoặc cá nhân vào prompt, nội dung đó có thể được lưu vào dữ liệu huấn luyện hoặc nhật ký rồi bị tái hiện hay rò rỉ (rò rỉ thông tin), và đầu vào không tin cậy có thể ghi đè chỉ thị hệ thống để vượt qua kiểm soát (prompt injection). Đặc biệt, injection đang tiến hóa thành prompt injection gián tiếp (Indirect), trong đó chỉ thị ẩn trong tài liệu hoặc trang web đi vào qua RAG, nên cuộc tấn công có thể thành công ngay cả khi người dùng không trực tiếp nhập nội dung độc hại.

Ở mô hình/dịch vụ, việc làm sai lệch dữ liệu huấn luyện hoặc RAG có thể cấy thiên lệch hay backdoor (đầu độc dữ liệu, Poisoning), và việc truy vấn API lặp lại để sao chép mô hình hoặc suy luận dữ liệu huấn luyện trở thành vấn đề (đánh cắp mô hình/suy luận thành viên). Điều này đe dọa đồng thời tài sản trí tuệ của tổ chức và dữ liệu cá nhân đã dùng để huấn luyện.

Ở đầu ra, giới hạn nội tại của việc sinh theo thống kê—ảo giác (Hallucination)—trình bày các sự kiện không tồn tại một cách có vẻ hợp lý và làm sai lệch quyết định, còn khả năng sinh bị lạm dụng để tạo mã độc, email lừa đảo và deepfake. Ảo giác không phải là lỗi mà là sản phẩm phụ của việc sinh theo xác suất, nên không thể loại bỏ hoàn toàn và phải quản lý bằng cách cung cấp căn cứ và kiểm chứng.

Mối đe dọa Nguyên nhân chính Mối đe dọa bảo mật có thể xảy ra
Rò rỉ thông tin Nhập thông tin mật/cá nhân vào prompt → lưu vào huấn luyện·nhật ký Lộ bí mật kinh doanh/dữ liệu cá nhân, rò rỉ tái hiện
Prompt injection Đầu vào/tài liệu không tin cậy ghi đè chỉ thị hệ thống Vượt chỉ thị, chiếm quyền, rò rỉ dữ liệu
Đầu độc dữ liệu (Poisoning) Làm sai lệch dữ liệu huấn luyện·RAG Thiên lệch·backdoor, gây trả lời sai
Ảo giác (Hallucination) Giới hạn tính đúng thật của việc sinh thống kê Thông tin sai đưa vào công việc, sai lầm ra quyết định
Lạm dụng (Misuse) Sử dụng sai khả năng sinh Sinh mã độc·lừa đảo·deepfake
Đánh cắp·suy ngược mô hình Lộ API·truy vấn lặp Sao chép mô hình, suy luận dữ liệu huấn luyện·thành viên

Ví dụ, năm 2023 tại một hãng sản xuất toàn cầu, một lập trình viên đã dán mã nguồn nội bộ vào chatbot để nhờ review, và sự cố mã mật chảy vào dịch vụ mô hình bên ngoài được biết đến, làm nổi bật rằng rò rỉ thông tin ở đầu vào là mối đe dọa hiện thực nhất. Sau đó hãng này có lúc cấm hoàn toàn việc dùng AI tạo sinh nội bộ, rồi chuyển hướng chính sách sang cho phép lại có giới hạn sau khi xây dựng một mô hình khép kín tự phát triển.

3. Cân nhắc bảo mật khi phát triển·sử dụng và biện pháp theo lớp

Cốt lõi của chiến lược ứng phó là xây dựng các biện pháp kiểm soát theo lớp: đầu vào, mô hình, đầu ra và quản trị (Defense in Depth) khớp với nơi mối đe dọa phát sinh. Kiến trúc dưới đây cho thấy yêu cầu của người dùng được xử lý an toàn ra sao khi đi qua nhiều cổng kiểm soát.

sequenceDiagram
  participant U as Người dùng
  participant F as Bộ lọc đầu vào (DLP·che dữ liệu)
  participant G as Cổng AI (xác thực·nhật ký)
  participant M as LLM/RAG
  participant V as Kiểm duyệt đầu ra (lọc·kiểm căn cứ)
  U->>F: Nhập prompt
  F->>F: Phát hiện·che thông tin nhạy cảm
  F->>G: Yêu cầu đã làm sạch
  G->>M: Chuyển yêu cầu đã xác thực·cách ly
  M->>M: Tách prompt hệ thống/người dùng
  M->>V: Kết quả sinh
  V->>V: Kiểm nội dung độc hại·ảo giác, đóng watermark
  V->>U: Phản hồi an toàn

A. Kiểm soát ở đầu vào. Đây là tuyến phòng thủ ưu tiên cao nhất. Để thông tin nhạy cảm không đi vào mô hình ngay từ đầu, dùng DLP (chống thất thoát dữ liệu) và phát hiện dựa trên biểu thức chính quy/NER để che số định danh, số thẻ, khóa API và tương tự. Ở cấp tổ chức, thiết lập chính sách cấm nhập và quy trình phê duyệt nêu rõ "cái gì không được nhập", giảm thiểu ngoại lệ vượt qua kiểm soát kỹ thuật. Kiểm soát ở đầu vào có hiệu quả chi phí cao nhất vì nó chặn tại nguồn thay vì khắc phục sau sự cố.

B. Kiểm soát ở mô hình/dịch vụ. Để ngăn prompt injection, cách ly rõ ràng prompt hệ thống với đầu vào của người dùng và xử lý chỉ thị tách khỏi dữ liệu, trên tiền đề rằng đầu vào của người dùng là không tin cậy. Nếu dùng RAG, hãy kiểm chứng nguồn gốc và tính toàn vẹn của tài liệu trước khi lập chỉ mục để chặn injection gián tiếp và đầu độc. Ngoài ra, để ngăn đánh cắp mô hình, áp dụng xác thực và giới hạn tần suất (Rate Limiting) cho API và ghi nhật ký mọi truy vấn để phát hiện mẫu truy vấn bất thường.

C. Kiểm soát ở đầu ra. Không tin kết quả sinh nguyên trạng mà đặt một lớp lọc·kiểm duyệt. Kiểm tra nội dung độc hại, phân biệt hay chứa dữ liệu cá nhân, và với công việc mà tính đúng thật quan trọng, bắt buộc cung cấp căn cứ (nguồn) để con người có thể kiểm chứng ảo giác. Chèn watermark·chỉ dẫn nguồn gốc (ví dụ C2PA) vào nội dung sinh để truy vết lạm dụng deepfake. Đầu ra hiệu quả nhất khi kết hợp với "con người kiểm tra cuối (Human-in-the-loop)".

D. Lớp quản trị. Chính sách, đào tạo và kiểm toán của tổ chức bao quanh toàn bộ các biện pháp kỹ thuật trên. Chính sách sử dụng và quy trình phê duyệt, đào tạo nhân viên định kỳ, mô hình riêng·tách mạng cho công việc nhạy cảm, và kiểm toán lịch sử sử dụng đều thuộc về đây. Vì phần lớn rò rỉ thông tin bắt nguồn từ bất cẩn hơn là ác ý, quản trị là tấm lưới an toàn cuối cùng giúp giảm "lỗi con người" mà công nghệ không chặn được.

Điểm cần lưu ý khi thiết kế kiểm soát theo lớp là mỗi lớp phải hoạt động độc lập. Ngay cả khi bộ lọc đầu vào bị xuyên thủng, cách ly ở lớp mô hình vẫn lọc được injection; và nếu cả điều đó thất bại, kiểm duyệt đầu ra vẫn chặn rò rỉ dữ liệu nhạy cảm—tạo thành phòng thủ nhiều lớp (Defense in Depth) sao cho một thất bại kiểm soát đơn lẻ không lập tức thành sự cố. Vì AI tạo sinh liên tục sinh ra mối đe dọa mới, một thiết kế dựa vào một lớp kiểm soát duy nhất là nguy hiểm.

Phân loại Cân nhắc bảo mật Biện pháp ứng phó
Đầu vào Chặn thông tin nhạy cảm đi vào Lọc·che đầu vào, DLP, chính sách cấm nhập thông tin nhạy cảm
Mô hình/Dịch vụ Ngăn injection·đầu độc·đánh cắp Cách ly prompt (tách hệ thống/người dùng), kiểm tra đầu vào, kiểm soát truy cập·nhật ký, kiểm chứng dữ liệu RAG, giới hạn tần suất
Đầu ra Kiểm soát kết quả độc hại·không chính xác Lọc·kiểm duyệt đầu ra, cung cấp căn cứ, watermark, kiểm chứng ảo giác, human-in-the-loop
Quản trị Kiểm soát cấp tổ chức Chính sách·quy trình phê duyệt, đào tạo nhân viên, mô hình riêng·tách mạng, kiểm toán

4. So sánh với an toàn thông tin truyền thống và các trường hợp

Hiểu chỗ khác biệt giữa bảo mật AI tạo sinh và an toàn thông tin truyền thống làm rõ vì sao cần biện pháp kiểm soát riêng. An ninh truyền thống bảo vệ bên trong bằng cách vạch một "ranh giới tin cậy", nhưng ở AI tạo sinh, bản thân đầu vào ngôn ngữ tự nhiên là một lệnh tiềm tàng, nên tấn công có thể thành công ngay cả bên trong ranh giới. Ngoài ra, an ninh truyền thống xử lý tính bảo mật, toàn vẹn và sẵn sàng (CIA), còn AI tạo sinh bổ sung các trục mới là tính đúng thật (chính xác) và thiên lệch.

Khía cạnh An toàn thông tin truyền thống Bảo mật AI tạo sinh
Đối tượng đe dọa Dữ liệu·hệ thống (có cấu trúc) Dữ liệu + mô hình + đầu ra (phi cấu trúc)
Vector tấn công Lỗ hổng mã·mạng Prompt ngôn ngữ tự nhiên·dữ liệu huấn luyện
Thuộc tính cốt lõi Bảo mật·toàn vẹn·sẵn sàng (CIA) CIA + tính đúng thật·thiên lệch·khả năng giải thích
Cách kiểm soát Dựa trên ranh giới·chữ ký Dựa trên lớp·kiểm chứng·quản trị

Khác biệt đáng chú ý nhất trong bảng này là vector tấn công. Trong an ninh truyền thống, kẻ tấn công nhắm vào lỗ hổng mã hoặc đường mạng, nhưng ở AI tạo sinh, chính con đường sử dụng bình thường là "đầu vào ngôn ngữ tự nhiên" trở thành phương tiện tấn công. Chỉ thị độc hại có thể được nhúng trong lưu lượng bình thường đã vượt tường lửa, nên khó phán đoán đúng sai của lưu lượng ở lớp mạng. Vì lý do này, trọng tâm kiểm soát dịch chuyển từ ranh giới mạng sang các lớp kiểm chứng ứng dụng·dữ liệu·đầu ra.

Một trường hợp cụ thể: một cơ quan công lập khi soạn thảo phản hồi khiếu nại bằng AI tạo sinh đã trích dẫn một điều luật không tồn tại (ảo giác), để lại bài học rằng không được tin kết quả nếu thiếu kiểm chứng đầu ra (cung cấp căn cứ). Ngược lại, ngành tài chính đang xây dựng các trường hợp mẫu trong đó họ xây LLM khép kín nội bộ và ghi nhật ký·kiểm toán mọi truy vấn, vừa lấy lợi ích năng suất vừa kiểm soát rủi ro rò rỉ dữ liệu.

Một trường hợp khác: khi các công cụ tăng năng suất phát triển lan rộng nội bộ, vấn đề lộ ra là lập trình viên vô tình đưa các thông tin bí mật (Secret) như khóa API và thông tin kết nối CSDL vào các yêu cầu tự động hoàn tất mã. Đáp lại, một số hãng đã đưa vào các bộ lọc đầu vào phát hiện và chặn mẫu Secret ngay ở tầng plugin IDE—một minh họa tốt cho nguyên tắc phòng thủ theo lớp "chặn càng gần nơi mối đe dọa phát sinh (đầu vào) càng tốt". Bài học chung của ba trường hợp là bảo mật AI tạo sinh không hoàn tất bằng một biện pháp kiểm soát tại một điểm duy nhất; nó chỉ có hiệu lực khi chặn đầu vào, kiểm chứng đầu ra và chính sách tổ chức cùng vận hành.

5. Chuyên sâu: Tiêu chuẩn quốc tế·trong nước và xu hướng mới nhất

Bảo mật AI tạo sinh đang nhanh chóng hội tụ vượt khỏi nỗ lực của từng doanh nghiệp vào các khung tiêu chuẩn hóa và quy định. Dưới góc độ Kỹ sư chuyên nghiệp, phải có khả năng thiết kế một hệ thống quản lý dựa trên rủi ro bằng cách liên kết các khung dưới đây.

  • OWASP Top 10 for LLM Applications: Tiêu chuẩn trên thực tế tổng hợp các mối đe dọa đặc thù của ứng dụng LLM, bao gồm prompt injection, lộ thông tin nhạy cảm, chuỗi cung ứng, đầu độc dữ liệu, ủy quyền quá mức (Excessive Agency) và nhiều thứ khác. Khi thời đại mà các tác nhân AI (AI agent) tự động gọi công cụ đang đến, trọng số của mối đe dọa "ủy quyền quá mức" ngày càng lớn.
  • NIST AI RMF (Khung quản lý rủi ro AI) 1.0: Quản lý rủi ro AI qua bốn chức năng Govern·Map·Measure·Manage, và năm 2024 đã bổ sung riêng Hồ sơ AI tạo sinh (NIST AI 600-1) trình bày các mục kiểm soát cho các rủi ro đặc thù của AI tạo sinh.
  • ISO/IEC 42001: Tiêu chuẩn quốc tế cho hệ thống quản lý AI (AIMS) mà, giống như ISMS (27001), yêu cầu tổ chức có một hệ thống có thể chứng nhận để liên tục quản lý rủi ro AI.
  • Quy định: EU AI Act áp đặt nghĩa vụ minh bạch và lập tài liệu qua cách tiếp cận dựa trên rủi ro (cấm·rủi ro cao·hạn chế·tối thiểu) và được áp dụng theo giai đoạn. Luật khung về AI của Hàn Quốc (Luật về phát triển AI và thiết lập nền tảng tin cậy) quy định nghĩa vụ minh bạch (ghi nhãn nội dung sinh) đối với AI tác động cao và AI tạo sinh. Tuy nhiên, các nghị định thi hành và tiêu chí chi tiết vẫn đang trong giai đoạn hoàn thiện, nên phải kiểm tra các thông báo mới nhất.

Như vậy tiêu chuẩn được phân lớp từ "chặn cái gì (OWASP)" đến "tổ chức quản lý liên tục ra sao (NIST·ISO)" đến "nhà nước bắt buộc điều gì (quy định)", và thực tiễn hướng tới việc ánh xạ ba yếu tố này và triển khai chúng thành các biện pháp kiểm soát của riêng công ty.

Một xu hướng mới nhất đáng chú ý là trọng tâm của mối đe dọa đang mở rộng từ tấn công prompt đơn lẻ sang tác nhân tự động và đa phương thức. Một tác nhân AI gọi công cụ và tự động thực hiện nhiều bước có bán kính ảnh hưởng lớn, vì một lần injection có thể dẫn tới thao túng hệ thống thực tế (xóa tệp, thanh toán, v.v.). Các mô hình đa phương thức xử lý cả hình ảnh và âm thanh cũng tạo bề mặt tấn công mới, thử injection qua chỉ thị ẩn bên trong hình ảnh. Do đó hệ thống phòng thủ cũng phải vượt khỏi cách tiếp cận lấy văn bản làm trung tâm để mở rộng sang phê duyệt hành động của tác nhân và kiểm chứng đầu vào đa phương thức.

6. Cân nhắc và hàm ý

  • Vận hành song song bộ ba kiểm soát kỹ thuật·chính sách·con người: Chỉ các biện pháp kỹ thuật như DLP và cách ly prompt là không đủ. Chính sách sử dụng và đào tạo nhân viên phải đi cùng nhau mới thành phòng thủ thực chất. Vì phần lớn rò rỉ thông tin bắt nguồn từ bất cẩn hơn là ác ý, đầu tư vào con người chính là đầu tư bảo mật.
  • Đánh đổi giữa chủ quyền dữ liệu và lựa chọn mô hình triển khai: Với công việc nhạy cảm, dùng LLM khép kín/tại chỗ (on-premises) và RAG thay cho API thương mại bên ngoài để dữ liệu không rời khỏi tổ chức. Tuy nhiên, vì tự xây dựng tốn chi phí GPU·vận hành lớn, một chiến lược lai áp dụng phân biệt API thương mại, phiên bản riêng và tại chỗ theo mức độ nhạy cảm của dữ liệu là thực tế.
  • Liên kết quy định·quản trị: Liên kết EU AI Act, Luật khung về AI của Hàn Quốc, ISO/IEC 42001 và các văn bản khác để thiết lập hệ thống quản lý dựa trên rủi ro, và phản ánh các yêu cầu về độ tin cậy như ghi nhãn nội dung và khả năng giải thích vào thiết kế ngay từ đầu (Security/Compliance by Design).
  • Tối thiểu hóa quyền trong thời đại tác nhân AI: Với các tác nhân tự động gọi công cụ, "ủy quyền quá mức" trở thành mối đe dọa mới. Cần tối thiểu hóa quyền cấp cho tác nhân và đặt sự phê duyệt của con người cho các hành động rủi ro.
  • Thường trực hóa công-thủ (red team liên tục): Các kỹ thuật prompt đối kháng·bẻ khóa (Jailbreak) không ngừng tiến hóa, nên red team và giám sát phải chạy liên tục—không phải kiểm tra một lần—để liên tục cập nhật phòng thủ.
  • Bảo đảm minh bạch·khả năng giải thích: Việc ghi nhãn nội dung (watermark)·cung cấp căn cứ ra quyết định mà quy định yêu cầu phải được phản ánh tại thời điểm thiết kế dịch vụ, không phải là điều xử lý sau; điều này góp phần cho cả niềm tin của người dùng lẫn việc minh chứng trách nhiệm pháp lý.

Tài liệu tham khảo


Tóm tắt một câu: Bảo mật AI tạo sinh kiểm soát các mối đe dọa rò rỉ thông tin·prompt injection·đầu độc dữ liệu·ảo giác·lạm dụng·đánh cắp mô hình theo từng lớp qua đầu vào (DLP)·mô hình (cách ly·kiểm chứng)·đầu ra (lọc·căn cứ·watermark)·quản trị (chính sách·đào tạo·kiểm toán), lấy bộ ba kỹ thuật·chính sách·đào tạo song hành, bảo đảm chủ quyền dữ liệu và liên kết các tiêu chuẩn·quy định như OWASP, NIST và EU AI Act làm cốt lõi.