← Về danh sách
Bảo mật & Quyền riêng tư
#비식별조치#k-익명성#l-다양성#t-근접성#가명정보
Cập nhật lần cuối · 2026-09-21

Biện pháp phi định danh thông tin cá nhân và các mô hình bảo vệ quyền riêng tư (k-anonymity, l-diversity, t-closeness)

1. Tổng quan

Định nghĩa: Biện pháp phi định danh (de-identification) thông tin cá nhân là chuỗi xử lý kỹ thuật và quản lý nhằm loại bỏ hoặc biến đổi các định danh để không thể nhận ra một cá nhân cụ thể từ tập hợp thông tin; còn k-anonymity (k-ẩn danh), l-diversity (l-đa dạng) và t-closeness (t-gần kề) là các mô hình bảo vệ quyền riêng tư (privacy protection model) phán định định lượng mức độ kết quả đó chống chịu được việc tái định danh.

Khi nền kinh tế dữ liệu lan rộng, các tổ chức có động lực mạnh mẽ để khai thác thông tin cá nhân đang nắm giữ cho thống kê, nghiên cứu và huấn luyện trí tuệ nhân tạo, nhưng nếu dùng nguyên bản gốc sẽ vấp phải rào cản về sự đồng ý và giới hạn mục đích theo Luật Bảo vệ thông tin cá nhân. Để giải quyết điều này, ẩn danh hóa đơn giản bằng cách xóa các định danh trực tiếp như họ tên, số đăng ký cư trú đã được dùng từ lâu, nhưng trong thực tế các sự cố cá nhân bị xác định lại chỉ với cách này đã lặp đi lặp lại. Cốt lõi của vấn đề là sức mạnh xác định cá nhân không nằm ở một định danh duy nhất, mà ở sự kết hợp của nhiều bán định danh (quasi-identifier) như giới tính, ngày sinh, mã bưu chính, và ở sự liên kết với các dữ liệu đã công khai bên ngoài. Do đó, phi định danh ngày nay phải được thiết kế và kiểm chứng từ góc độ rủi ro tái định danh, tức là "có thể tìm lại cá nhân từ dữ liệu còn lại hay không", chứ không phải "đã xóa những gì".

Biện pháp phi định danh tự nó không phải là mục đích mà là cơ chế cân bằng điều hòa hai giá trị xung đột: khai thác dữ liệu và bảo vệ thông tin cá nhân. Xử lý quá mạnh sẽ làm mất tính hữu ích phân tích (utility) của dữ liệu khiến không đạt được mục đích khai thác, ngược lại xử lý lỏng lẻo sẽ để lại rủi ro tái định danh và phải gánh trách nhiệm pháp lý, đạo đức. Kỹ sư chuyên nghiệp (Professional Engineer) không nên dừng ở việc liệt kê ưu nhược của từng thuật toán, mà phải thiết kế cơ chế quản trị tổng hợp mục đích xử lý, độ nhạy cảm dữ liệu, môi trường sử dụng (khai thác nội bộ vs công khai ra ngoài) và mức chấp nhận rủi ro còn lại để phán đoán mức bảo vệ phù hợp và văn bản hóa căn cứ đó.

2. Quy trình xử lý phi định danh và các loại thông tin

2.1 Quy trình xử lý tổng thể

«Hướng dẫn xử lý thông tin bí danh» (Ủy ban Bảo vệ Thông tin Cá nhân, sửa đổi 2/2024) và «Hướng dẫn biện pháp phi định danh thông tin cá nhân» trước đây của Hàn Quốc quy định phi định danh không phải là một phép biến đổi một lần mà là quy trình tuần hoàn rà soát trước → xử lý → rà soát tính thích đáng → quản lý an toàn. Điều này có nghĩa phi định danh không phải công việc kết thúc sau khi gia công dữ liệu một lần, mà là hoạt động kiểm soát phải đo lại rủi ro của kết quả và liên tục quản lý để không có nỗ lực tái định danh.

flowchart LR
    A["Rà soát trước (mục đích·căn cứ pháp lý·phạm vi xử lý)"] --> B["Xử lý bí danh·phi định danh (loại bỏ·biến đổi định danh)"]
    B --> C["Rà soát tính thích đáng (đánh giá rủi ro tái định danh)"]
    C -->|"Rủi ro cao"| B
    C -->|"Rủi ro chấp nhận được"| D["Khai thác·cung cấp (phân tích nội bộ·kết hợp·công khai)"]
    D --> E["Quản lý sau (giám sát tái định danh·hủy)"]
    E -.->|"Dấu hiệu tái định danh"| A

Ở giai đoạn rà soát trước, làm rõ mục đích xử lý và áp dụng tối thiểu hóa dữ liệu, chỉ giữ lại các mục tối thiểu cần cho mục đích đó. Phán đoán cốt lõi ở giai đoạn này là mục đích có nằm trong phạm vi Điều 28-2 Luật Bảo vệ thông tin cá nhân cho phép như thống kê, nghiên cứu, huấn luyện AI hay không, và đã có biện pháp kiểm soát loại trừ nỗ lực nhận ra một cá nhân cụ thể hay chưa. Ở giai đoạn xử lý, kết hợp năm kỹ thuật sẽ trình bày ở phần sau để giảm rủi ro nhận diện, nhưng phải giảm đồng thời cả rủi ro kết hợp của các bán định danh thì mới là phi định danh hiệu quả. Rà soát tính thích đáng định lượng xem kết quả xử lý có thực sự chống chịu được tái định danh hay không bằng các mô hình như k-anonymity, và nếu chưa đạt thì quay lại giai đoạn xử lý, tạo thành cấu trúc lặp. Ở giai đoạn quản lý sau, duy trì liên tục các biện pháp kiểm soát quản lý như giám sát nỗ lực tái định danh, kiểm soát truy cập, hủy sau khi đạt mục đích sử dụng, dừng xử lý và thông báo ngay khi xảy ra tái định danh.

2.2 Phân loại các mục dữ liệu

Để thiết kế phi định danh, trước hết phải phân biệt vai trò của từng cột trong việc tái định danh. Bởi cùng một cách xử lý nhưng mức đóng góp rủi ro và chiến lược xử lý hoàn toàn khác nhau tùy đối tượng là định danh, bán định danh hay thông tin nhạy cảm.

Loại Định nghĩa Ví dụ Hướng xử lý cơ bản
Định danh (Identifier) Tự nó xác định cá nhân Họ tên, số đăng ký cư trú, số điện thoại di động Về nguyên tắc xóa·xử lý bí danh
Bán định danh (Quasi-identifier) Xác định cá nhân khi kết hợp Giới tính, ngày sinh, mã bưu chính, nghề nghiệp Giảm rủi ro bằng phân nhóm·tổng quát hóa
Thông tin nhạy cảm (Sensitive Attribute) Xâm phạm quyền riêng tư khi bị lộ Bệnh tật, thu nhập, tôn giáo, khuynh hướng chính trị Bảo vệ tính đa dạng·phân phối giá trị
Thuộc tính không liên quan Không liên quan đến việc xác định cá nhân Mùa, danh mục sản phẩm Nhìn chung giữ nguyên gốc

Ở đây, đặc biệt quan trọng là bán định danh. Năm 1997 tại Mỹ, Sweeney (L. Sweeney) đã tái định danh được thống đốc bang chỉ bằng giới tính, ngày sinh và mã bưu chính (ZIP) từ hồ sơ y tế công chức bang Massachusetts đã công khai, và chỉ ra rằng chỉ với tổ hợp ba mục này có thể xác định duy nhất khoảng 87% dân số Mỹ. Ví dụ này phá vỡ quan niệm "đã xóa định danh trực tiếp thì an toàn" và trở thành động lực trực tiếp cho sự ra đời của mô hình bảo vệ định lượng đối với tổ hợp bán định danh (k-anonymity).

3. Năm kỹ thuật phi định danh

Hướng dẫn của Hàn Quốc đưa ra các kỹ thuật xử lý phi định danh theo năm nhóm lớn. Mỗi kỹ thuật riêng lẻ không bảo đảm an toàn hoàn toàn, và nguyên tắc là kết hợp áp dụng phù hợp với vai trò và rủi ro của từng mục dữ liệu.

Xử lý bí danh (Pseudonymization) là kỹ thuật thay định danh bằng giá trị khác để che giấu giá trị gốc, chẳng hạn đổi tên "Hong Gil-dong" thành số thứ tự ngẫu nhiên hoặc biệt danh. Có các cách mã hóa, token hóa, bảng ánh xạ; điểm khác biệt với các kỹ thuật khác là nếu lưu tách riêng thông tin bổ sung (khóa bí danh) có thể đảo ngược ánh xạ thì có thể liên kết lại khi cần. Do đó, thông tin bí danh ở trạng thái "không thể nhận ra cá nhân cụ thể nếu không có thông tin bổ sung", khác với thông tin ẩn danh hoàn toàn, về mặt pháp lý vẫn kéo theo nghĩa vụ biện pháp an toàn tương đương thông tin cá nhân.

Xử lý tổng hợp (Aggregation) là cách chuyển thành giá trị thống kê như tổng, trung bình, giá trị lớn nhất thay cho từng bản ghi, loại bỏ quan sát ở mức cá nhân. Chẳng hạn, thay thu nhập từng người bằng thu nhập trung bình theo khu vực, độ tuổi thì khó truy vết cá nhân, nhưng ở nhóm có rất ít mẫu, chỉ giá trị trung bình cũng có thể suy ngược ra giá trị cá nhân, nên phải kiểm soát đồng thời đơn vị tổng hợp tối thiểu.

Xóa dữ liệu (Data Reduction) là cách loại bỏ hẳn các mục có rủi ro nhận diện cao hoặc giá trị ngoại lai (outlier). Số ít giá trị ngoại lai như người rất cao tuổi hay thu nhập rất cao tự nó có tính duy nhất cao và trở thành điểm xuất phát của tái định danh, vì vậy cần xử lý cắt bỏ giá trị đặc biệt ở hai đầu hoặc xóa một phần.

Phân nhóm dữ liệu (Generalization) là kỹ thuật cốt lõi gộp giá trị cụ thể thành khoảng hoặc nhóm để giảm tính duy nhất. Tổng quát hóa "1985-03-21" thành "sinh thập niên 1980", "Seoul Gangnam-gu Yeoksam-dong" thành "Seoul" sẽ làm tăng số người có cùng giá trị, khiến việc xác định cá nhân trở nên khó khăn, và đây là phương tiện chính để đạt k-anonymity được trình bày ở phần sau.

Che dữ liệu (Masking) là cách che một phần giá trị bằng dấu sao, tiêu biểu là xử lý phần sau của số đăng ký cư trú hoặc phần giữa số điện thoại bằng *. Dễ áp dụng ngay trên màn hình hiển thị và môi trường vận hành, nhưng nếu phần bị che có thể suy ra từ dữ liệu khác thì hiệu quả bảo vệ bị hạn chế.

4. Các mô hình bảo vệ quyền riêng tư: k-anonymity, l-diversity, t-closeness

Dù xử lý phi định danh đến đâu, nếu không có tiêu chí để phán đoán "như vậy đã an toàn chưa" thì việc xử lý sẽ trở nên tùy tiện. Mô hình bảo vệ quyền riêng tư là thước đo phán định định lượng rủi ro tái định danh, và đã phát triển theo hướng k-anonymity → l-diversity → t-closeness, mô hình sau bổ khuyết lỗ hổng của mô hình trước.

flowchart TB
    K["k-anonymity (kích thước lớp tương đương ≥ k)"] -->|"Không phòng được tấn công đồng nhất·kiến thức nền"| L["l-diversity (số loại giá trị nhạy cảm ≥ l)"]
    L -->|"Không phòng được tấn công lệch·tương tự"| T["t-closeness (khoảng cách phân phối ≤ t)"]
    K -.-> R1["Phòng tái định danh qua tổ hợp bán định danh"]
    L -.-> R2["Phòng suy luận thuộc tính nhạy cảm"]
    T -.-> R3["Phòng suy luận do phân phối lệch"]

4.1 k-anonymity (k-ẩn danh)

k-anonymity là mô hình định lượng đầu tiên do Sweeney đưa ra năm 2002, với mục tiêu làm cho trong tập dữ liệu luôn tồn tại từ k bản ghi trở lên có cùng giá trị bán định danh. Nhóm bản ghi chia sẻ cùng tổ hợp bán định danh được gọi là lớp tương đương (equivalence class); nếu kích thước nhỏ nhất của lớp tương đương là k, kẻ tấn công chỉ có thể thu hẹp một cá nhân cụ thể thành một trong k người trong lớp đó. Ví dụ, với k=5, số người thuộc tổ hợp "sinh thập niên 1980, Seoul, nam" luôn từ 5 trở lên, nên chỉ với bán định danh thì xác suất tái định danh bị giới hạn ở mức 1/5 trở xuống.

Giá trị k càng lớn thì bảo vệ càng mạnh nhưng phân nhóm và xóa càng nhiều, làm giảm tính hữu ích của dữ liệu, vì vậy k là tham số đánh đổi tiêu biểu giữa bảo vệ và khai thác. Tuy nhiên, k-anonymity có giới hạn căn bản là chỉ kiểm soát bán định danh mà không xét đến bản thân giá trị của thông tin nhạy cảm. Nếu bệnh của cả 5 người trong một lớp tương đương đều là "ung thư dạ dày", kẻ tấn công chỉ cần biết đối tượng thuộc lớp đó là có thể suy ra bệnh với độ chắc chắn 100% (tấn công đồng nhất, homogeneity attack). Ngoài ra, nếu kẻ tấn công có thể loại trừ các giá trị cụ thể nhờ kiến thức nền, các ứng viên còn lại sẽ bị thu hẹp nhanh chóng (tấn công kiến thức nền, background knowledge attack).

4.2 l-diversity (l-đa dạng)

l-diversity là mô hình bổ sung do Machanavajjhala và cộng sự đề xuất năm 2007, yêu cầu mỗi lớp tương đương chứa từ l giá trị phân biệt rõ ràng trở lên đối với thông tin nhạy cảm. Mô hình này giảm thiểu tấn công đồng nhất và tấn công kiến thức nền bằng cách buộc tính đa dạng của thuộc tính nhạy cảm mà k-anonymity bỏ ngỏ. Tức là làm cho bệnh của 5 người "sinh thập niên 1980, Seoul, nam" không dồn vào mỗi ung thư dạ dày mà phân bố ít nhất l loại, để chỉ với sự trực thuộc thì không thể khẳng định bệnh.

Tuy nhiên, l-diversity cũng chỉ nhìn vào "số loại" giá trị mà không xét được phân phối và sự tương tự về ngữ nghĩa. Dù trong lớp tương đương có ba loại ung thư dạ dày, ung thư gan, ung thư phổi thỏa mãn l=3, sự thật nhạy cảm rằng tất cả đều là "ung thư" vẫn bị lộ nguyên vẹn (tấn công tương tự, similarity attack). Ngoài ra, nếu 9 trong 10 người bị ung thư dạ dày và chỉ 1 người bị cảm thì tuy có hai loại, thực tế xác suất là ung thư dạ dày áp đảo nên việc bảo vệ bị vô hiệu hóa (tấn công lệch, skewness attack).

4.3 t-closeness (t-gần kề)

t-closeness là mô hình do Li (N. Li) và cộng sự đưa ra năm 2007, giới hạn để phân phối của thông tin nhạy cảm trong mỗi lớp tương đương chỉ chênh lệch không quá t so với phân phối của toàn bộ tập dữ liệu. Khoảng cách giữa các phân phối thường được đo bằng thước đo như EMD (Earth Mover's Distance); t càng nhỏ thì phân phối của từng lớp càng giống trung bình toàn thể, làm giảm thông tin bổ sung thu được từ sự trực thuộc. Nhờ đó có thể kiểm soát cả tấn công lệch và tấn công tương tự mà l-diversity không chặn được, cung cấp mức bảo vệ mạnh nhất trong ba mô hình.

Tuy nhiên, để điều chỉnh phân phối giống với toàn thể cần nhiều biến dạng và phân nhóm tương ứng, nên tổn thất tính hữu ích dữ liệu là lớn nhất và chi phí tính toán cũng cao. Vì vậy, trong thực tế, thay vì chọn loại trừ lẫn nhau giữa ba mô hình, cách thiết kế theo giai đoạn phổ biến là lấy k làm cơ bản và áp dụng thêm l, t khi thuộc tính nhạy cảm quan trọng, tùy tính chất thông tin nhạy cảm và mục đích khai thác.

Mô hình Tấn công cần phòng Đối tượng kiểm soát Giới hạn
k-anonymity Tái định danh qua tổ hợp bán định danh Kích thước lớp tương đương Tấn công đồng nhất·kiến thức nền
l-diversity Tấn công đồng nhất·kiến thức nền Số loại giá trị nhạy cảm Tấn công tương tự·lệch
t-closeness Tấn công tương tự·lệch Khoảng cách phân phối giá trị nhạy cảm Tổn thất tính hữu ích·chi phí tính toán

5. So sánh và các vụ tái định danh thực tế

Khác biệt giữa ba mô hình bắt nguồn từ "kiểm soát cái gì". k-anonymity chỉ nhìn kích thước nhóm của bán định danh nên vẫn vượt qua dù giá trị nhạy cảm bị lệch về một phía; l-diversity buộc số loại giá trị nhưng không xét đến phân phối và ngữ nghĩa; t-closeness điều chỉnh bản thân phân phối cho khớp với toàn thể nên mạnh nhất nhưng tổn thất tính hữu ích lớn. Do đó, với dữ liệu mà thuộc tính nhạy cảm là trọng tâm phân tích như bệnh tật, thu nhập, cần kiểm soát thuộc dòng t-closeness, còn với khai thác chủ yếu dựa trên bán định danh thì chỉ một giá trị k thích hợp cũng có thể bảo vệ hiệu quả.

Các sự cố thực tế cho thấy đồng thời sự cần thiết và giới hạn của phi định danh. Năm 2006, AOL tại Mỹ công khai khoảng 20 triệu bản ghi nhật ký tìm kiếm cho mục đích nghiên cứu sau khi đổi định danh người dùng thành số ngẫu nhiên, nhưng chỉ từ tổ hợp từ khóa tìm kiếm (tìm địa danh, tên, bệnh, v.v.) mà một cá nhân cụ thể đã bị báo chí tái định danh và dữ liệu lập tức bị thu hồi. Năm 2008, Narayanan và Shmatikov kết hợp dữ liệu đánh giá phim ẩn danh do Netflix công khai với đánh giá IMDb công khai và tái định danh được nhiều thuê bao, qua đó chứng minh thực nghiệm rủi ro kết hợp với dữ liệu bên ngoài của thông tin bán định danh. Tại Hàn Quốc, khi nhu cầu kết hợp dữ liệu của nhiều cơ quan để khai thác tăng lên, đã có quy định thể chế hóa việc kết hợp an toàn thông tin bí danh của các bên xử lý thông tin cá nhân khác nhau thông qua tổ chức chuyên trách kết hợp do Ủy ban Bảo vệ Thông tin Cá nhân chỉ định, và rà soát tính thích đáng trước khi mang dữ liệu ra ngoài.

6. Chuyên sâu: Ngoại lệ đối với thông tin bí danh và xu hướng mới nhất

Với việc sửa đổi Ba luật về dữ liệu năm 2020 tại Hàn Quốc, khái niệm thông tin bí danh được đưa vào Luật Bảo vệ thông tin cá nhân, tạo ra ngoại lệ cho phép xử lý thông tin bí danh mà không cần sự đồng ý của chủ thể dữ liệu, giới hạn ở mục đích lập thống kê, nghiên cứu khoa học và lưu trữ hồ sơ vì lợi ích công cộng. Đây là bước ngoặt nâng phi định danh từ mức hướng dẫn tự nguyện lên thành chế định pháp luật, gán căn cứ pháp lý và nghĩa vụ cho toàn bộ quá trình xử lý bí danh → khai thác → kết hợp → biện pháp an toàn. Thông tin bí danh khác với thông tin ẩn danh hoàn toàn ở chỗ vẫn là đối tượng quản lý, nên bắt buộc các biện pháp an toàn như lưu tách riêng thông tin bổ sung, cấm tái định danh, dừng xử lý và thông báo khi xảy ra tái định danh.

Môi trường công nghệ cũng thay đổi nhanh chóng. «Hướng dẫn xử lý thông tin bí danh» của Ủy ban Bảo vệ Thông tin Cá nhân Hàn Quốc, qua lần sửa đổi tháng 2/2024, đã vượt ra ngoài dữ liệu có cấu trúc (bảng) hiện có để đề cập mới phương pháp xử lý bí danh cho dữ liệu phi cấu trúc như giọng nói, hình ảnh, video và phương án khai thác cho huấn luyện AI. Với dữ liệu phi cấu trúc, bản thân khuôn mặt, giọng nói trở thành định danh nên cần các kỹ thuật chuyên biệt theo miền như che, làm mờ, tổng hợp, và với dữ liệu huấn luyện AI quy mô lớn còn phải xét đến rủi ro mới là mô hình ghi nhớ (memorization) dữ liệu huấn luyện rồi làm rò rỉ, chứ không chỉ từng bản ghi riêng lẻ. Ngoài ra, trong khi dòng k-anonymity "giả định kiến thức nền của kẻ tấn công ở mức hạn chế", quyền riêng tư vi sai (Differential Privacy) đã được đề cập ở chủ đề riêng trước đó cung cấp bảo đảm toán học không cần giả định kiến thức nền, nên xu hướng là xem xét cả hai một cách bổ trợ lẫn nhau. Về hướng ra đề dự kiến, các câu hỏi dạng bài luận thường yêu cầu: "quan hệ giữa năm kỹ thuật phi định danh và ba mô hình quyền riêng tư", "thủ tục kết hợp thông tin bí danh và vai trò của tổ chức chuyên trách kết hợp", "so sánh phi định danh và quyền riêng tư vi sai", "xử lý bí danh dữ liệu phi cấu trúc và dữ liệu huấn luyện AI".

7. Các điểm cần cân nhắc và hàm ý

Từ góc độ Kỹ sư chuyên nghiệp, phi định danh không phải là việc lựa chọn kỹ thuật mà là ra quyết định dựa trên rủi ro, và cần xem xét tổng hợp các điểm sau.

  • Phán đoán dựa trên rủi ro về mức bảo vệ phù hợp: Giá trị k, l, t càng lớn càng an toàn nhưng hy sinh tính hữu ích, vì vậy phải xác định dựa trên mục đích xử lý, độ nhạy cảm dữ liệu, môi trường sử dụng (khai thác nội bộ khép kín vs công khai ra ngoài), mức chấp nhận rủi ro còn lại và văn bản hóa căn cứ phán đoán. Công khai ra ngoài đòi hỏi k cao hơn nhiều và mô hình mạnh hơn so với khai thác nội bộ.

  • Quản lý đánh đổi giữa tính khai thác và bảo vệ: Phân nhóm và xóa quá mức làm méo mó kết quả phân tích, dẫn đến ra quyết định sai, vì vậy cần đo đồng thời các chỉ số tính hữu ích dữ liệu (tỷ lệ mất thông tin, độ chính xác phân tích) và hướng tới xử lý tối thiểu cần thiết để đạt mục đích.

  • Kiểm soát thường xuyên rủi ro kết hợp và dữ liệu bên ngoài: Như trường hợp Netflix và AOL, tái định danh thường phát sinh từ kết hợp dữ liệu bên ngoài, nên việc kết hợp phải được kiểm soát qua tổ chức chuyên trách kết hợp được chỉ định, và ngay cả sau khi công khai vẫn phải đánh giá lại rủi ro tái định danh khi xuất hiện dữ liệu công khai mới.

  • Quản trị theo vòng đời và quản lý sau: Phi định danh không phải biến đổi một lần mà là vòng tuần hoàn rà soát trước – xử lý – rà soát tính thích đáng – quản lý sau, vì vậy phải nội tại hóa kiểm soát truy cập, giám sát nỗ lực tái định danh, hủy sau khi đạt mục đích và thủ tục ứng phó khi xảy ra tái định danh vào hệ thống bảo vệ thông tin cá nhân của tổ chức.

  • Chiến lược kết hợp với công nghệ liên quan: Vì một mô hình đơn lẻ không thể chặn mọi rủi ro, cần kết hợp xử lý bí danh, phân nhóm, che dữ liệu, và khi thuộc tính nhạy cảm là trọng tâm hoặc dự kiến có truy vấn lặp lại thì thiết kế phòng thủ nhiều lớp áp dụng cùng lúc quyền riêng tư vi sai và PET (công nghệ tăng cường bảo vệ quyền riêng tư).

Tài liệu tham khảo


Tóm tắt một câu: Cốt lõi là giảm rủi ro nhận diện bằng các biện pháp phi định danh (xử lý bí danh, tổng hợp, xóa, phân nhóm, che dữ liệu), kiểm chứng định lượng rủi ro tái định danh bằng k-anonymity (kích thước nhóm), l-diversity (số loại giá trị), t-closeness (phân phối giá trị), đồng thời quản trị theo vòng đời để quản lý dựa trên rủi ro đối với rủi ro kết hợp/dữ liệu bên ngoài và tổn thất tính hữu ích.