← Về danh sách
AI & Dữ liệu
#합성데이터#SyntheticData#프라이버시#차분프라이버시#데이터증강#생성모델
Cập nhật lần cuối · 2026-09-23

Dữ liệu tổng hợp (Synthetic Data)

1. Tổng quan

Định nghĩa: Dữ liệu tổng hợp (Synthetic Data) không phải là dữ liệu gốc thu thập trực tiếp từ thế giới thực, mà là dữ liệu được tạo ra một cách nhân tạo bằng cách học hoặc mô phỏng thông qua quy tắc, giả lập các phân phối thống kê, tương quan và đặc tính cấu trúc của dữ liệu gốc. Nó được thiết kế sao cho không chỉ định bất kỳ cá thể thực tồn tại nào nhưng vẫn có tính hữu dụng (utility) tương tự dữ liệu gốc cho mục đích phân tích và huấn luyện.

Bối cảnh khiến dữ liệu tổng hợp nổi lên nằm ở sự căng thẳng cơ bản giữa khai thác dữ liệu và bảo vệ thông tin cá nhân. Trong ngành AI và dữ liệu, lượng và chất lượng dữ liệu huấn luyện quyết định hiệu năng mô hình, nhưng dữ liệu chất lượng cao lại khó sử dụng tự do vì các quy định như Luật Bảo vệ thông tin cá nhân (Hàn Quốc), GDPR, bí mật kinh doanh và chi phí thu thập. Các biện pháp phi định danh (bí danh hóa, ẩn danh hóa) khó cân bằng giữa rủi ro tái định danh và mất mát thông tin, và gặp nghịch lý là càng xóa dữ liệu thì tính hữu dụng càng giảm mạnh. Dữ liệu tổng hợp vượt qua nghịch lý này bằng cách tiếp cận không phải “biến đổi dữ liệu gốc” mà là “tạo dữ liệu mới giống dữ liệu gốc về mặt thống kê”.

Thêm vào đó, vấn đề cạn kiệt dữ liệu thực chất lượng cao cũng thúc đẩy dữ liệu tổng hợp. Văn bản và hình ảnh chất lượng cao có thể thu thập trên Internet là hữu hạn, và mối lo ngại rằng các mô hình quy mô lớn đang nhanh chóng tiêu thụ hết chúng ngày càng lớn. Dữ liệu thu thập bằng web crawling còn mang rủi ro tranh chấp bản quyền và giấy phép, nên giá trị chiến lược của dữ liệu tổng hợp — có thể kiểm soát điều kiện sinh để tạo ra chất lượng và chủ đề mong muốn — trở nên tương đối cao hơn.

Một bối cảnh khác là vấn đề mất cân bằng và khan hiếm dữ liệu. Những sự kiện rất hiếm khi xảy ra trong thực tế như giao dịch gian lận, lỗi sản xuất, bệnh hiếm thiếu dữ liệu huấn luyện nên mô hình không học được đúng cách. Trong xe tự hành, việc thu thập thực tế các tình huống cực đoan (corner case) như trẻ em bất ngờ lao ra đường gần như là không thể. Dữ liệu tổng hợp được dùng để cố ý sinh hàng loạt các kịch bản hiếm nhằm tăng cường dữ liệu (augmentation) và bổ sung các trường hợp biên (edge case). Gartner từng dự báo rằng vào khoảng năm 2030, một phần đáng kể dữ liệu dùng để huấn luyện mô hình AI sẽ được thay thế bằng dữ liệu tổng hợp, và thực tế việc sử dụng corpus tổng hợp trong huấn luyện mô hình ngôn ngữ lớn (LLM) cũng đang tăng nhanh.

Các đặc điểm chính của dữ liệu tổng hợp là ① duy trì tính tương đồng thống kê với dữ liệu gốc trong khi từng bản ghi không tương ứng 1:1 với người thực, ② có thể mở rộng và sinh không giới hạn theo nhu cầu, ③ có thể gán nhãn ngay tại thời điểm sinh nên giảm chi phí gán nhãn (annotation), ④ có thể điều chỉnh điều kiện sinh để kiểm soát phân phối (controllable generation).

Những đặc điểm này biến dữ liệu tổng hợp không đơn thuần là “dữ liệu giả” mà là phương tiện chiến lược cho việc tài sản hóa và lưu thông dữ liệu. Vì có thể chia sẻ giá trị của dữ liệu gốc với bên ngoài mà không cần di chuyển hay chia sẻ trực tiếp dữ liệu gốc, nó cùng hướng với việc khai thác dữ liệu an toàn mà các chính sách kinh tế dữ liệu như 3 luật dữ liệu và MyData của Hàn Quốc hướng tới. Tuy nhiên, như sẽ trình bày ở phần sau, nhận thức “vì là dữ liệu tổng hợp nên chắc chắn không phải thông tin cá nhân” là nguy hiểm, và cần hiểu trên tiền đề rằng địa vị pháp lý và kỹ thuật của nó thay đổi tùy theo chất lượng sinh và rủi ro tái định danh.

2. Cấu trúc tổng thể và các loại hình sinh dữ liệu tổng hợp

Pipeline sinh dữ liệu tổng hợp gồm giai đoạn học hoặc định nghĩa phân phối của dữ liệu gốc, giai đoạn lấy mẫu từ phân phối đó để sinh dữ liệu, và giai đoạn đánh giá tính hữu dụng, quyền riêng tư và độ trung thực của sản phẩm sinh ra. Sơ đồ khái niệm dưới đây thể hiện luồng tổng thể.

graph LR
    A["Dữ liệu gốc<br/>(nhạy cảm·hiếm·thiếu)"] --> B["Học phân phối / Định nghĩa quy tắc"]
    B --> C["Mô hình sinh<br/>(GAN·VAE·Diffusion v.v.)"]
    C --> D["Sinh dữ liệu tổng hợp"]
    D --> E["Đánh giá chất lượng<br/>(trung thực·hữu dụng·riêng tư)"]
    E -->|Đạt| F["Sử dụng: huấn luyện·phân tích·chia sẻ·kiểm thử"]
    E -->|Không đạt| B
    F --> G["Giám sát rủi ro tái định danh·suy luận thành viên"]

Diễn giải pipeline sinh thành quy trình như sau. Thứ nhất, ở giai đoạn định nghĩa yêu cầu, xác định mục tiêu: tạo cái gì (cột, nhãn, kịch bản nào), tại sao (kiểm thử, huấn luyện, chia sẻ), và ở mức quyền riêng tư, độ trung thực nào. Thứ hai, ở bước phân tích và tiền xử lý dữ liệu gốc, nắm bắt giá trị thiếu, giá trị ngoại lai, loại cột (phân loại/liên tục/chuỗi thời gian) và nhận diện các trường nhạy cảm. Thứ ba, ở bước lựa chọn phương thức và mô hình sinh, chọn kỹ thuật phù hợp với loại dữ liệu và mục tiêu, và (khi cần) kết hợp differential privacy. Thứ tư, ở bước sinh và hậu xử lý, áp đặt các ràng buộc (ví dụ quy tắc toàn vẹn như tuổi từ 0~120, tổng phải khớp). Thứ năm, ở bước đánh giá và kiểm chứng, đo độ trung thực, tính hữu dụng và quyền riêng tư, nếu không đạt mục tiêu thì quay lại bước trước. Thứ sáu, ở bước triển khai và giám sát, ghi lại phiên bản và dòng dõi của bộ dữ liệu, liên tục theo dõi rủi ro tái định danh. Điều quan trọng là quy trình này không phải một lần mà là cấu trúc tuần hoàn lặp lại theo kết quả đánh giá.

Dữ liệu tổng hợp được chia thành ba nhánh lớn theo phương thức sinh. Thứ nhất là sinh dựa trên quy tắc và thống kê, tạo dữ liệu bằng quy tắc do chuyên gia lĩnh vực định nghĩa, phân phối xác suất (chuẩn, Poisson v.v.), hoặc phân phối biên và ma trận tương quan của dữ liệu gốc. Dễ hiện thực và có thể giải thích, nhưng khó thể hiện các quan hệ phi tuyến phức tạp giữa các biến. Thứ hai là sinh dựa trên mô phỏng và agent, dựng môi trường ảo bằng physics engine, game engine hoặc digital twin để tạo dữ liệu cảm biến và hình ảnh. Đặc biệt hữu ích trong xe tự hành và robot. Thứ ba là dựa trên mô hình sinh học sâu, trong đó GAN, VAE, mô hình khuếch tán (Diffusion) và transformer (LLM) học phân phối đồng thời (joint distribution) của dữ liệu gốc để sinh chân thực cả dữ liệu nhiều chiều và phi cấu trúc.

Bảng dưới đây so sánh đặc tính của ba nhánh. Tuy nhiên, bảng chỉ là công cụ hỗ trợ tổng hợp, còn việc mỗi phương thức có lợi khi nào và tại sao sẽ được giải thích trong các đoạn tiếp theo.

Phương thức Kỹ thuật tiêu biểu Điểm mạnh Điểm yếu Dữ liệu phù hợp
Quy tắc·Thống kê Lấy mẫu phân phối, copula Có thể giải thích·Chi phí thấp Hạn chế biểu diễn quan hệ phức tạp Có cấu trúc (bảng)
Mô phỏng Physics engine, digital twin Nhãn tự động·Edge case Khác biệt với thực tế (domain gap) Hình ảnh·Cảm biến
Sinh học sâu GAN, VAE, Diffusion, LLM Độ trung thực cao·Phi cấu trúc Khó huấn luyện·Sụp đổ mode Ảnh·Văn bản·Chuỗi thời gian

Phương thức dựa trên quy tắc và thống kê phù hợp với dữ liệu kiểm thử ban đầu hoặc dữ liệu giả (dummy) cho phát triển phần mềm, nơi thông tin cá nhân hầu như không liên quan. Ví dụ, khi tạo 100 triệu bản ghi giao dịch ảo để kiểm thử tải hiệu năng cho hệ thống tài chính, chỉ cần tuân theo sơ bộ phân phối khách hàng thực là đủ nên phương thức thống kê là kinh tế. Ngược lại, để huấn luyện mô hình phát hiện gian lận thì phải tái hiện cả những tương quan tinh tế giữa giao dịch bình thường và bất thường, nên cần sinh bằng học sâu.

Lý do phương thức mô phỏng có lợi là có thể biết chính xác nhãn ngay tại thời điểm sinh. Người đi bộ và phương tiện được kết xuất trong môi trường ảo đã có sẵn thông tin vị trí, khoảng cách, tốc độ và che khuất (occlusion) theo từng pixel, nên chi phí gán nhãn thủ công vẽ bounding box gần như bằng 0. Để con người gán nhãn 1 triệu ảnh đường thực tế cần chi phí và thời gian khổng lồ, còn mô phỏng tự động sinh quy mô tương tự. Như vậy, việc lựa chọn phương thức sinh là hàm số của ba trục “loại dữ liệu (có cấu trúc/phi cấu trúc)” và “độ trung thực, độ chính xác nhãn, chi phí yêu cầu”, và trong thực tế thường kết hợp nhiều phương thức thay vì chỉ khăng khăng một phương thức.

3. Kiến trúc tổng hợp dựa trên mô hình sinh học sâu

Cốt lõi của dữ liệu tổng hợp dựa trên học sâu là mô hình sinh xấp xỉ phân phối xác suất của dữ liệu gốc. Sơ đồ chi tiết kiến trúc dưới đây đối chiếu nguyên lý sinh của họ GAN và họ mô hình khuếch tán tiêu biểu.

flowchart TB
    subgraph GAN["Họ GAN"]
        Z1["Vector tiềm ẩn z"] --> GEN["Bộ sinh G"]
        GEN --> FAKE["Mẫu giả"]
        REAL1["Mẫu thật"] --> DISC["Bộ phân biệt D"]
        FAKE --> DISC
        DISC -->|"Phán định thật/giả"| LOSS1["Hàm mất mát đối kháng"]
        LOSS1 -->|Lan truyền ngược| GEN
    end
    subgraph DIFF["Họ mô hình khuếch tán"]
        REAL2["Mẫu thật"] -->|"Chiều thuận (thêm nhiễu)"| NOISE["Nhiễu Gauss"]
        NOISE -->|"Chiều nghịch (khử nhiễu)"| DENOISE["U-Net khử nhiễu"]
        DENOISE --> GEN2["Mẫu tổng hợp được phục hồi"]
    end

Ba họ mô hình có nguyên lý sinh khác nhau về căn bản, và chính sự khác biệt này tạo nên điểm mạnh và điểm yếu. GAN thu được mẫu sắc nét (sharp) nhờ cạnh tranh với bộ phân biệt nhưng huấn luyện không ổn định; VAE ổn định nhờ không gian tiềm ẩn xác suất nhưng mờ; mô hình khuếch tán cho chất lượng cao nhất nhờ khử nhiễu nhiều bước nhưng tốc độ sinh chậm. Không có mô hình nào là vạn năng, nên phải lựa chọn dựa trên sự cân bằng giữa chất lượng yêu cầu và chi phí, tốc độ sinh.

GAN (Generative Adversarial Network) được huấn luyện thông qua cạnh tranh giữa bộ sinh (Generator) và bộ phân biệt (Discriminator). Bộ sinh tạo dữ liệu giả từ vector tiềm ẩn, còn bộ phân biệt cố gắng phân biệt đó là thật hay giả. Khi hai mạng nơ-ron hội tụ về điểm cân bằng (cân bằng Nash) theo cách đối kháng, bộ sinh dần tạo ra dữ liệu khó phân biệt với dữ liệu gốc. Với dữ liệu bảng có cấu trúc, CTGAN (Conditional Tabular GAN) được chuyên biệt hóa để xử lý cột hỗn hợp phân loại/liên tục và phân phối mất cân bằng, được sử dụng rộng rãi. Tuy nhiên, GAN huấn luyện không ổn định và có rủi ro sụp đổ mode (mode collapse) — chỉ lặp lại việc sinh một số mẫu nhất định — nên việc tinh chỉnh siêu tham số khá khó khăn.

Lấy CTGAN làm ví dụ, các cột liên tục như doanh thu, tuổi thường có phân phối đa đỉnh (multi-modal) nên chuẩn hóa đơn giản sẽ làm méo biểu diễn. CTGAN biểu diễn giá trị theo từng cột bằng hỗn hợp nhiều phân phối chuẩn (mode-specific normalization) và đưa vào lấy mẫu có điều kiện (conditional vector) để các phân loại hiếm không bị bỏ sót trong huấn luyện, qua đó giảm mất cân bằng. Bài học thực tiễn là phải có thiết kế chuyên biệt cho lĩnh vực như vậy thì mới bảo đảm được tính hữu dụng của dữ liệu bảng thực, còn nếu dùng nguyên GAN đa dụng thì hiệu năng giảm mạnh.

VAE (Variational Autoencoder) mã hóa dữ liệu vào không gian tiềm ẩn chiều thấp, sau đó lấy mẫu từ phân phối tiềm ẩn đó và phục hồi (giải mã) lại. Huấn luyện ổn định hơn GAN và không gian tiềm ẩn liên tục nên phép nội suy (interpolation) tự nhiên, nhưng sản phẩm sinh ra có xu hướng hơi mờ (blurry). Dù vậy, nhờ tính ổn định và khả năng diễn giải của không gian tiềm ẩn, VAE vẫn được sử dụng rộng rãi làm nền tảng cho việc học phân phối chuẩn trong phát hiện bất thường hoặc sinh có điều kiện.

Mô hình khuếch tán (Diffusion Model) được huấn luyện để dần dần thêm nhiễu vào dữ liệu gốc cho đến khi thành nhiễu hoàn toàn (quá trình thuận), rồi ngược lại loại bỏ từng bước nhiễu để phục hồi dữ liệu (quá trình nghịch). Hiện nay mô hình này cho thấy độ trung thực và tính đa dạng cao nhất trong tổng hợp hình ảnh và trở thành nền tảng của sinh văn bản-hình ảnh như Stable Diffusion. Gần đây, các nghiên cứu áp dụng mô hình khuếch tán cho dữ liệu dạng bảng (TabDDPM v.v.) cũng đang sôi động.

Tổng hợp dựa trên LLM tận dụng khả năng sinh câu, mã và hội thoại của mô hình ngôn ngữ transformer. Đặc biệt, để chưng cất (distillation) LLM thành mô hình nhỏ hơn, phương thức dùng các cặp chỉ dẫn-phản hồi chất lượng cao do mô hình giáo viên mạnh tạo ra làm dữ liệu huấn luyện tổng hợp đang trở thành tiêu chuẩn. Tuy nhiên, đã có báo cáo về hiện tượng thiên lệch của mô hình gốc bị truyền nguyên vẹn, hoặc hiện tượng sụp đổ mô hình (model collapse) — phân phối bị sụp đổ khi chỉ huấn luyện lặp lại bằng dữ liệu tổng hợp — nên việc quản lý tỷ lệ pha trộn giữa dữ liệu thực và tổng hợp trở nên quan trọng.

Chọn mô hình sinh nào phụ thuộc vào đặc tính và ràng buộc của dữ liệu. Với bảng có cấu trúc, các kỹ thuật chuyên biệt xử lý tính không đồng nhất giữa các cột và mất cân bằng như CTGAN, TabDDPM là có lợi; với hình ảnh là mô hình khuếch tán; với chuỗi thời gian là họ hồi quy (recurrent) hoặc transformer bảo toàn phụ thuộc thời gian; với văn bản là LLM. Ngoài ra, trong các ngành bị quản lý chặt nơi bảo đảm quyền riêng tư là bắt buộc, ưu tiên xem xét các biến thể kết hợp differential privacy (DP-CTGAN v.v.) dù hiệu năng có thấp hơn đôi chút. Nói cách khác, cốt lõi là chọn “mô hình phù hợp với mục đích và ràng buộc” chứ không phải “mô hình chân thực nhất”, và phán đoán này chính là quyết định thiết kế mà Kỹ sư chuyên nghiệp (Professional Engineer) phải đưa ra.

4. Đánh giá chất lượng: Cân bằng tam giác giữa độ trung thực, tính hữu dụng và quyền riêng tư

Giá trị của dữ liệu tổng hợp được đánh giá theo ba trục, và ba trục này thường xung đột với nhau. Độ trung thực lại được chia thành đơn biến (phân phối của từng cột) và đa biến (tương quan, quan hệ có điều kiện giữa các cột). Nếu chỉ khớp đơn biến mà cấu trúc đa biến bị phá vỡ, sẽ tạo ra dữ liệu mà từng cột trông hợp lý nhưng tổ hợp các cột lại phi thực tế, làm mô hình hiểu sai. Độ trung thực (Fidelity) là mức độ dữ liệu tổng hợp tái hiện tốt đặc tính thống kê của dữ liệu gốc, được đo bằng so sánh phân phối theo cột (thống kê KS), độ tương đồng cấu trúc tương quan, mức độ mô hình phân biệt không phân biệt được dữ liệu gốc và tổng hợp (distinguishability) v.v. Tính hữu dụng (Utility) là mức độ mô hình được huấn luyện bằng dữ liệu tổng hợp hoạt động tốt trong nghiệp vụ thực tế, tiêu biểu là phương thức TSTR (Train on Synthetic, Test on Real) — hiệu năng khi huấn luyện bằng dữ liệu tổng hợp và kiểm chứng bằng dữ liệu thực. Hiệu năng TSTR càng tiệm cận với khi huấn luyện bằng dữ liệu thực (TRTR) thì dữ liệu tổng hợp đó càng được đánh giá là có thể dùng thay thế trong thực tế. Quyền riêng tư (Privacy) là rủi ro thông tin cá nhân của dữ liệu gốc bị rò rỉ từ dữ liệu tổng hợp, được đánh giá bằng tấn công suy luận thành viên (suy luận một bản ghi cụ thể có được dùng trong huấn luyện hay không) hoặc tấn công lân cận (bản ghi tổng hợp có quá gần bản ghi gốc hay không).

Điểm cốt lõi ở đây là ba trục có quan hệ đánh đổi. Nếu nâng độ trung thực lên cực độ thì gần như sao chép nguyên dữ liệu gốc, khiến quyền riêng tư sụp đổ. Ngược lại, nếu thêm nhiều nhiễu để bảo vệ quyền riêng tư thì tính hữu dụng giảm. Do đó, trong thực tế người ta kết hợp differential privacy (quyền riêng tư vi sai) vào huấn luyện mô hình sinh (ví dụ DP-SGD) để đưa ra bảo đảm toán học rằng “dù dữ liệu của một cá nhân có hay không thì kết quả sinh gần như không thể phân biệt về mặt thống kê”, và điều chỉnh định lượng điểm cân bằng bằng ngân sách quyền riêng tư (ε). ε càng nhỏ thì quyền riêng tư càng mạnh nhưng tính hữu dụng càng thấp.

Cái bẫy đặc biệt cần lưu ý là chỉ số hữu dụng trung bình che giấu sự sụp đổ của nhóm thiểu số. Dù độ chính xác (accuracy) tổng thể hay độ tương đồng phân phối trông tốt, các nhóm con chiếm tỷ trọng nhỏ trong dữ liệu có thể bị biểu diễn thiếu trong quá trình tổng hợp, khiến hiệu năng mô hình đối với nhóm đó giảm mạnh. Vì vậy, đánh giá tính hữu dụng phải được phân rã và kiểm tra theo từng nhóm con chứ không chỉ chỉ số tổng thể. Ngoài ra, nguyên tắc thực tiễn là thay vì phán định “đạt/không đạt” dữ liệu tổng hợp bằng một điểm tóm tắt duy nhất, cần quản lý bằng dashboard hiển thị đồng thời ba trục và đặt ngưỡng phù hợp với mục đích kinh doanh cho từng trục.

DCR (Distance to Closest Record), thường được dùng trong đánh giá quyền riêng tư, đo mỗi bản ghi tổng hợp cách bản ghi gốc gần nhất bao xa. Nếu khoảng cách này gần 0 thì thực chất đã sao chép dữ liệu gốc, đó là tín hiệu rủi ro. Tuy nhiên, nếu tăng khoảng cách một cách mù quáng thì tính hữu dụng bị tổn hại, nên cách tiếp cận tinh tế là so sánh với phân phối khoảng cách tới tập holdout (mẫu trong dữ liệu gốc không dùng để huấn luyện) để phán đoán tương đối xem “có riêng gần một cách bất thường với dữ liệu gốc dùng để huấn luyện hay không”.

Bảng dưới đây tổng hợp ba trục đánh giá và các chỉ số tiêu biểu. Nguyên tắc thực tiễn là không xem riêng từng chỉ số mà quản lý đồng thời ba trục bằng dashboard.

Trục đánh giá Câu hỏi Chỉ số·Phương pháp tiêu biểu
Độ trung thực Có giống dữ liệu gốc về thống kê không Kiểm định KS phân phối, tương đồng tương quan, tính không thể phân biệt
Tính hữu dụng Có hữu ích trong tác vụ thực không TSTR, hiệu năng mô hình hạ nguồn
Quyền riêng tư Dữ liệu gốc có bị rò rỉ không Tỷ lệ thành công tấn công suy luận thành viên, DCR (khoảng cách gần nhất)

5. Tình huống áp dụng trong ngành và so sánh

Dữ liệu tổng hợp đã được kiểm chứng thực tế trong nhiều ngành. Lý do chọn dữ liệu tổng hợp trong mỗi tình huống có phần khác nhau. Tài chính lấy ràng buộc về quyền riêng tư và chia sẻ, y tế lấy hạn chế truy cập và tính khan hiếm, xe tự hành và sản xuất lấy thu thập edge case và chi phí gán nhãn làm động lực chính. Sự khác biệt này phân tách phương thức sinh (học sâu cho dữ liệu có cấu trúc vs mô phỏng) và trọng tâm kiểm chứng (quyền riêng tư vs tính phù hợp lĩnh vực).

Trong lĩnh vực tài chính, vì khó chia sẻ dữ liệu giao dịch gắn với thông tin cá nhân với các công ty fintech hay viện nghiên cứu bên ngoài, người ta tạo dữ liệu giao dịch tổng hợp tương đương thống kê với dữ liệu gốc để dùng cho cùng phát triển mô hình phát hiện gian lận hoặc kiểm thử regulatory sandbox. Ví dụ, gian lận thẻ tín dụng chỉ chiếm khoảng 0.1~0.2% tổng số giao dịch nên mất cân bằng nghiêm trọng, và nếu tăng cường giao dịch bất thường bằng tổng hợp có thể nâng đáng kể độ bao phủ (recall) của lớp thiểu số.

Trong y tế, hồ sơ bệnh án điện tử (EMR) của bệnh nhân thuộc loại dữ liệu nhạy cảm nhất nên việc truy cập cho nghiên cứu bị hạn chế. Tạo EMR tổng hợp cho phép phát triển và kiểm chứng thuật toán mà không làm lộ bệnh nhân thực. Tuy nhiên, các trường hợp thiểu số như bệnh hiếm có thể trở nên quá giống một bệnh nhân thực cụ thể trong quá trình tổng hợp, nên phải kết hợp kiểm tra lân cận và kiểm chứng tính hợp lý lâm sàng. Đặc biệt, dữ liệu y tế có các ràng buộc sinh lý học giữa các chỉ số xét nghiệm (ví dụ một số tổ hợp chỉ số là bất khả thi về mặt lâm sàng), nên không thể chỉ khớp tương đồng thống kê mà nhất thiết phải kiểm chứng hậu kỳ dựa trên quy tắc lĩnh vực.

Trong xe tự hành và sản xuất, tổng hợp dựa trên mô phỏng là chủ lực. Dùng game engine để tự động sinh video lái xe và nhãn kết hợp nhiều loại thời tiết, độ sáng và hành vi người đi bộ, cho mô hình học hàng loạt các tình huống nguy hiểm khó thu thập trên đường thực. Mấu chốt ở đây là giảm domain gap — sự khác biệt thống kê giữa ảo và thực — bằng kỹ thuật thích ứng miền (domain adaptation). Trong sản xuất, các trường hợp tăng cường bằng tổng hợp hình ảnh lỗi có tỷ lệ lỗi cực thấp ở mức vài trăm ppm để nâng hiệu năng phát hiện lỗi của mô hình kiểm tra thị giác cũng đang tăng lên, và khi kết hợp với digital twin có thể sinh ảo cả kịch bản hỏng hóc thiết bị.

Các tình huống trong lĩnh vực văn bản và LLM cũng tăng nhanh. Dữ liệu như nhật ký tư vấn của trung tâm cuộc gọi, trộn lẫn thông tin cá nhân và phát ngôn nhạy cảm, khó dùng nguyên trạng để huấn luyện, nên người ta sinh hội thoại tổng hợp bảo toàn ý định, cảm xúc và kịch bản phát ngôn để huấn luyện chatbot tư vấn và mô hình tóm tắt. Ngoài ra, nếu dùng mô hình cấp cao tổng hợp dữ liệu chỉ dẫn-phản hồi còn thiếu trong một lĩnh vực cụ thể (pháp luật, y tế) để chưng cất mô hình nhỏ, có thể đạt hiệu năng chuyên biệt lĩnh vực mà không cần thu thập dữ liệu thực. Tuy nhiên, trong trường hợp này nhất thiết phải có bộ lọc kiểm chứng để lỗi sự thật (hallucination) không lẫn vào dữ liệu huấn luyện.

So sánh dữ liệu tổng hợp với các biện pháp phi định danh hiện có sẽ thấy rõ sự khác biệt. Bí danh hóa và ẩn danh hóa giữ nguyên bản ghi gốc và biến đổi định danh nên vẫn còn tương ứng 1:1 với dữ liệu gốc, rủi ro tái định danh luôn tồn tại, và càng xóa hoặc phân nhóm thì thông tin càng mất mát. Ngược lại, dữ liệu tổng hợp tạo bản ghi mới nên bản thân tương ứng 1:1 với dữ liệu gốc không tồn tại, điểm xuất phát của tái định danh biến mất. Nhưng điều này không có nghĩa “là dữ liệu tổng hợp thì chắc chắn an toàn”. Mô hình sinh bị quá khớp có thể thực chất ghi nhớ và sao chép dữ liệu gốc, nên hàm ý thực tiễn là dữ liệu tổng hợp cũng bắt buộc phải đánh giá rủi ro quyền riêng tư. Tức là phi định danh là cách tiếp cận “bớt đi”, còn tổng hợp là cách tiếp cận “tạo lại”, và cách quản lý rủi ro còn lại của mỗi bên khác nhau.

6. Chuyên sâu: Xu hướng mới nhất và thay đổi về tiêu chuẩn, quy định

Môi trường thể chế và kỹ thuật xung quanh dữ liệu tổng hợp đang được hoàn thiện nhanh chóng. Về mặt quy định, EU AI Act đã đề cập rõ ràng dữ liệu tổng hợp trong bối cảnh giảm thiên lệch và quản trị dữ liệu, tạo cơ sở cho phép sử dụng, và tại Mỹ cùng các nước khác nó cũng được chú ý như một trong các công nghệ bảo toàn quyền riêng tư. Tại Hàn Quốc, các thảo luận về hướng dẫn sử dụng thông tin bí danh và dữ liệu tổng hợp đang tiếp diễn với trung tâm là Ủy ban Bảo vệ thông tin cá nhân và các cơ quan liên quan, nên địa vị pháp lý của dữ liệu tổng hợp (tiêu chí phán đoán có phải thông tin cá nhân hay không) được dự báo sẽ trở thành vấn đề then chốt trong tương lai. Ở thời điểm hiện tại, cách tiếp cận thận trọng “dữ liệu tổng hợp không tự động trở thành thông tin phi cá nhân, mà được phán đoán theo kết quả đánh giá rủi ro tái định danh” là phổ biến, nên cần tránh các biểu đạt khẳng định.

Cùng với đó, thảo luận về ghi nhận nguồn gốc và truy vết dữ liệu tổng hợp cũng đang nổi lên. Khi yêu cầu về watermarking và ghi nguồn gốc (provenance) đối với nội dung AI tạo sinh ngày càng mạnh, việc để lại thông tin về việc có phải là dữ liệu tổng hợp hay không và dòng dõi sinh trong siêu dữ liệu, để dữ liệu tổng hợp được huấn luyện và lưu thông không bị nhầm là dữ liệu thực, đang trở thành điều kiện để bảo đảm độ tin cậy. Điều này gắn kết tự nhiên với quản lý dòng dõi dữ liệu (lineage) và danh mục dữ liệu (data catalog).

Về xu hướng kỹ thuật, thứ nhất, sinh kết hợp differential privacy (DP-GAN, PATE-GAN v.v.) đang trở thành cách tiếp cận tiêu chuẩn bảo đảm quyền riêng tư về mặt toán học. Thứ hai, xu hướng thay thế GAN bằng mở rộng mô hình khuếch tán sang dữ liệu có cấu trúc ngày càng mạnh. Thứ ba, cùng với tỷ trọng dữ liệu tổng hợp tăng vọt trong huấn luyện LLM, việc neo giữ (anchoring) và tuyển chọn (curation) dữ liệu thực nhằm ngăn sụp đổ mô hình đã nêu ở trên trở thành chủ đề nghiên cứu quan trọng. Thứ tư, các framework đánh giá mã nguồn mở (ví dụ họ SDMetrics) và benchmark nhằm đánh giá nhất quán chất lượng và quyền riêng tư của dữ liệu tổng hợp đang lan rộng, và nút thắt cổ chai trong thực tế đang chuyển từ “sinh” sang “kiểm chứng”. Về hướng ra đề dự kiến, khả năng cao là ① so sánh dữ liệu tổng hợp với biện pháp phi định danh, ② đánh đổi độ trung thực-tính hữu dụng-quyền riêng tư và kết hợp differential privacy, ③ thiết kế kịch bản áp dụng cho ngành cụ thể (tài chính, y tế, xe tự hành).

7. Các điểm cần cân nhắc và hàm ý

  • Kiểm chứng thường xuyên rủi ro quyền riêng tư còn lại: Không được khẳng định là an toàn chỉ vì là dữ liệu tổng hợp. Cần định kỳ kiểm tra việc quá khớp và ghi nhớ của mô hình sinh bằng các chỉ số suy luận thành viên và lân cận, đồng thời có hệ thống quản trị quản lý tường minh ngân sách differential privacy (ε). Cần có cổng chất lượng (quality gate) không cho phát hành, chia sẻ dữ liệu tổng hợp không vượt qua kiểm chứng quyền riêng tư.

  • Ngăn chặn sự truyền và khuếch đại thiên lệch: Dữ liệu tổng hợp học nguyên vẹn thiên lệch của dữ liệu gốc (lệch về giới tính, chủng tộc, khu vực), và nếu sinh thiếu nhóm thiểu số thì thiên lệch còn có thể bị khuếch đại. Do đó cần chiến lược kiểm soát điều kiện sinh để bổ sung biểu diễn nhóm thiểu số, đồng thời giám sát các chỉ số công bằng của mô hình hạ nguồn.

  • Căn chỉnh cân bằng hữu dụng-riêng tư với mục tiêu kinh doanh: Ưu tiên trục nào tùy thuộc vào bối cảnh kinh doanh và quy định. Cách tiếp cận hiệu quả là trước hết định nghĩa mục tiêu — ví dụ ưu tiên quyền riêng tư nếu là bộ dữ liệu chia sẻ ra ngoài hoặc công khai, ưu tiên tính hữu dụng nếu là cải thiện hiệu năng mô hình nội bộ — rồi tính ngược ra ε và mục tiêu độ trung thực.

  • Nội tại hóa hệ thống đánh giá và kiểm chứng chất lượng (công nghệ liên kết): Nút thắt của dữ liệu tổng hợp không phải là sinh mà là kiểm chứng đáng tin cậy. Cần liên kết với MLOps, khả năng quan sát dữ liệu (data observability) và model registry để truy vết phiên bản, dòng dõi và kết quả đánh giá của bộ dữ liệu tổng hợp, và quản lý bằng pipeline có thể tái hiện.

  • Quản lý domain gap và tính phù hợp thực tế: Với tổng hợp dựa trên mô phỏng, sự khác biệt phân phối ảo-thực quyết định hiệu năng. Cần giảm khoảng cách bằng thích ứng miền và pha trộn một lượng nhỏ dữ liệu thực (hybrid), đồng thời tiêu chuẩn hóa quy trình nhất thiết kiểm chứng bằng dữ liệu thực (TSTR) trước khi triển khai vào môi trường thực.

  • Áp đặt tính toàn vẹn và quy tắc kinh doanh: Dữ liệu tổng hợp dù hợp lý về mặt thống kê vẫn có thể vi phạm ràng buộc lĩnh vực (toàn vẹn tham chiếu, khớp tổng, giới hạn vật lý và sinh lý). Cần đặt bộ kiểm tra quy tắc ở bước hậu xử lý sau sinh để lọc các bản ghi vi phạm thì hạ nguồn mới tin cậy được, và nên vận hành điều này liên kết với quản lý chất lượng dữ liệu và hợp đồng dữ liệu (data contract).

  • Làm rõ quản trị và trách nhiệm: Cần lập tài liệu về căn cứ sinh (nguồn gốc dữ liệu gốc, phạm vi đồng ý), mục đích sử dụng và đối tượng phát hành của dữ liệu tổng hợp, đồng thời có tiêu chí nội bộ và quy trình phê duyệt để phán đoán có phải thông tin cá nhân hay không dựa trên kết quả đánh giá rủi ro tái định danh. Tiền đề chủ quan “là dữ liệu tổng hợp thì nằm ngoài quy định” có thể quay trở lại thành rủi ro pháp lý trong tương lai.

  • Triển vọng: Khi việc siết chặt quy định dữ liệu và sự cạn kiệt dữ liệu chất lượng cao chồng lên nhau, dữ liệu tổng hợp nhiều khả năng sẽ chuyển từ lựa chọn thành hạ tầng bắt buộc. Tuy nhiên, vẫn còn tồn tại hiểu lầm “là dữ liệu tổng hợp thì không liên quan đến quy định” và rủi ro sụp đổ mô hình, nên chiến lược dữ liệu lai — phối trộn chiến lược dữ liệu thực và dữ liệu tổng hợp và kiểm chứng liên tục — sẽ trở thành nhiệm vụ cốt lõi dưới góc nhìn Kỹ sư chuyên nghiệp.

Tài liệu tham khảo


Tóm tắt một câu: Dữ liệu tổng hợp là dữ liệu được sinh nhân tạo bằng cách mô phỏng đặc tính thống kê của dữ liệu gốc, là hạt nhân của chiến lược dữ liệu lai cho phép bảo vệ quyền riêng tư, tăng cường dữ liệu và bổ sung kịch bản hiếm, nhưng phải quản lý đánh đổi giữa độ trung thực, tính hữu dụng và quyền riêng tư bằng differential privacy và kiểm chứng liên tục.