Mạng đối nghịch tạo sinh (GAN, Generative Adversarial Network)
1. Tổng quan
Mạng đối nghịch tạo sinh (GAN) là một mô hình tạo sinh (Generative Model) dựa trên học sâu, trong đó hai mạng nơ-ron — bộ sinh (Generator) tạo ra dữ liệu mới và bộ phân biệt (Discriminator) phán định dữ liệu đó là thật hay giả — được cho cạnh tranh với nhau và huấn luyện đồng thời, nhằm xấp xỉ phân phối của dữ liệu thực và sinh ra các mẫu chân thực từ phân phối đó.
Mục tiêu căn bản của mô hình tạo sinh (Generative) là tìm ra phân phối xác suất p_data(x) mà dữ liệu huấn luyện tuân theo, rồi rút ra từ phân phối đó những mẫu mới chưa từng thấy. Theo truyền thống, bài toán này được tiếp cận bằng cách mô hình hóa tường minh hàm hợp lý (likelihood) của dữ liệu (ví dụ: máy Boltzmann, bộ tự mã hóa biến phân VAE), nhưng với các phân phối phức tạp như ảnh nhiều chiều thì việc tính toán hay tối ưu hóa trực tiếp hàm hợp lý là cực kỳ khó khăn. VAE huấn luyện ổn định nhưng kết quả sinh ra có hạn chế là bị mờ (blurry).
GAN do Ian Goodfellow đề xuất năm 2014 đã vượt qua thế lưỡng nan này bằng một bước chuyển đổi tư duy: "đừng tính trực tiếp hàm hợp lý, hãy biến bài toán thành trò chơi tạo ra hàng giả khó phân biệt". Phép ẩn dụ kẻ làm tiền giả (bộ sinh) và cảnh sát (bộ phân biệt) được dùng rộng rãi. Kẻ làm giả cố tạo tiền giả ngày càng tinh vi, cảnh sát cố giám định ngày càng chính xác; khi cuộc cạnh tranh này lặp đi lặp lại, tiền giả trở nên tinh xảo đến mức không thể phân biệt với tiền thật. GAN chính là việc hình thức hóa cuộc cạnh tranh đối nghịch này thành hàm mất mát của mạng nơ-ron.
Đằng sau sự lan tỏa bùng nổ của GAN là sự hội tụ của một số điều kiện thời đại. Mạng nơ-ron tích chập của học sâu đã trưởng thành trong nhận dạng ảnh, hậu thuẫn cho hiệu năng của bộ phân biệt; tính toán song song trên GPU khiến việc huấn luyện mạng nơ-ron quy mô lớn trở thành hiện thực; và các bộ dữ liệu ảnh khổng lồ đã được tích lũy. Trên nền tảng đó, GAN phát triển qua DCGAN năm 2015, CycleGAN·Pix2Pix năm 2017, StyleGAN năm 2018, và chỉ trong vài năm đã tiến bộ vượt bậc về độ chân thực. Chính tốc độ phát triển nhanh chóng này là tín hiệu báo trước tác động mà AI tạo sinh sẽ gây ra cho xã hội, nên bối cảnh ra đời của GAN cũng mang ý nghĩa lớn trong lịch sử công nghệ.
Lý do GAN quan trọng dưới góc nhìn Kỹ sư chuyên nghiệp Quản lý Thông tin là vì nó từng là một bước ngoặt trong phả hệ AI tạo sinh. Từ sau năm 2014, GAN trở thành tiêu chuẩn trên thực tế cho việc sinh ảnh chân thực, và ngay cả khi dòng chủ lưu của sinh ảnh từ văn bản ngày nay đã chuyển sang mô hình khuếch tán (diffusion), GAN vẫn được dùng trong các lĩnh vực thực tiễn như siêu phân giải ảnh·cải thiện chất lượng ảnh·tăng cường dữ liệu·phát hiện bất thường. Đồng thời, nó đã sinh ra trường hợp lạm dụng gọi là Deepfake, trở thành điểm khởi đầu của các vấn đề độ tin cậy·bảo mật·đạo đức AI, nên đây là chủ đề cần hiểu cả nguyên lý kỹ thuật lẫn hàm ý xã hội.
Các đặc điểm cốt lõi của GAN có thể tóm tắt như sau. Thứ nhất, đó là mô hình tạo sinh ngầm (implicit) không tính tường minh hàm hợp lý. Nó không biểu diễn trực tiếp mật độ xác suất của dữ liệu bằng công thức mà chỉ học khả năng rút mẫu từ phân phối đó. Thứ hai, sự cạnh tranh giữa hai mạng nơ-ron chính là tín hiệu học. Không cần đáp án riêng, hai mạng cải thiện lẫn nhau chỉ nhờ phán định của đối phương, mang tính tự giám sát (self-supervised). Thứ ba là tính liên tục của không gian tiềm ẩn. Khi thay đổi dần vectơ nhiễu đầu vào, kết quả sinh ra biến đổi một cách tự nhiên, cho phép xử lý các trục ngữ nghĩa của dữ liệu bằng phép toán vectơ. Ba đặc điểm này khiến GAN vừa mạnh mẽ vừa khó điều khiển.
2. Cấu trúc tổng thể và nguyên lý học đối nghịch của GAN
flowchart LR
Z["Vectơ nhiễu ngẫu nhiên z(mẫu không gian tiềm ẩn)"] --> G["Bộ sinh G(Generator)"]
G --> FAKE["Dữ liệu giả G(z)"]
REAL["Dữ liệu thực x(tập dữ liệu huấn luyện)"] --> D
FAKE --> D["Bộ phân biệt D(Discriminator)"]
D --> OUT["Xác suất thật/giả D(·)"]
OUT -->|"Mất mát phân biệt"| D
OUT -->|"Lan truyền ngược tới bộ sinh(gradient để đánh lừa)"| G
GAN là cấu trúc trong đó hai mạng nơ-ron tham gia một trò chơi minimax trên cùng một hàm mục tiêu. Bộ sinh G nhận vectơ nhiễu ít chiều z rút từ phân phối chuẩn hoặc tương tự, và xuất ra mẫu G(z) giống dữ liệu thực. Không gian chứa z được gọi là không gian tiềm ẩn (latent space), và một tính chất thú vị của GAN là sự di chuyển liên tục trong không gian này dẫn đến những thay đổi có ý nghĩa trong kết quả sinh (ví dụ: thay đổi góc·biểu cảm khuôn mặt). Bộ phân biệt D phán định đầu vào là dữ liệu thực hay đồ giả do G tạo ra dưới dạng xác suất từ 0 đến 1.
Nếu hiểu bộ phân biệt không đơn thuần là "máy giám định" mà là hàm mất mát được học (learned loss), bản chất của GAN sẽ rõ ràng hơn. Các mô hình tạo sinh truyền thống tối thiểu hóa một hàm mất mát cố định do con người định ra, như sai số theo từng điểm ảnh (ví dụ: sai số bình phương trung bình), nhưng loại mất mát này không nắm bắt tốt tính chân thực về mặt tri giác nên kết quả bị mờ. Ngược lại, trong GAN, bộ phân biệt tự học từ dữ liệu "cái gì trông giống thật" và phản hồi lại cho bộ sinh. Tức là chính tiêu chí mất mát trở nên tinh vi hơn qua quá trình học, nên có thể học "tính chân thực" — thứ con người khó quy định trước — theo hướng dữ liệu dẫn dắt; đây là thế mạnh căn bản của GAN.
Cốt lõi của việc huấn luyện nằm ở chỗ mục tiêu của hai mạng hoàn toàn đối lập. Bộ phân biệt D học để gán 1 cho thật, 0 cho giả (tức là phân biệt giỏi), còn bộ sinh G học để D phán định sản phẩm của nó là 1 (thật) (tức là đánh lừa giỏi). Về mặt công thức, D tối đa hóa hàm mục tiêu V(D,G) còn G tối thiểu hóa nó; về lý thuyết, khi hai mạng đạt cân bằng, phân phối của bộ sinh trùng với phân phối dữ liệu thực và bộ phân biệt không phân biệt được bên nào, xuất ra 0.5 cho mọi đầu vào — đạt tới cân bằng Nash (Nash equilibrium).
Tính chất của không gian tiềm ẩn mở rộng thêm tính thực dụng của GAN. Khi dịch chuyển dần vectơ nhiễu z trong bộ sinh đã huấn luyện xong, kết quả sinh ra biến đổi mượt mà chứ không nhảy đột ngột (ví dụ: khuôn mặt chính diện dần chuyển thành mặt nghiêng), và có thể chỉnh sửa sản phẩm sinh bằng cách tìm vectơ hướng ứng với một thuộc tính cụ thể (đeo kính, tuổi, biểu cảm) rồi cộng hoặc trừ đi. Điều này cho thấy không gian tiềm ẩn chứa cấu trúc ngữ nghĩa của dữ liệu một cách liên tục·tuyến tính, là nền tảng lý thuyết cho các ứng dụng như chỉnh sửa ảnh·điều khiển thuộc tính·nội suy (interpolation). StyleGAN hiện thực được việc điều khiển thuộc tính tinh vi cũng nhờ tái cấu trúc không gian tiềm ẩn này thành các trục phong cách.
Hàm mục tiêu V(D,G) của trò chơi này được định nghĩa là tổng kỳ vọng của "log xác suất của D trên mẫu thực" và "log(1−D) trên mẫu giả". D cố làm tăng giá trị này còn G cố làm giảm, nên việc huấn luyện không phải là tối thiểu hóa đơn thuần mà là tối ưu hóa để tìm điểm yên ngựa (saddle point). Nếu tối thiểu hóa mất mát thông thường là bài toán tìm đáy thung lũng, thì trò chơi minimax phải tìm điểm vừa là cực đại theo một hướng vừa là cực tiểu theo hướng khác, nên bảo đảm hội tụ yếu và dễ dao động. Khó khăn căn bản trong huấn luyện GAN bắt nguồn chính từ cấu trúc lý thuyết trò chơi này.
Trong triển khai thực tế, hai mạng được huấn luyện luân phiên. Trước tiên cố định G và cập nhật D vài bước với mẫu thực và mẫu giả, sau đó cố định D và cập nhật G. Trong bài báo gốc, mất mát của G gặp vấn đề triệt tiêu gradient ở giai đoạn đầu, nên người ta áp dụng hiệu chỉnh thực tiễn là đổi sang mất mát không bão hòa (non-saturating loss) — "tối đa hóa log xác suất khiến đồ giả bị nhận nhầm là thật" — để tăng cường tín hiệu học ở giai đoạn đầu. Như vậy, GAN tuy lý thuyết thanh nhã nhưng quá trình huấn luyện rất nhạy cảm, và việc cân bằng tốc độ học của hai mạng quyết định thành bại.
3. Quy trình huấn luyện và các kiến trúc biến thể tiêu biểu
flowchart TB
A["Bước 1: Lấy mẫu thực x, nhiễu z"] --> B["Bước 2: G sinh đồ giả G(z)"]
B --> C["Bước 3: Cập nhật bộ phân biệt D(học thật=1, giả=0)"]
C --> D["Bước 4: Cập nhật bộ sinh G(để đánh lừa D)"]
D --> E{"Hội tụ(đạt cân bằng)?"}
E -->|"Không"| A
E -->|"Có"| F["Kết thúc huấn luyện: sinh dữ liệu mới bằng G"]
Hình trên là quy trình huấn luyện lặp của GAN. Ở mỗi vòng lặp, bộ phân biệt và bộ sinh được cập nhật luân phiên; bí quyết để ổn định là huấn luyện bộ phân biệt thường xuyên hơn hoặc mạnh hơn bộ sinh một chút để duy trì một bộ phân biệt "không dễ bị lừa". Tuy nhiên, nếu bộ phân biệt quá mạnh, gradient truyền tới bộ sinh sẽ biến mất và việc học dừng lại, nên cần điều chỉnh tỉ mỉ sự cân bằng năng lực giữa hai mạng.
Một điểm cần lưu ý là quy trình huấn luyện này không có thời điểm kết thúc rõ ràng hay đường cong độ chính xác kiểm định như học có giám sát. Giá trị mất mát là kết quả của cuộc giằng co giữa hai mạng, nên thấp không có nghĩa là tốt, và hội tụ về một giá trị nào đó cũng không có nghĩa là đã học xong. Vì vậy, trong thực tế, thay vì đường cong mất mát, người ta quản lý việc huấn luyện bằng cách định kỳ kiểm tra trực quan các mẫu sinh ra hoặc kết hợp chỉ số định lượng như FID. Điều này tạo nên độ khó vận hành đặc thù của GAN, nơi ngay cả việc "khi nào dừng huấn luyện" cũng khó phán đoán.
Ở đây cần chỉ rõ vì sao việc điều chỉnh cân bằng huấn luyện lại khó. Nếu bộ phân biệt học nhanh hơn bộ sinh quá nhiều, nó sẽ lọc bỏ hoàn hảo đồ giả, và gradient chứa thông tin về "cần cải thiện điều gì" cho bộ sinh sẽ biến mất; ngược lại nếu bộ sinh vượt lên trước, bộ phân biệt bị lừa và chỉ đưa ra tín hiệu vô nghĩa. Vì thế, trong thực tế người ta điều chỉnh số lần cập nhật bộ phân biệt, tốc độ học, cấu hình lô (batch) qua các thí nghiệm lặp đi lặp lại, và gánh nặng tinh chỉnh này là lý do tiêu biểu khiến GAN trở thành "mô hình khó điều khiển".
Kể từ khi xuất hiện, GAN đã phát triển thành nhiều mô hình phái sinh phù hợp với mục đích và đặc tính dữ liệu. Nếu hiểu mỗi biến thể là một nỗ lực giải quyết một điểm yếu cụ thể của GAN ban đầu (huấn luyện bất ổn, không điều khiển được điều kiện, độ phân giải thấp, v.v.), phả hệ sẽ trở nên rõ ràng.
| Mô hình biến thể | Ý tưởng cốt lõi | Vấn đề đã giải quyết |
|---|---|---|
| DCGAN | Thiết kế lại bộ sinh·bộ phân biệt bằng cấu trúc tích chập (CNN), đưa vào chuẩn hóa theo lô | Nâng cao chất lượng ảnh·độ ổn định huấn luyện |
| cGAN(Conditional) | Đưa thêm thông tin điều kiện như nhãn vào đầu vào | Điều khiển việc sinh dữ liệu "đúng loại mong muốn" |
| Pix2Pix / CycleGAN | Chuyển đổi ảnh-sang-ảnh (có ghép cặp/không ghép cặp) | Chuyển đổi miền (ảnh chụp↔tranh vẽ, ngựa↔ngựa vằn) |
| WGAN / WGAN-GP | Thay mất mát bằng khoảng cách Wasserstein, phạt gradient | Giảm nhẹ sụp đổ mode·huấn luyện bất ổn |
| StyleGAN | Tiêm vectơ phong cách theo từng tầng, mở rộng độ phân giải dần dần | Siêu phân giải cao·điều khiển thuộc tính tinh vi |
DCGAN (Deep Convolutional GAN) đưa mạng nơ-ron tích chập vào thay cho kết nối đầy đủ, nâng mạnh chất lượng sinh ảnh và trở thành khung xương chuẩn trên thực tế. Bộ sinh dùng tích chập chuyển vị (transposed convolution) để mở rộng dần đặc trưng độ phân giải thấp, bộ phân biệt dùng tích chập có bước trượt (stride), và cả hai mạng đều áp dụng chuẩn hóa theo lô (batch normalization) để ổn định huấn luyện. DCGAN còn có ý nghĩa lớn ở chỗ cho thấy phép toán số học trên vectơ nhiễu z (ví dụ: lấy vectơ "mặt cười" trừ vectơ "mặt vô cảm" rồi cộng vectơ "nam giới") dẫn đến kết quả có ý nghĩa, chứng minh rằng không gian tiềm ẩn chứa ngữ nghĩa của dữ liệu một cách có cấu trúc.
GAN có điều kiện (cGAN) đưa không chỉ nhiễu mà cả điều kiện y như nhãn lớp·văn bản·ảnh khác vào cả bộ sinh lẫn bộ phân biệt, thoát khỏi việc sinh ngẫu nhiên để cho phép sinh có định hướng mục tiêu như "ảnh con mèo" hay "biến bản phác thảo này thành ảnh chụp". Bộ phân biệt cũng được huấn luyện để phán định không chỉ "ảnh này có thật không" mà còn "có phù hợp với điều kiện đã cho không", nên bộ sinh được dẫn dắt để tạo ra ảnh phù hợp với điều kiện chứ không chỉ là ảnh trông hợp lý. Cấu trúc có điều kiện này sau đó trở thành điểm khởi đầu cho các ứng dụng thực tiễn như văn bản-sang-ảnh, chỉnh sửa ảnh.
Pix2Pix và CycleGAN là dòng chuyên cho chuyển đổi ảnh-sang-ảnh. Pix2Pix học từ dữ liệu có đầu vào-đầu ra được ghép cặp (paired) (ví dụ: cặp phác thảo-ảnh thật), nhưng trong thực tế thường khó có được những cặp như vậy. CycleGAN học phép chuyển đổi qua lại giữa hai miền (ví dụ: phong cảnh mùa hè↔mùa đông, ngựa↔ngựa vằn) mà không cần dữ liệu huấn luyện ghép cặp, bằng mất mát nhất quán chu trình (cycle consistency). Ý tưởng cốt lõi là áp đặt ràng buộc: sau khi chuyển A→B rồi chuyển ngược B→A thì phải giống bản gốc, nhờ đó học được phép chuyển đổi bảo toàn ngữ nghĩa ngay cả khi không có cặp.
StyleGAN (2018~) thay vì biến nhiễu thành ảnh ngay lập tức, đã đưa vào cấu trúc trước tiên dùng mạng ánh xạ để chuyển vectơ tiềm ẩn sang không gian phong cách, rồi tiêm nó vào từng tầng của bộ sinh (AdaIN). Nhờ đó có thể điều khiển tách biệt theo từng tầng các thuộc tính thô như bố cục tổng thể·dáng mặt và các thuộc tính chi tiết như tóc·nếp nhăn, gây chú ý khi sinh ra những khuôn mặt siêu phân giải mà mắt người gần như không phân biệt được với thật. Đồng thời, độ chân thực này cũng là trường hợp tiêu biểu làm dấy lên lo ngại về deepfake, tượng trưng cho tính hai mặt của GAN khi tiến bộ công nghệ và rủi ro xã hội cùng gia tăng.
4. Các chỉ số đánh giá hiệu năng GAN
Khác với học có giám sát so sánh nhãn đúng và dự đoán, với mô hình tạo sinh rất khó định lượng "đã sinh tốt đến đâu". Một kết quả sinh tốt không chỉ yêu cầu từng mẫu phải chân thực (chất lượng·fidelity) mà còn phải phản ánh đồng đều các dạng thức đa dạng của dữ liệu huấn luyện (đa dạng·diversity), và hai trục này đôi khi xung đột nhau. Chẳng hạn, mô hình rơi vào sụp đổ mode có thể trông chất lượng cao nhưng độ đa dạng cực thấp. Do đó, chỉ số đánh giá phải nắm bắt được cả hai. Đánh giá chủ quan của con người tốn kém và khó tái lập, nên trong nghiên cứu GAN có hai chỉ số tự động được dùng rộng rãi. Thứ nhất là Inception Score (IS), kết hợp thành một giá trị hai điều kiện: khi đưa ảnh sinh vào bộ phân loại đã huấn luyện trước (Inception), dự đoán lớp của từng ảnh phải rõ ràng (chất lượng) và phân phối lớp của toàn bộ sản phẩm sinh phải đồng đều (đa dạng). Giá trị càng lớn càng tốt, nhưng có hạn chế là không so sánh trực tiếp với phân phối dữ liệu thực và phụ thuộc vào hệ thống lớp mà bộ phân loại đã học. Hơn nữa, ngay cả khi mô hình học thuộc và tái hiện nguyên dữ liệu huấn luyện vẫn có thể đạt điểm cao, nên không phải lúc nào cũng phát hiện được sự mất đa dạng.
Chỉ số thứ hai và là tiêu chuẩn hiện nay là Fréchet Inception Distance (FID). FID chuyển cả ảnh thực và ảnh sinh vào không gian đặc trưng, rồi đo sự khác biệt về trung bình và hiệp phương sai của hai phân phối bằng khoảng cách Fréchet. Giá trị càng nhỏ nghĩa là phân phối sinh càng gần phân phối thực, và do tương quan cao với phán đoán tri giác của con người nên nó trở thành chuẩn mực trên thực tế để so sánh mô hình. Tuy nhiên, FID nhạy cảm với bộ trích xuất đặc trưng và số lượng mẫu được dùng, nên cần diễn giải như so sánh tương đối trong cùng điều kiện thay vì so sánh tuyệt đối các con số giữa các bài báo·thiết lập khác nhau. Như vậy, hiểu được giới hạn của chỉ số đánh giá là tiền đề để diễn giải đúng kết quả GAN.
Trong thực tế, các chỉ số này được dùng làm căn cứ cho việc dừng sớm huấn luyện và lựa chọn mô hình. Vì bản thân giá trị mất mát của GAN không phản ánh tốt tiến độ học (mất mát thấp vẫn có thể chất lượng kém), người ta vận hành theo cách đo FID theo chu kỳ, khi giá trị không còn cải thiện thì dừng huấn luyện và chọn trọng số tại thời điểm đó. Tuy nhiên, cả FID·IS đều là chỉ số tối ưu cho miền ảnh, nên khi dùng GAN để sinh dữ liệu âm thanh·chuỗi thời gian·dạng bảng, cần thiết kế cách đánh giá riêng phù hợp với miền đó (ví dụ: hiệu năng tác vụ hạ nguồn, độ tương đồng thống kê). Tức là cần nhận thức rằng chính định nghĩa "thế nào là sinh tốt" cũng khác nhau tùy bài toán.
5. GAN vs mô hình khuếch tán — So sánh và ứng dụng thực tiễn
GAN và mô hình khuếch tán (Diffusion Model) là hai dòng chính của sinh ảnh ngày nay, nhưng cách sinh và điểm mạnh·điểm yếu khác biệt rõ rệt. Cần chỉ ra nguyên lý tạo nên sự khác biệt chứ không chỉ liệt kê các mục. GAN sinh ảnh từ nhiễu chỉ bằng một lần lan truyền xuôi, nên suy luận rất nhanh, nhưng do phụ thuộc vào cân bằng đối nghịch giữa bộ sinh và bộ phân biệt nên huấn luyện bất ổn và dễ gặp sụp đổ mode (mode collapse) — các mẫu sinh dồn về một số mẫu hình nhất định. Ngược lại, mô hình khuếch tán loại bỏ nhiễu dần dần qua hàng chục đến hàng nghìn bước, nên huấn luyện ổn định, đa dạng·chất lượng vượt trội, nhưng tốc độ sinh chậm do suy luận lặp.
Gốc rễ của sự khác biệt này nằm ở bản chất của mục tiêu huấn luyện. GAN chỉ có mục tiêu là đánh lừa bộ phân biệt, nên động lực bao phủ đều toàn bộ phân phối dữ liệu huấn luyện là yếu, và vì thế sụp đổ mode — tập trung vào "vài thứ dễ lừa" — phát sinh mang tính cấu trúc. Diffusion giải một bài toán hồi quy rõ ràng là đoán nhiễu thực sự đã được thêm vào ở mỗi bước, nên tín hiệu học ổn định và áp lực học toàn bộ phân phối vận hành một cách tự nhiên. Như vậy, khác biệt về "lấy gì làm tín hiệu học" dẫn đến khác biệt toàn diện về đa dạng·ổn định·tốc độ.
| Phân loại | GAN | Mô hình khuếch tán |
|---|---|---|
| Cách sinh | 1 lần lan truyền xuôi (một bước) | Khử nhiễu lặp nhiều bước |
| Tốc độ suy luận | Rất nhanh | Tương đối chậm (theo số bước) |
| Độ ổn định huấn luyện | Bất ổn (mất cân bằng·sụp đổ mode) | Ổn định |
| Độ đa dạng mẫu | Hạn chế (nguy cơ sụp đổ mode) | Vượt trội |
| Ứng dụng tiêu biểu | Sinh thời gian thực, siêu phân giải, tăng cường dữ liệu | Sinh văn bản-sang-ảnh quy mô lớn |
Sự khác biệt này dẫn đến các lựa chọn thực tiễn. Trong tăng cường dữ liệu ở lĩnh vực y tế·sản xuất, dữ liệu bình thường và lỗi thường mất cân bằng cực độ, nên người ta dùng GAN tạo dữ liệu tổng hợp cho lớp thiếu để bổ sung cho việc huấn luyện mô hình phân loại. Ví dụ, trong kiểm tra lỗi sản xuất, khi mẫu lỗi thực tế chưa đến 1% tổng số, cách tiếp cận bổ sung ảnh tổng hợp từ GAN để cải thiện độ bao phủ (recall) của lớp thiểu số đã được báo cáo. Tuy nhiên, nếu dữ liệu tổng hợp không phản ánh chính xác đặc tính vật lý của lỗi thực, nó có thể còn dẫn dắt sai mô hình, nên cần kết hợp kiểm duyệt của chuyên gia miền và điều chỉnh tỷ lệ trộn với dữ liệu thực.
Trong phát hiện bất thường (Anomaly Detection), cách huấn luyện GAN chỉ với dữ liệu bình thường rồi phán định đầu vào có sai số tái tạo lớn là bất thường được ứng dụng trong phát hiện gian lận giao dịch tài chính hay bảo trì dự đoán thiết bị công nghiệp. Bộ sinh chỉ học mẫu hình bình thường sẽ không tái hiện tốt mẫu hình bất thường chưa từng thấy, nên mức độ thất bại khi tái hiện chính là điểm bất thường. Điều này mang lại lợi thế thực tiễn là có thể xây dựng bộ phát hiện chỉ với dữ liệu bình thường trong thực tế khó thu thập nhãn cho các trường hợp bất thường.
Ngoài ra, siêu phân giải (SRGAN) — khôi phục video độ phân giải thấp thành độ phân giải cao — được dùng để cải thiện chất lượng hình ảnh CCTV·ảnh y tế, và trong lĩnh vực đề cao tính thời gian thực này, thế mạnh sinh nhanh trong một bước của GAN nổi bật.
Sinh dữ liệu tổng hợp (synthetic data) để bảo vệ thông tin cá nhân cũng là một ứng dụng đáng chú ý. Chia sẻ nguyên dữ liệu khách hàng·bệnh nhân thực có nguy cơ xâm phạm thông tin cá nhân cao, nhưng nếu dùng GAN tạo dữ liệu tổng hợp giữ được đặc tính thống kê mà không liên kết với cá nhân cụ thể, việc phân tích·huấn luyện·chia sẻ trở nên tương đối an toàn hơn. Tuy nhiên, ngay cả trong trường hợp này vẫn có nguy cơ mô hình sinh học thuộc và tái hiện (memorization) dữ liệu huấn luyện làm lộ bản gốc, nên bắt buộc phải kết hợp kiểm chứng khả năng tái định danh của dữ liệu tổng hợp và bảo đảm quyền riêng tư (ví dụ: kết hợp quyền riêng tư vi sai). Tóm lại, hợp lý khi hiểu đây là cục diện bổ trợ lẫn nhau: diffusion chiếm ưu thế ở sinh sáng tạo quy mô lớn·đề cao đa dạng, còn GAN chiếm ưu thế ở sinh thực tiễn đề cao tốc độ·miền chuyên biệt·bổ sung dữ liệu.
6. Chuyên sâu — Các dạng thất bại khi huấn luyện và xu hướng mới nhất
Trở ngại lớn nhất khi áp dụng GAN vào thực tế là tính bất ổn của huấn luyện, và hiểu các dạng thất bại tiêu biểu chính là chiến lược ứng phó. Sụp đổ mode là hiện tượng bộ sinh chỉ lặp lại vài mẫu đánh lừa được bộ phân biệt và mất đi tính đa dạng, chẳng hạn dữ liệu huấn luyện có mười chữ số nhưng bộ sinh chỉ liên tục tạo ra "1". Để giảm nhẹ điều này, WGAN (Wasserstein GAN) thay đổi chính hàm mất mát đã được đề xuất: thay khoảng cách giữa các phân phối trước đây (phân kỳ JS) — vốn không cung cấp gradient khi hai phân phối không chồng lấn — bằng khoảng cách Wasserstein, rồi thêm phạt gradient (WGAN-GP) để ổn định huấn luyện.
Có thể hiểu trực quan vì sao khoảng cách Wasserstein hiệu quả. Phân kỳ JS trả về khoảng cách là một hằng số cố định khi hai phân phối hoàn toàn không chồng lấn, làm mất thông tin "cách xa bao nhiêu", dẫn đến bộ sinh không biết hướng cải thiện. Ngược lại, khoảng cách Wasserstein đo chi phí tối thiểu để di chuyển một phân phối thành phân phối kia (earth-mover), nên dù hai phân phối không chồng lấn, khoảng cách vẫn thay đổi liên tục và cung cấp tín hiệu học ổn định. Như vậy, lịch sử cải tiến GAN cũng có thể đọc như "hành trình tìm thước đo khoảng cách tốt hơn", minh chứng rằng trong nghiên cứu mô hình tạo sinh, thiết kế hàm mục tiêu quan trọng không kém kiến trúc.
Một dạng thất bại khác là triệt tiêu gradient và dao động (oscillation). Nếu bộ phân biệt trở nên quá hoàn hảo, tín hiệu học chảy tới bộ sinh hội tụ về 0 và tiến trình dừng lại; ngược lại, nếu hai mạng không tìm được cân bằng, mất mát không hội tụ mà tiếp tục dao động. Trong thực tế, người ta kết hợp nhiều kỹ thuật ổn định như điều chỉnh tốc độ học, chuẩn hóa phổ (spectral normalization), điều chỉnh tỷ lệ cập nhật bộ phân biệt·bộ sinh, làm mềm nhãn (label smoothing). Đặc điểm là thành bại của huấn luyện GAN phụ thuộc lớn vào bí quyết kỹ thuật như vậy hơn là lý thuyết.
Các kỹ thuật ổn định này nhắm vào những nguyên nhân thất bại khác nhau. Chuẩn hóa phổ giới hạn độ lớn trọng số của bộ phân biệt để kìm hãm việc bộ phân biệt trở nên quá mạnh, còn phạt gradient giữ độ dốc của đầu ra bộ phân biệt trong một phạm vi nhất định để việc học mượt mà. Làm mềm nhãn nới lỏng đáp án, như dùng "thật=0.9" thay vì "thật=1", để bộ phân biệt không quá tự tin. Người thực hành lựa chọn·kết hợp các kỹ thuật này tùy theo đặc tính dữ liệu và triệu chứng (sụp đổ mode hay dao động), nên khi đưa GAN vào cần lên kế hoạch đồng thời cho việc lặp thí nghiệm đầy đủ và hệ thống giám sát chất lượng trực quan.
Về xu hướng mới nhất, khi dòng chủ lưu của sinh văn bản-sang-ảnh quy mô lớn chuyển sang mô hình khuếch tán, vị thế của GAN tương đối giảm xuống, nhưng các nghiên cứu gần đây đi theo hướng kết hợp tốc độ suy luận nhanh của GAN với chất lượng của diffusion. Tiêu biểu là cách tiếp cận dùng mất mát đối nghịch khi chưng cất (distillation) mô hình khuếch tán xuống vài bước (thậm chí 1 bước). Điều này cho thấy GAN đang được nhìn nhận lại như một thành phần của pipeline sinh hơn là một công nghệ độc lập. Tuy nhiên, các con số hiệu năng chi tiết của những kỹ thuật mới này dao động giữa các nghiên cứu, nên chính xác hơn là hiểu đây là "xu hướng giảm nhẹ đánh đổi tốc độ-chất lượng" thay vì khẳng định chắc chắn.
Sự mở rộng lĩnh vực ứng dụng cũng đáng chú ý. Nếu GAN ban đầu tập trung vào ảnh tĩnh như khuôn mặt·phong cảnh, thì sau đó đã mở rộng sang siêu phân giải nâng ảnh độ phân giải thấp lên cao, tô màu ảnh đen trắng, phục hồi ảnh hư hỏng (inpainting), sinh hình dạng 3D, tổng hợp·chuyển đổi giọng nói. Đặc biệt, sinh chuyên biệt theo miền chuyên môn đang sôi động, như nghiên cứu chuyển đổi phương thức chụp trong ảnh y tế (ví dụ: chuyển đổi phong cách MRI↔CT) hoặc tăng cường dữ liệu bệnh hiếm, hay các thử nghiệm sinh cấu trúc phân tử ứng viên hiệu quả trong phát triển thuốc mới. Điều này cho thấy GAN duy trì giá trị thực tiễn như một công cụ giải quyết vấn đề thiếu dữ liệu của các ngành cụ thể hơn là sáng tạo đa dụng.
Một xu hướng đáng chú ý khác là sự đồng tiến hóa của công nghệ phát hiện·phòng thủ. Khi deepfake dựa trên GAN càng tinh vi, các mô hình phát hiện cũng phát triển theo, và thú vị là bản thân bộ phát hiện đóng vai trò tương tự bộ phân biệt, khiến sinh-phát hiện lại tạo thành cục diện cạnh tranh đối nghịch. Vì thế, nhận thức đang lan rộng rằng chỉ công nghệ phát hiện thì khó giải quyết tận gốc, cần phòng thủ đa tầng kết hợp thủy vân (watermarking) và tiêu chuẩn chữ ký chứng minh nguồn gốc·tính xác thực của nội dung ngay từ giai đoạn sinh (C2PA, v.v.). Trong bài thi Kỹ sư chuyên nghiệp, cần có góc nhìn coi GAN không đơn thuần là một thuật toán sinh, mà là công nghệ nằm trong hệ sinh thái nơi sinh-đánh giá-phát hiện-quản trị gắn kết với nhau.
Tóm lại, GAN là công nghệ cốt lõi dẫn dắt sự tăng trưởng nhanh của AI tạo sinh từ năm 2014, và ngày nay phân chia vai trò với mô hình khuếch tán, duy trì vị thế thực tiễn trong miền chuyên biệt·sinh thời gian thực·tăng cường dữ liệu. Quyền dẫn dắt sinh sáng tạo quy mô lớn đã chuyển sang diffusion, nhưng ý tưởng của GAN — "học tính chân thực qua cạnh tranh đối nghịch" — đang được kế thừa dưới nhiều hình thức như chưng cất·siêu phân giải·phát hiện bất thường. Do đó, hợp lý khi hiểu GAN không phải là công nghệ của quá khứ, mà vẫn là một lựa chọn và khung tư duy còn hiệu lực trong thiết kế AI tạo sinh.
7. Các điểm cần cân nhắc và hàm ý
Dưới góc nhìn Kỹ sư chuyên nghiệp, GAN là công nghệ lưỡng dụng (dual-use) tiêu biểu cần xem xét đồng thời cả khả năng kỹ thuật lẫn rủi ro xã hội.
Khi AI tạo sinh lan rộng khắp các ngành, GAN không còn chỉ là lựa chọn thuật toán mà đã nằm ở giao điểm của chiến lược dữ liệu·bảo mật·quy định·đạo đức. Trong bài thi Kỹ sư chuyên nghiệp, ngoài nguyên lý kỹ thuật, cần cân nhắc đa chiều như sau.
- Chiến lược áp dụng (ưu tiên phù hợp với bài toán): GAN không phải vạn năng mà là công cụ có thế mạnh rõ rệt. Nó phù hợp với các bài toán coi trọng tốc độ và yêu cầu đa dạng hạn chế như sinh thời gian thực·siêu phân giải·tăng cường dữ liệu, nhưng với sinh quy mô lớn cần đa dạng rộng và huấn luyện ổn định thì mô hình khuếch tán có lợi hơn. Trước khi triển khai, cần chọn dòng mô hình dựa trên chất lượng yêu cầu·tốc độ·quy mô dữ liệu.
- Đánh đổi (chất lượng vs ổn định vs chi phí): Dùng dòng WGAN để có độ ổn định huấn luyện thì thời gian huấn luyện tăng, và StyleGAN siêu phân giải cao đòi hỏi tài nguyên tính toán khổng lồ. Khi dùng cho tăng cường dữ liệu, dữ liệu tổng hợp có nguy cơ làm méo phân phối thực và còn làm giảm hiệu năng mô hình, nên bắt buộc phải kết hợp tỷ lệ tổng hợp-thực và quy trình kiểm chứng chất lượng.
- Mối đe dọa độ tin cậy·bảo mật (ứng phó deepfake): Phương tiện tổng hợp siêu chân thực do GAN·StyleGAN tạo ra sinh ra các mối đe dọa xã hội nghiêm trọng như deepfake·thông tin sai lệch·đánh cắp danh tính·giả mạo giọng nói. Để ứng phó, các thảo luận về thủy vân sản phẩm sinh, tiêu chuẩn nguồn gốc nội dung (C2PA, v.v.), mô hình phát hiện và quy định bao gồm nghĩa vụ ghi nhãn sản phẩm do AI tạo ra (ví dụ: EU AI Act) đang diễn ra, nên khi đưa công nghệ vào cần thiết kế đồng thời hệ thống phát hiện·ghi nhãn·quản trị.
- Thông tin cá nhân·đạo đức (tính chính đáng của dữ liệu huấn luyện): Các mô hình sinh khuôn mặt·giọng nói dùng dữ liệu của người thật để huấn luyện, có khả năng xâm phạm quyền hình ảnh·bản quyền·quyền riêng tư. Cần có căn cứ thu thập hợp pháp dữ liệu huấn luyện, kiểm tra nguy cơ tái hiện·rò rỉ (memorization) và xem xét tính chính đáng của mục đích sinh.
- Trách nhiệm·quản trị (thiết lập nguyên tắc sử dụng): Cần định nghĩa trước chính sách sử dụng cấp tổ chức đối với việc sinh·phân phối phương tiện tổng hợp, quy trình ghi nhãn·lưu vết sản phẩm sinh, và trách nhiệm khi bị lạm dụng. Đặc biệt, khi dùng sản phẩm của GAN cho dịch vụ bên ngoài, cần hệ thống quản trị xem xét điều khoản sử dụng·nghĩa vụ thông báo và việc tuân thủ luật liên quan (Luật Bảo vệ thông tin cá nhân của Hàn Quốc, các quy định liên quan đến AI).
- Góc nhìn đánh giá·vận hành: GAN không thể phán đoán chất lượng chỉ bằng giá trị mất mát và không có thời điểm kết thúc huấn luyện rõ ràng, nên cần lập kế hoạch triển khai trên tiền đề có hệ thống giám sát kết hợp chỉ số định lượng như FID với kiểm duyệt trực quan, cùng việc lặp thí nghiệm đầy đủ. Cũng cần cân nhắc rằng nếu miền không phải là ảnh thì phải thiết kế lại chính chỉ số đánh giá.
- Góc nhìn tài nguyên·chi phí: Huấn luyện các mô hình chất lượng cao như StyleGAN tiêu tốn tài nguyên GPU và thời gian huấn luyện đáng kể, và nếu tính cả việc lặp tinh chỉnh siêu tham số thì tổng chi phí sở hữu (TCO) sẽ lớn. Cần xem xét song song các chiến lược tiết kiệm tài nguyên bằng tinh chỉnh (fine-tuning)·học chuyển giao mô hình huấn luyện trước, hoặc tối ưu chi phí bằng cách dùng linh hoạt GPU đám mây.
- Góc nhìn công nghệ liên kết: GAN cùng với mô hình khuếch tán·VAE tạo nên phả hệ AI tạo sinh, và gần đây được tái sử dụng như thành phần bổ trợ trong chưng cất diffusion·siêu phân giải·tăng cường dữ liệu. Thay vì nhìn nó như một công nghệ cô lập, nên xác định vị trí của nó trong toàn bộ pipeline bao trùm sinh-phát hiện-quản trị.
Tài liệu tham khảo
- Ian Goodfellow et al., "Generative Adversarial Networks", 2014 — https://arxiv.org/abs/1406.2661
- Google Developers, "Generative Adversarial Networks (GAN) Overview" — https://developers.google.com/machine-learning/gan
- NVIDIA, "StyleGAN(A Style-Based Generator Architecture for GANs)" — https://arxiv.org/abs/1812.04948
- Wikipedia, "Generative adversarial network" — https://en.wikipedia.org/wiki/Generative_adversarial_network
Tóm tắt một câu: GAN là mô hình tạo sinh xấp xỉ phân phối thực bằng cách cho bộ sinh (tạo dữ liệu) và bộ phân biệt (phân định thật giả) cạnh tranh đối nghịch; nó có thế mạnh về suy luận nhanh, tăng cường dữ liệu·siêu phân giải, nhưng mang theo các thách thức như sụp đổ mode·huấn luyện bất ổn và lạm dụng deepfake, đồng thời phát triển bổ trợ lẫn nhau với mô hình khuếch tán.