← Về danh sách
AI & Dữ liệu
#생성형AI#확산모델#잠재확산#StableDiffusion#DDPM
Cập nhật lần cuối · 2026-09-05

Mô hình khuếch tán (Diffusion Model)

1. Tổng quan

Mô hình khuếch tán (Diffusion Model) là mô hình học sâu tạo sinh (Generative) gồm quá trình khuếch tán thuận (Forward Diffusion) — thêm dần nhiễu (noise) vào dữ liệu cho tới khi thành nhiễu Gauss thuần túy — và quá trình khuếch tán ngược (Reverse Denoising) — dùng mạng nơ-ron học quá trình ngược đó để khôi phục·sinh dữ liệu từ nhiễu.

Mục tiêu của AI tạo sinh là xấp xỉ phân phối xác suất p(x) của dữ liệu huấn luyện và rút mẫu mới từ phân phối đó. GAN (Generative Adversarial Network) ra đời năm 2014 đã tạo ra hình ảnh chất lượng cao nhờ cạnh tranh đối kháng giữa bộ sinh và bộ phân biệt, nhưng việc huấn luyện không ổn định và dễ bị sụp đổ chế độ (mode collapse, mất tính đa dạng). VAE (bộ tự mã hóa biến phân) huấn luyện ổn định nhưng có giới hạn là ảnh sinh ra bị mờ. Mô hình khuếch tán giải quyết thế lưỡng nan này bằng ý tưởng "đừng sinh trong một lần, mà phân rã thành bài toán khôi phục dần qua hàng trăm bước gỡ nhiễu từng chút một". Vì mỗi bước được chia thành bài toán nhỏ và dễ xử lý, việc huấn luyện ổn định, đồng thời bảo đảm cả tính đa dạng lẫn độ chân thực (fidelity) của mẫu.

Lý do gốc khiến khuếch tán được chú ý là sự cân bằng giữa chất lượng·đa dạng·ổn định. Sau khi bài báo DDPM (Denoising Diffusion Probabilistic Models) năm 2020 cho thấy chất lượng ảnh sánh ngang GAN, qua giai đoạn 2021~2022 nó đã trở thành công nghệ nền tảng tiêu chuẩn thực tế của các dịch vụ sinh ảnh từ văn bản như Stable Diffusion·DALL·E 2·Imagen·Midjourney. Ngày nay ứng dụng đang lan rộng không chỉ ở hình ảnh mà cả âm thanh (tổng hợp giọng nói), video, 3D, sinh cấu trúc protein, nên từ góc nhìn Kỹ sư chuyên nghiệp (Professional Engineer) đây là chủ đề nhất định phải hiểu như nguyên lý cốt lõi của AI tạo sinh.

2. Nguyên lý của quá trình khuếch tán thuận·ngược

flowchart LR
  X0["Dữ liệu gốc x0 (ảnh sắc nét)"] -->|"Khuếch tán thuận: thêm nhiễu"| XT["x_T (nhiễu Gauss thuần túy)"]
  XT -->|"Khuếch tán ngược: khử nhiễu (mạng nơ-ron)"| G["Dữ liệu sinh x0' (ảnh mới)"]
  subgraph FWD["Quá trình thuận (cố định, không cần học)"]
    X0
    XT
  end
  subgraph REV["Quá trình ngược (mạng nơ-ron học)"]
    XT
    G
  end

Quá trình khuếch tán thuận là chuỗi Markov (Markov chain) thêm nhiễu Gauss nhỏ vào dữ liệu gốc x0 ở mỗi bước t để tạo thành x1, x2, …, x_T. Cường độ nhiễu được quyết định bởi lịch trình định trước (β1…βT, variance schedule), và thường T lên tới hàng trăm~hàng nghìn bước. Điểm cốt lõi là quá trình này là quá trình cố định không có tham số học. Ngoài ra, nhờ tái tham số hóa (reparameterization) có thể tính trạng thái x_t ở bước t bất kỳ trực tiếp từ x0 trong một lần, mang lại lợi thế tính toán là khi huấn luyện không cần mô phỏng tuần tự từng bước. Với T đủ lớn, x_T hội tụ về phân phối chuẩn tắc, không còn dấu vết của bản gốc.

Quá trình khuếch tán ngược dùng mạng nơ-ron học quá trình ước lượng x_(t-1) ở bước trước từ x_t có lẫn nhiễu. Một cách trực quan, đó là bài toán "hãy dự đoán nhiễu nào đã bị trộn vào ảnh mờ này và gỡ bỏ đúng lượng đó". Trong DDPM thực tế, mạng nơ-ron được huấn luyện để dự đoán nhiễu ε đã thêm vào ở mỗi bước, và hàm mất mát có dạng rất đơn giản là sai số bình phương trung bình (MSE) giữa nhiễu dự đoán và nhiễu thực. Sự đơn giản này là bí quyết của độ ổn định huấn luyện. Sau khi huấn luyện xong, bắt đầu từ nhiễu thuần túy x_T và dùng mạng nơ-ron gỡ nhiễu T lần để sinh dữ liệu mới.

Về cấu trúc của mạng nơ-ron quá trình ngược, U-Net được dùng rộng rãi. U-Net đặt kết nối tắt (skip connection) giữa encoder-decoder để đồng thời bảo toàn cấu trúc tổng thể và chi tiết cục bộ của ảnh, và đưa bước hiện tại t vào mỗi tầng dưới dạng embedding thời gian để mạng nơ-ron nhận biết "hiện đang ở bước nhiều nhiễu đến đâu". Gần đây cách dùng DiT (Diffusion Transformer) dựa trên transformer làm backbone thay cho U-Net cũng đang lan rộng, tiêu biểu là việc sinh video của OpenAI Sora được biết là đã áp dụng họ này.

3. Sinh có điều kiện và khuếch tán tiềm ẩn

flowchart TB
  P["Prompt văn bản"] --> TE["Bộ mã hóa văn bản (CLIP v.v.)"]
  TE --> C["Embedding điều kiện"]
  Z["Nhiễu không gian tiềm ẩn z_T"] --> UNET["U-Net (khử nhiễu có điều kiện, lặp lại)"]
  C --> UNET
  UNET --> Z0["Vector tiềm ẩn đã khôi phục z0"]
  Z0 --> DEC["Bộ giải mã (VAE)"]
  DEC --> IMG["Ảnh cuối cùng"]
  subgraph LATENT["Khuếch tán tiềm ẩn (Latent Diffusion)"]
    Z
    UNET
    Z0
  end

Mô hình khuếch tán ban đầu chỉ dừng ở sinh không điều kiện (unconditional), tức tạo ra "ảnh bất kỳ". Then chốt để thực dụng hóa là sinh có điều kiện (Conditional Generation) — tạo ra "thứ mình muốn". Trong sinh ảnh từ văn bản, prompt được embedding bằng bộ mã hóa văn bản như CLIP rồi đưa vào tầng attention (cross-attention) của U-Net, dẫn dắt mỗi bước khử nhiễu tuân theo điều kiện văn bản. Kết hợp thêm kỹ thuật dẫn hướng không cần bộ phân loại (Classifier-Free Guidance, CFG) sẽ khuếch đại khác biệt giữa dự đoán có điều kiện và không có điều kiện, nâng mạnh độ trung thành với prompt. Tăng cường độ CFG (guidance scale) thì bám prompt sát hơn nhưng có đánh đổi là giảm tính đa dạng và độ tự nhiên.

Một đổi mới khác quyết định sự thực dụng hóa của mô hình khuếch tán là mô hình khuếch tán tiềm ẩn (Latent Diffusion Model, LDM). Nếu thực hiện khuếch tán trực tiếp trong không gian điểm ảnh (ví dụ: 512×512×3) thì khối lượng tính toán khổng lồ. LDM trước hết dùng encoder VAE nén ảnh vào không gian tiềm ẩn ít chiều (ví dụ: 64×64), thực hiện khuếch tán·khôi phục trong không gian tiềm ẩn đó, rồi dùng decoder VAE khôi phục ảnh ở độ phân giải gốc. Nhờ vậy khối lượng tính toán giảm hàng chục lần, cho phép sinh ảnh độ phân giải cao ngay trên GPU thông thường, và đây chính là cấu trúc cốt lõi của Stable Diffusion. Nén vào không gian tiềm ẩn còn có hiệu quả tập trung vào thông tin quan trọng về mặt tri giác và giảm gánh nặng xử lý nhiễu tần số cao vi tế.

Phân loại Khuếch tán không gian điểm ảnh (DDPM) Khuếch tán tiềm ẩn (LDM/Stable Diffusion)
Không gian thực hiện khuếch tán Điểm ảnh gốc (nhiều chiều) Vector tiềm ẩn đã nén (ít chiều)
Khối lượng tính toán·bộ nhớ Rất lớn Giảm mạnh (hàng chục lần)
Sinh ảnh độ phân giải cao Khó khăn Khả thi cả trên GPU tiêu dùng
Mô hình tiêu biểu DDPM, ADM Stable Diffusion, SDXL

4. So sánh với các mô hình tạo sinh khác như GAN

So sánh đặc tính của các mô hình tạo sinh sẽ làm rõ lý do vì sao khuếch tán trở thành dòng chính. GAN sinh bằng một lần lan truyền thuận (one-shot) nên suy luận nhanh, nhưng khi cân bằng với bộ phân biệt bị phá vỡ thì huấn luyện phân kỳ hoặc sụp đổ chế độ khiến chỉ sinh lặp lại một số mẫu nhất định. Ngược lại, khuếch tán huấn luyện ổn định và đa dạng mẫu vượt trội, nhưng khi sinh phải lặp hàng chục~hàng trăm bước nên tốc độ suy luận chậm là điểm yếu căn bản. Đây là cái giá của việc khuếch tán "phân rã thành nhiều bài toán nhỏ", cho thấy chất lượng·ổn định và tốc độ xung khắc nhau.

Để giảm nhẹ vấn đề tốc độ này, các kỹ thuật giảm mạnh số bước lấy mẫu đã phát triển. DDIM (bộ lấy mẫu tất định phi Markov) cho chất lượng khá chỉ với vài chục bước, xa hơn nữa, mô hình nhất quán tiềm ẩn (LCM)·kỹ thuật chưng cất (distillation) đã hiện thực việc sinh chỉ với 1~4 bước, tiến gần tới sinh thời gian thực. Tức là định kiến ban đầu "chậm" đang nhanh chóng được giải quyết.

Hạng mục so sánh GAN VAE Mô hình khuếch tán
Chất lượng sinh (độ chân thực) Cao Trung bình (mờ) Rất cao
Đa dạng mẫu Thấp (rủi ro sụp đổ chế độ) Cao Cao
Độ ổn định huấn luyện Thấp Cao Cao
Tốc độ suy luận Nhanh (1-step) Nhanh Chậm (nhiều bước, đang cải thiện)
Ứng dụng tiêu biểu Khuôn mặt·siêu phân giải Học biểu diễn Văn bản-ảnh·video·âm thanh

Về ví dụ áp dụng công nghiệp thực tế, trong phát triển thuốc mới·vật liệu, khuếch tán được dùng để sinh cấu trúc phân tử có tính chất mong muốn (thiết kế protein như RFdiffusion), trong sản xuất thì tăng cường dữ liệu lỗi dùng cho huấn luyện khi thiếu ảnh lỗi, còn trong truyền thông·quảng cáo thì rút ngắn thời gian làm concept art và bản phác thảo. Ví dụ, dịch vụ văn bản-ảnh được báo cáo là giảm thời gian làm bản phác thảo ban đầu của nhà thiết kế từ vài giờ xuống còn vài phút.

5. Các điểm cần cân nhắc và hàm ý

Khi áp dụng·khai thác mô hình khuếch tán, từ góc nhìn Kỹ sư chuyên nghiệp cần cân nhắc những điểm sau.

  • Quản lý đánh đổi hiệu năng-chi phí: Chất lượng sinh (số bước·độ phân giải·guidance scale) gắn trực tiếp với độ trễ suy luận·chi phí GPU. Với dịch vụ thời gian thực thì giảm số bước bằng DDIM·LCM·chưng cất mô hình, còn với sinh theo batch thì ưu tiên chất lượng — phải thiết kế điểm tối ưu theo mục đích. Hạ chi phí hạ tầng một cách cấu trúc bằng việc áp dụng khuếch tán tiềm ẩn cũng là chiến lược cốt lõi.

  • Bản quyền·quản trị dữ liệu: Vì huấn luyện bằng dữ liệu crawl web quy mô lớn, các vấn đề xâm phạm bản quyền, bắt chước phong cách của tác giả cụ thể, đầu độc dữ liệu huấn luyện (data poisoning) luôn tồn tại. Phải xác lập trước việc quản lý nguồn gốc dữ liệu, tuân thủ giấy phép, phản ánh yêu cầu từ chối (opt-out), chính sách sử dụng thương mại cho sản phẩm sinh ra.

  • Ứng phó lạm dụng và watermarking: Năng lực sinh chân thực có thể bị lợi dụng để tạo deepfake·thông tin sai lệch. Cần phòng thủ nhiều lớp: chèn watermark vô hình vào sản phẩm sinh ra (ví dụ: SynthID), áp dụng tiêu chuẩn nguồn gốc (provenance) (C2PA v.v.), và chặn nội dung có hại bằng bộ lọc nội dung·bộ phân loại an toàn.

  • Chọn chỉ số đánh giá: Chất lượng sinh được đánh giá định lượng bằng FID (Fréchet Inception Distance, khoảng cách với phân phối thực)·IS v.v., nhưng phải dùng song song CLIP Score cho độ khớp văn bản và đánh giá định tính cho mức hài lòng của người dùng thì mới có phán đoán đáng tin cậy.

  • Triển vọng và công nghệ liên quan: Đang mở rộng sang video·3D·world model dựa trên khuếch tán và kết hợp với backbone transformer (DiT) để tăng cường khả năng mở rộng (scaling). Dự kiến sẽ phát triển thành pipeline tự động hóa sinh-kiểm chứng-chỉnh sửa khi kết hợp với RAG·LLM đa phương thức·agent, nên cần hiểu một cách tích hợp trong liên kết với mô hình nền tảng·AI đa phương thức.

Tài liệu tham khảo


Tóm tắt một câu: Mô hình khuếch tán là mô hình tạo sinh gồm quá trình thuận thêm dần nhiễu vào dữ liệu và quá trình ngược dùng mạng nơ-ron đảo ngược nó, đồng thời bảo đảm độ ổn định huấn luyện cùng chất lượng·đa dạng, và nhờ các kỹ thuật khuếch tán tiềm ẩn·sinh có điều kiện đã trở thành công nghệ nền tảng tiêu chuẩn cho sinh ảnh từ văn bản·video.