← Về danh sách
AI & Dữ liệu
#파인튜닝#LLM#PEFT#LoRA#RLHF#전이학습
Cập nhật lần cuối · 2026-07-06

Tinh chỉnh AI (Fine-tuning)

1. Tổng quan

A. Định nghĩa

Kỹ thuật học chuyển giao (Transfer Learning) tối ưu hiệu năng bằng cách huấn luyện bổ sung với lượng dữ liệu tương đối nhỏ phù hợp với miền·tác vụ (Task)·định dạng phản hồi cụ thể cho mô hình nền tảng (Foundation Model) đã được tiền huấn luyện (Pre-training) trên dữ liệu quy mô lớn, qua đó điều chỉnh trọng số của mô hình.

Tiền đề của tinh chỉnh là "mô hình tiền huấn luyện đã chứa tri thức tổng quát về ngôn ngữ·thế giới trong tham số". Vì vậy, thay vì học từ đầu, chỉ cần đặt thêm điều chỉnh vi mô theo hướng mong muốn lên trên biểu diễn đã học. Điều này có thể ví như con người sau khi hoàn thành giáo dục phổ thông thì nhận đào tạo cho một vị trí công việc cụ thể, và lợi thế cốt lõi là có thể trao chuyên môn với ít dữ liệu·chi phí.

B. Bối cảnh ra đời và sự cần thiết

Mô hình nền tảng đa dụng có tri thức rộng nhưng không được tối ưu cho thuật ngữ chuyên môn·định dạng phản hồi·giọng điệu riêng của doanh nghiệp trong một miền cụ thể. Để huấn luyện lại từ đầu (Pre-training) cần hàng nghìn GPU và dữ liệu khổng lồ, điều phi thực tế với phần lớn tổ chức. Mặt khác, chỉ bằng kỹ thuật prompt (prompt engineering) thì khó khai thác ổn định phong cách nhất quán hay tri thức chuyên môn sâu. Tinh chỉnh là giải pháp thực dụng nằm giữa hai cực này, chỉ điều chỉnh một phần mà không huấn luyện lại toàn bộ để có được hiệu năng chuyên biệt theo miền và định dạng nhất quán. Tuy nhiên, khi nhu cầu giảm thêm chi phí huấn luyện tăng lên, họ kỹ thuật PEFT đã xuất hiện.

2. Các loại tinh chỉnh

flowchart LR
  P[Mô hình tiền huấn luyện<br/>Foundation Model] --> F[Full Fine-tuning<br/>Cập nhật toàn bộ trọng số]
  P --> PE[PEFT<br/>Chỉ cập nhật một phần tham số]
  PE --> L[LoRA / QLoRA]
  PE --> A[Adapter]
  PE --> PT[Prefix / Prompt Tuning]
  style PE fill:#e8f0fe,stroke:#2f6fed,stroke-width:2px

Các loại được phân chia theo "động tới bao nhiêu tham số". Phương thức Full cập nhật toàn bộ nên năng lực biểu diễn tối đa nhưng chi phí và rủi ro cũng lớn, còn PEFT chỉ cập nhật một phần nên hạ mạnh chi phí·rủi ro nhưng nhượng bộ đôi chút năng lực biểu diễn. Vị trí của sự thỏa hiệp này chính là yếu tố quyết định lựa chọn thực tiễn.

Phân loại Nội dung Đánh đổi
Full Fine-tuning Cập nhật toàn bộ trọng số mô hình — có thể đạt hiệu năng cao nhất Chi phí GPU·lưu trữ lớn, rủi ro quên thảm khốc (Catastrophic Forgetting)
PEFT (Parameter-Efficient Fine-Tuning) Chỉ học một số ít tham số, đóng băng trọng số gốc Chi phí thấp·bộ nhớ thấp, bảo toàn tri thức gốc vs hiệu năng cực hạn có thể không bằng Full

Quên thảm khốc là hiện tượng quên những gì đã biết trong lúc học tác vụ mới, đặc biệt nổi bật ở phương thức Full. Nếu dịch chuyển mạnh toàn bộ trọng số theo dữ liệu mới thì năng lực tổng quát có được từ tiền huấn luyện bị phủ lấp. Lý do PEFT đóng băng trọng số gốc và chỉ học một số ít chính là để ức chế về mặt cấu trúc sự quên này.

3. Các kỹ thuật PEFT chính

Nguyên lý chung của PEFT là "giữ nguyên bản gốc khổng lồ, chỉ học các tham số bổ sung nhỏ". Như vậy đối tượng học·lưu trữ giảm xuống khoảng 1% tổng thể, và chỉ với một GPU cũng có thể tinh chỉnh.

Kỹ thuật Nguyên lý cốt lõi Ưu điểm
LoRA Xấp xỉ lượng thay đổi trọng số $\Delta W$ bằng tích hai ma trận hạng thấp (Low-Rank), chỉ học số ít tham số đó Đóng băng bản gốc·lượng lưu trữ cực nhỏ, dễ hoán đổi nhiều adapter
QLoRA Lượng tử hóa mô hình xuống 4bit để giảm bộ nhớ rồi áp dụng LoRA lên trên Tinh chỉnh mô hình lớn bằng một GPU tiêu dùng
Adapter Chèn mô-đun mạng nơ-ron nhỏ giữa các tầng transformer, chỉ học mô-đun đó Tách·tái sử dụng mô-đun theo tác vụ
Prefix/Prompt Tuning Chỉ tối ưu token ảo có thể học (Soft Prompt) đặt trước đầu vào, đóng băng thân mô hình Tham số cực nhỏ, dễ chuyển đổi tác vụ

Căn cứ để LoRA thành lập là quan sát "lượng thay đổi trọng số cần thiết khi tinh chỉnh thực tế nằm ở hạng thấp (chiều nội tại)". Vì vậy dù xấp xỉ $\Delta W$ bằng $B\cdot A$ (hai ma trận nhỏ) thì tổn thất hiệu năng vẫn nhỏ. QLoRA bổ sung lượng tử hóa 4bit vào đó, và việc cho phép tinh chỉnh mô hình lớn vốn cần hàng chục GB trên một GPU cỡ 24GB đã tạo ra tác động thực tiễn lớn.

4. Tinh chỉnh căn chỉnh (Alignment)

flowchart LR
  B[Mô hình nền tảng] --> S[SFT<br/>Tinh chỉnh có giám sát]
  S --> R[RLHF / DPO<br/>Căn chỉnh dựa trên ưu tiên]
  R --> M[Mô hình đã căn chỉnh<br/>Hữu ích·an toàn·trung thực]

Căn chỉnh là tinh chỉnh làm cho mô hình vượt ra ngoài "năng lực" để "hành xử phù hợp với ý định·giá trị của con người". Mô hình tiền huấn luyện giỏi dự đoán token tiếp theo, nhưng xu hướng làm theo chỉ dẫn hay từ chối câu trả lời có hại phải được huấn luyện riêng. Quá trình này thường dùng SFT để dựng khung năng lực thực hiện chỉ dẫn, tiếp theo dùng căn chỉnh dựa trên ưu tiên để điều chỉnh chất lượng câu trả lời theo khẩu vị con người.

Giai đoạn Nội dung Vai trò
SFT (tinh chỉnh có giám sát) Học bằng các cặp chỉ dẫn-phản hồi (Instruction) Trao nền tảng năng lực thực hiện chỉ dẫn
RLHF Căn chỉnh bằng mô hình phần thưởng học từ ưu tiên của con người + học tăng cường (PPO) Phản ánh cả ưu tiên tinh tế, phức tạp·không ổn định
DPO Tối ưu trực tiếp bằng cặp ưu tiên, không cần mô hình phần thưởng·học tăng cường Đơn giản·ổn định hơn RLHF, dễ hiện thực

RLHF mạnh nhưng hai giai đoạn huấn luyện mô hình phần thưởng và học tăng cường PPO không ổn định và tốn nhiều tài nguyên. Bối cảnh ra đời của DPO là loại bỏ sự phức tạp này bằng cách tối ưu trực tiếp chính sách từ cặp ưu tiên (câu trả lời tốt hơn/kém hơn), và đó là lý do nó được ưa chuộng trong thực tiễn gần đây.

5. So sánh với RAG

Tinh chỉnh và RAG không phải hàng thay thế mà có vai trò khác nhau. Tinh chỉnh nội tại hóa tri thức·năng lực vào trọng số nên mạnh trong việc dạy định dạng·giọng điệu·năng lực cụ thể, nhưng khi tri thức thay đổi thì phải huấn luyện lại. RAG đưa sự kiện·thông tin mới nhất vào từ bên ngoài nên cập nhật nhanh và có thể chỉ ra nguồn.

Phân loại Tinh chỉnh RAG
Đưa tri thức vào Nội tại hóa vào trọng số (học) Kết hợp vào prompt bằng tìm kiếm bên ngoài khi suy luận
Tính cập nhật Cần huấn luyện lại (chậm·tốn chi phí) Chỉ cập nhật cơ sở tri thức (nhanh)
Phù hợp Nội tại hóa định dạng·giọng điệu·năng lực chuyên môn Phản hồi sự kiện mới nhất·có căn cứ, chỉ ra nguồn
Chi phí Chi phí huấn luyện·xây dựng dữ liệu Hạ tầng tìm kiếm

Vì vậy trong thực tiễn thường dùng song song theo nguyên tắc "năng lực thì tinh chỉnh, tri thức thì RAG". Ví dụ, chatbot tư vấn nội bộ cố định giọng điệu·định dạng ứng đáp bằng tinh chỉnh, còn thông tin sản phẩm·chính sách thay đổi thường xuyên được đưa vào bằng RAG.

6. Lưu ý và hàm ý

  • Chất lượng·lượng dữ liệu quyết định hiệu năng: Học bằng dữ liệu ít·chất lượng thấp sẽ quá khớp hoặc thậm chí giảm hiệu năng. Dù quy mô vài nghìn bản ghi thì việc tinh lọc·tính đa dạng vẫn quan trọng.
  • Ngăn chặn quên thảm khốc: Ức chế tổn hại năng lực tổng quát bằng PEFT, tốc độ học thấp, chính quy hóa, trộn dữ liệu cũ (rehearsal).
  • Tuân thủ·bảo mật: Nếu dùng dữ liệu thông tin cá nhân·có bản quyền để huấn luyện, thông tin đó có thể còn lại trong mô hình và bị rò rỉ, nên phải rà soát trước nguồn gốc·giấy phép·phi định danh hóa dữ liệu.
  • Chiến lược tại chỗ·hiệu quả chi phí: Kết hợp PEFT với mô hình chuyên biệt cỡ nhỏ (sLLM) cho phép vận hành AI chuyên biệt theo miền với chi phí thấp trên hạ tầng riêng, phù hợp với tổ chức coi trọng chủ quyền dữ liệu.

Tóm tắt một câu: Tinh chỉnh là kỹ thuật học chuyển giao huấn luyện bổ sung mô hình tiền huấn luyện bằng lượng nhỏ dữ liệu tác vụ để điều chỉnh trọng số, hiện thực chi phí thấp·ít quên bằng PEFT (LoRA·QLoRA), căn chỉnh theo ưu tiên của con người bằng SFT·RLHF/DPO, và bổ trợ tri thức mới nhất bằng cách dùng song song với RAG ("năng lực thì tinh chỉnh, tri thức thì RAG").