← Về danh sách
AI & Dữ liệu
#RLHF#DPO#AI정렬#보상모델#PPO
Cập nhật lần cuối · 2026-10-09

RLHF (Học tăng cường từ phản hồi của con người) và Căn chỉnh (Alignment) LLM

1. Tổng quan

RLHF (Reinforcement Learning from Human Feedback) là kỹ thuật hậu huấn luyện (Post-training) trong đó người ta huấn luyện một mô hình phần thưởng (Reward Model) bằng dữ liệu sở thích (Preference) do con người xếp hạng, rồi thực hiện học tăng cường dùng phần thưởng đó làm tín hiệu, để đầu ra của mô hình ngôn ngữ lớn (LLM) phù hợp với ý định, giá trị và tiêu chuẩn an toàn của con người (Alignment).

Một LLM chỉ mới hoàn tất tiền huấn luyện (Pre-training) chỉ là mô hình được tối ưu để mô phỏng xác suất token kế tiếp trên một kho ngữ liệu Web khổng lồ, nên nó lệch một cách có hệ thống khỏi "đầu ra trôi chảy nhưng đúng điều người dùng thực sự muốn". Sự không khớp này xuất hiện ở ba dạng. Thứ nhất, không tuân thủ chỉ dẫn: với yêu cầu "tóm tắt trong ba câu" nó lại tuôn ra một đoạn dài, chỉ sinh một tiếp nối có vẻ hợp lý về xác suất chứ không tiếp nhận chỉ dẫn như một nhiệm vụ. Thứ hai, ảo giác và sự quá tự tin: nó khẳng định những sự kiện vô căn cứ một cách tự tin, vốn là kết quả của việc mô phỏng kiểu "trần thuật khẳng định" phổ biến trong kho ngữ liệu. Thứ ba, tính gây hại: nó tái hiện nguyên vẹn các khuôn mẫu có hại lẫn trong dữ liệu huấn luyện như phân biệt đối xử, bạo lực, tiếp tay hành vi phi pháp. RLHF ra đời chính để lấp khoảng cách giữa hàm mục tiêu huấn luyện (dự đoán token kế tiếp) và hiệu dụng thực tế (tính hữu ích, trung thực, vô hại, tức 3H: Helpful, Honest, Harmless).

Mục tiêu mà căn chỉnh theo đuổi thường được tóm gọn thành 3H. Hữu ích (Helpful) là năng lực nắm bắt ý định thực của người dùng và hoàn thành nhiệm vụ; Trung thực (Honest) là thái độ thừa nhận điều mình không biết và không bóp méo sự thật; Vô hại (Harmless) là tính an toàn từ chối tiếp tay hành vi nguy hiểm, phân biệt đối xử, phi pháp. Vấn đề là ba điều này thường xung đột. Chẳng hạn để "hoàn toàn hữu ích" với một câu hỏi nguy hiểm thì phải hy sinh tính vô hại, còn nếu nghiêng quá về tính vô hại thì tính hữu ích bị tổn hại qua việc từ chối thái quá (Over-refusal) cả những yêu cầu chính đáng. Ở điểm RLHF khiến mô hình học điểm cân bằng giữa các giá trị xung đột từ sở thích của con người, nó mang tính căn chỉnh giá trị (Value Alignment), vượt khỏi một kỹ thuật cải thiện hiệu năng đơn thuần.

Lý do căn bản khiến RLHF không thể giải quyết chỉ bằng tinh chỉnh có giám sát (SFT, Supervised Fine-Tuning) là vì so sánh hai lựa chọn dễ hơn và rẻ hơn nhiều so với viết ra từng câu trả lời đúng. Bắt chuyên gia viết "câu trả lời tốt" từ đầu làm chi phí bùng nổ, nhưng cho họ chọn trong hai phản hồi cái nào tốt hơn thì ngay cả người không chuyên cũng nhanh chóng tạo ra lượng lớn tín hiệu. Hơn nữa, các mục tiêu như chất lượng, sự lịch sự, tính an toàn của bản tóm tắt là mục tiêu không khả vi và khó định lượng, khó biểu diễn trực tiếp bằng hàm mất mát, nhưng có thể được tối ưu gián tiếp qua một "người đánh giá đã học" — chính là mô hình phần thưởng. Khi InstructGPT và ChatGPT của OpenAI nâng vọt khả năng sử dụng theo cách này vào năm 2022, RLHF đã trở thành công thức chuẩn trên thực tế cho căn chỉnh AI tạo sinh.

Gốc rễ của RLHF truy ngược về nghiên cứu năm 2017 của OpenAI và DeepMind "học phần thưởng từ sở thích con người" trong điều khiển robot và trò chơi, sau đó mở rộng qua nhiệm vụ tóm tắt (2020) đến tuân thủ chỉ dẫn đa dụng (2022). Nghĩa là RLHF không phải kỹ thuật bỗng xuất hiện cho LLM mà là kết quả của việc ghép vào mô hình ngôn ngữ một dòng chảy lâu dài của học tăng cường: kéo phán đoán của con người vào những bài toán mà phần thưởng khó thiết kế trực tiếp. Hiểu được phả hệ này thì thấy rõ rằng RLVR gần đây, đặt "kiểm chứng theo quy tắc" vào vị trí của "phán đoán con người", cũng là sự nối dài của cùng một ý thức vấn đề.

2. Đường ống ba giai đoạn của RLHF và các thành phần

RLHF không phải một thuật toán đơn lẻ mà là đường ống ba giai đoạn chạy SFT → mô hình hóa phần thưởng → học tăng cường. Mỗi giai đoạn nhận sản phẩm của giai đoạn trước làm đầu vào, và toàn thể có thể xem là quá trình "chưng cất (Distill) sở thích con người vào bên trong mô hình".

graph TD
    P["LLM tiền huấn luyện<br/>(Base Model)"] --> S["Giai đoạn 1: SFT<br/>học có giám sát trên dữ liệu chỉ dẫn-phản hồi"]
    S --> G["lấy mẫu nhiều phản hồi"]
    G --> H["con người so sánh sở thích cặp phản hồi<br/>(A vs B xếp hạng)"]
    H --> R["Giai đoạn 2: huấn luyện mô hình phần thưởng (RM)<br/>dự đoán điểm sở thích vô hướng"]
    S --> PO["Giai đoạn 3: học tăng cường (PPO)<br/>cập nhật LLM chính sách"]
    R -->|"tín hiệu phần thưởng"| PO
    PO -->|"mô hình đã căn chỉnh"| F["Aligned LLM"]
    S -.->|"mô hình tham chiếu KL"| PO

Giai đoạn 1, tinh chỉnh có giám sát (SFT), tinh chỉnh mô hình nền bằng dữ liệu trình diễn chỉ dẫn-phản hồi (Instruction-Response) chất lượng cao, trao năng lực cơ bản "tuân theo chỉ dẫn ở dạng hội thoại". Đây là giai đoạn đưa mô hình lên "vạch xuất phát" với hàng chục nghìn đến hàng trăm nghìn trình diễn, và về sau đồng thời đóng vai trò chính sách khởi đầu (Initial Policy) cho học tăng cường và điểm tham chiếu (Reference) ngăn sự chệch hướng quá mức. Nếu SFT yếu thì không gian tìm kiếm bị méo dù các giai đoạn sau có tinh vi đến đâu, nên trong thực tế chất lượng dữ liệu SFT thường quyết định hiệu năng cuối cùng.

Giai đoạn 2, huấn luyện mô hình phần thưởng (RM), tiến hành trên dữ liệu trong đó con người so sánh tương đối (xếp hạng) nhiều phản hồi do mô hình chính sách sinh cho cùng một prompt. Cho con người gán điểm tuyệt đối từ 1 đến 10 tạo nhiễu lớn vì tiêu chí mỗi người đánh giá khác nhau, nhưng so sánh cặp (Pairwise Comparison) "A tốt hơn B" lại nhất quán cao. Mô hình phần thưởng có cấu trúc thay đầu (head) của LLM nền thành đầu ra vô hướng, và được huấn luyện dựa trên mô hình Bradley-Terry để gán điểm cao hơn cho phản hồi được ưa thích. Tức là mất mát có dạng áp hàm logistic lên hiệu điểm giữa phản hồi được ưa thích và không được ưa thích, qua đó xấp xỉ hàm hiệu dụng ngầm của con người.

Giai đoạn 3, học tăng cường, lấy mô hình SFT làm chính sách khởi đầu và cập nhật chính sách dùng điểm do mô hình phần thưởng cấp làm phần thưởng. Ở đây LLM được hình thức hóa thành "một tác tử sinh chuỗi token (hành động) từ prompt (trạng thái) và nhận phần thưởng", và thuật toán được dùng rộng rãi nhất là PPO (Proximal Policy Optimization). Khác với học tăng cường trong cờ vây hay điều khiển robot, ở mô hình ngôn ngữ không gian hành động là siêu cao chiều — sinh liên tục hàng chục nghìn token — và phần thưởng chỉ được cấp một lần cho toàn bộ phản hồi, nên độ khó cao. Thiết kế cốt lõi của giai đoạn này là trói chính sách bằng phạt độ phân kỳ KL (Kullback-Leibler Divergence) để nó không rời quá xa mô hình tham chiếu SFT mà chạy theo phần thưởng một cách mù quáng; lý do sẽ được trình bày chi tiết ở phần sau.

Lý do cố ý tách ba giai đoạn là vì mỗi giai đoạn xử lý một tín hiệu có bản chất khác nhau. SFT xử lý trình diễn tuyệt đối "nên viết gì", mô hình hóa phần thưởng xử lý sở thích tương đối "trong hai cái nào tốt hơn", học tăng cường xử lý tín hiệu khám phá "phản hồi mới sinh tốt đến đâu". Đặc biệt giai đoạn học tăng cường thực hiện khám phá trực tuyến (online) trong đó chính mô hình sinh các phản hồi không có trong tập dữ liệu và nhận phần thưởng cho chúng, nên có thể dịch chuyển chính sách đến cả những vùng khó đạt tới nếu chỉ dùng SFT vốn mô phỏng đáp án cố định. Đây là câu trả lời cốt lõi cho câu hỏi "chẳng phải chỉ SFT là đủ sao?"; thực tế ngay trong thí nghiệm InstructGPT, mô hình RLHF cũng nhận sở thích cao hơn mô hình SFT một cách nhất quán trong đánh giá của con người.

Hình thức phản hồi mà RLHF xử lý cũng cần được phân biệt. "Trình diễn (Demonstration)" mà SFT dùng có chi phí viết cao nhưng là tín hiệu trực tiếp nhất; "so sánh (Comparison)" mà mô hình phần thưởng dùng thì rẻ và nhất quán cao, thuận lợi cho thu thập đại trà; và một số kỹ thuật còn tận dụng cả phản hồi nhị phân "tốt/xấu" hoặc điểm số. Tùy chọn hình thức nào mà chi phí thu thập dữ liệu, tính nhất quán của người đánh giá, và thuật toán huấn luyện áp dụng được (PPO, DPO, KTO, v.v.) đều thay đổi, nên thiết kế hình thức phản hồi phù hợp với nhiệm vụ và ngân sách trở thành quyết định đầu tiên của một dự án căn chỉnh.

Bản thân quy trình thu thập dữ liệu sở thích cũng chi phối chất lượng. Trong thực tế, 4 đến 9 phản hồi mà chính sách sinh cho cùng một prompt được trình cho người đánh giá để xếp hạng, rồi phân rã thành nhiều so sánh cặp để dùng cho huấn luyện. Lúc này nếu hướng dẫn chú thích (Annotation Guideline) mơ hồ thì sự bất đồng giữa những người chú thích (Inter-annotator Disagreement) tăng và mô hình phần thưởng học phải nhiễu, nên việc minh văn hóa trước thứ tự ưu tiên giữa tính hữu ích, trung thực, vô hại và tiêu chí xử lý các trường hợp ranh giới là quan trọng.

Giai đoạn Đầu vào Sản phẩm Bản chất dữ liệu Quy mô (ví dụ)
Tiền huấn luyện kho ngữ liệu Web mô hình nền không giám sát (tự hồi quy) hàng nghìn tỷ token
1. SFT trình diễn chỉ dẫn-phản hồi chính sách khởi đầu có giám sát (viết đáp án) hàng chục nghìn đến hàng trăm nghìn
2. Mô hình phần thưởng sở thích cặp phản hồi mô hình phần thưởng xếp hạng cặp hàng chục nghìn đến hàng triệu cặp
3. RL (PPO) prompt + RM mô hình đã căn chỉnh tăng cường (tín hiệu phần thưởng) hàng trăm nghìn prompt

Ngay cả sau khi ba giai đoạn kết thúc, căn chỉnh không dừng lại. Phản hồi người dùng mà mô hình đã triển khai nhận được (thích/không thích, yêu cầu viết lại, báo cáo) lại được đưa ngược về làm dữ liệu sở thích để cải thiện mô hình phần thưởng và chính sách thế hệ kế, tạo thành một bánh đà dữ liệu (Data Flywheel). Dịch vụ nào vận hành vòng tuần hoàn này càng tốt thì càng căn chỉnh được khớp với phân bố sử dụng thực tế, và đây là động lực chủ yếu để các dịch vụ thương mại quy mô lớn nhanh chóng vượt qua chất lượng mô hình ban đầu.

3. Nguyên lý vận hành của mô hình phần thưởng và tối ưu PPO

Bên trong học tăng cường ở Giai đoạn 3 là một vòng lặp trực tuyến trong đó sinh → đánh giá → cập nhật lặp lại. Khi chính sách sinh phản hồi, mô hình phần thưởng chấm điểm, và tham số của chính sách được điều chỉnh bằng tín hiệu kết hợp phần thưởng đó với phạt KL. Nhìn về mặt cấu trúc, bốn loại mô hình tương tác đồng thời.

graph LR
    PR["prompt"] --> POL["mô hình chính sách<br/>(Policy, được huấn luyện)"]
    POL -->|"sinh phản hồi"| RM["mô hình phần thưởng<br/>(Reward)"]
    POL -->|"log-xác suất"| REF["mô hình tham chiếu<br/>(Reference, cố định)"]
    RM -->|"phần thưởng r"| ADV["hiệu chỉnh phần thưởng<br/>r - β·KL"]
    REF -->|"tính KL"| ADV
    ADV --> CRI["mô hình giá trị<br/>(Critic)"]
    CRI -->|"advantage"| UPD["cập nhật PPO<br/>(clipping)"]
    UPD -->|"cập nhật tham số"| POL

Hack phần thưởng (Reward Hacking) và ràng buộc KL. Vì mô hình phần thưởng chỉ là một xấp xỉ không hoàn hảo của sở thích con người, nếu chính sách theo đuổi phần thưởng đến cực đoan thì nó hội tụ về đầu ra thoái hóa chỉ khoét vào lỗ hổng của mô hình phần thưởng (ví dụ: lặp một số sáo ngữ, nịnh bợ thái quá, đoạn dài vô nghĩa) — đó là hack phần thưởng. Để ngăn điều này, hàm mục tiêu cuối được thiết kế ở dạng "phần thưởng − β·KL(chính sách‖mô hình tham chiếu)", nên chính sách bị phạt nếu trôi quá xa mô hình tham chiếu SFT về phân bố token. β (hệ số KL) là siêu tham số then chốt điều chỉnh sự đánh đổi giữa cường độ căn chỉnh và giữ gìn chất lượng ngôn ngữ: quá nhỏ gây hack phần thưởng, quá lớn gây thiếu căn chỉnh.

Phạt KL hàm chứa một tiền đề triết học của căn chỉnh vượt khỏi một cơ chế an toàn đơn thuần. Nó chủ trương rằng một mô hình vốn đã có được kho tri thức ngôn ngữ và sự trôi chảy khổng lồ qua tiền huấn luyện và SFT thì ở giai đoạn căn chỉnh không bị "dạy lại hoàn toàn từ đầu" mà được "điều chỉnh tinh tế theo hướng sở thích trong khi giữ lại năng lực sẵn có". Nghĩa là căn chỉnh không phải học từ trang giấy trắng mà là sự hiệu chỉnh bảo thủ đối với một mô hình đã được huấn luyện tốt, và khoảng cách KL là cái phanh định lượng giữ cho hiệu chỉnh đó không trở nên quá mức.

Cơ chế ổn định hóa của PPO. Gradient chính sách (Policy Gradient) khét tiếng vì huấn luyện bất ổn do phương sai lớn. PPO bảo đảm ổn định bằng cách clipping tỷ lệ xác suất (Ratio) giữa chính sách mới và cũ vào một khoảng cố định (ví dụ 1±0.2), để một lần cập nhật không thể thay đổi chính sách một cách đột ngột. Nó cũng giữ riêng một mô hình giá trị (Critic) để ước lượng advantage, và kết quả là giai đoạn PPO của RLHF phải giữ đồng thời bốn mô hình lớn trong bộ nhớ — chính sách, phần thưởng, tham chiếu và giá trị — nên chi phí tính toán và bộ nhớ rất lớn. Chính vấn đề chi phí này là động lực cho các phương án thay thế nhẹ như DPO xuất hiện ngay sau đó.

Sự thưa thớt của tín hiệu và gán tín dụng. Vì LLM chỉ nhận một phần thưởng vô hướng duy nhất sau khi đã sinh hàng trăm token, việc gán tín dụng (Credit Assignment) — phân bổ "token nào đã đóng góp vào kết quả tốt" — là khó. Trong thực tế điều này được giảm nhẹ bằng cách gán phần thưởng cho token cuối và trải phạt KL trên từng token, đây là điểm khó riêng của RL ngôn ngữ phân biệt nó với RL cờ vây hay trò chơi.

Tóm lại vai trò của bốn mô hình: mô hình chính sách là mô hình duy nhất được huấn luyện và sinh phản hồi; mô hình tham chiếu bị đóng băng (Freeze) tại thời điểm SFT và cung cấp mốc cho phép tính KL; mô hình phần thưởng gán điểm vô hướng cho mỗi phản hồi; và mô hình giá trị ước lượng phần thưởng kỳ vọng tại mỗi bước để hỗ trợ tính advantage. Chính sách và mô hình giá trị được cập nhật trong lúc huấn luyện còn mô hình tham chiếu và phần thưởng thì cố định, và thiết kế tách "cái thay đổi với cái không đổi" này bảo đảm sự ổn định của huấn luyện.

Hạ tầng và chi phí rollout. Giai đoạn PPO, ở mỗi vòng lặp, sinh phản hồi cho nhiều prompt bằng chính sách hiện thời (rollout), đánh giá chúng bằng các mô hình phần thưởng, tham chiếu và giá trị, rồi lan truyền ngược — nên suy luận sinh và huấn luyện đan xen trong một vòng lặp. Vì vậy cần một hệ thống phân tán chuyên dụng kết hợp động cơ phục vụ suy luận với khung huấn luyện, và giai đoạn sinh (lấy mẫu trực tuyến) chiếm một phần đáng kể tổng thời gian. Chính sự phức tạp về kỹ thuật này đã làm tăng sức hấp dẫn thực tiễn của dòng DPO vốn tìm cách "quy về học có giám sát mà không cần vòng lặp học tăng cường".

Tối ưu quá mức mô hình phần thưởng và định luật Goodhart. Định luật Goodhart (Goodhart's Law) — "khi một thước đo trở thành mục tiêu thì nó không còn là thước đo tốt" — áp dụng trực tiếp cho RLHF. Vì mô hình phần thưởng chỉ là chỉ số đại diện (Proxy) cho sở thích con người, tối ưu chính sách quá mức theo tiêu chí của mô hình phần thưởng sẽ sinh ra tối ưu quá mức (Overoptimization) trong đó lúc đầu chất lượng thực tế và phần thưởng cùng tăng, nhưng từ một điểm nào đó chất lượng thực tế đình trệ hoặc giảm trong khi điểm phần thưởng vẫn tiếp tục tăng. Vì vậy trong vận hành người ta đặt các cơ chế phòng vệ như giám sát khoảng cách KL để dừng huấn luyện tại điểm thích hợp, hoặc thu thập thêm dữ liệu sở thích để định kỳ huấn luyện lại mô hình phần thưởng (reward model refresh).

4. Sự phát triển của các thuật toán căn chỉnh theo sở thích

Nhiều biến thể đã được đề xuất để giảm nhẹ sự phức tạp, bất ổn và chi phí của RLHF. Xu hướng cốt lõi là hướng "đổi chủ thể phản hồi từ con người sang AI (RLAIF), loại bỏ chính vòng lặp học tăng cường (DPO), hoặc bỏ critic (GRPO) để giảm chi phí". Câu hỏi xuyên suốt chúng là "ai cung cấp tín hiệu cần cho căn chỉnh, ở hình thức nào, và rẻ đến đâu", và bốn kỹ thuật dưới đây đưa ra câu trả lời ở những điểm khác nhau.

Bốn kỹ thuật có thể được định vị chủ yếu theo hai trục. Một là trục chủ thể phản hồi (con người ↔ AI ↔ quy tắc), trục kia là trục cấu trúc huấn luyện (học tăng cường trực tuyến ↔ học có giám sát ngoại tuyến). Nếu RLHF là nguyên mẫu của "con người + RL trực tuyến" thì DPO đã đơn giản hóa cấu trúc huấn luyện thành học có giám sát ngoại tuyến, RLAIF và Constitutional AI dời chủ thể phản hồi sang AI, còn GRPO và RLVR đổi cách tạo phần thưởng thành kiểm chứng theo quy tắc đồng thời làm cấu trúc huấn luyện hiệu quả hơn.

A. DPO (Direct Preference Optimization). Được đề xuất năm 2023, DPO thay hai giai đoạn "huấn luyện mô hình phần thưởng + học tăng cường" bằng một mất mát học có giám sát duy nhất. Khai thác việc phần thưởng của nghiệm tối ưu RLHF có thể được tái tham số hóa về mặt toán học thành một tỷ lệ xác suất chính sách, nó tinh chỉnh trực tiếp chính sách như một bài toán phân loại chỉ bằng dữ liệu cặp sở thích. Khi mô hình phần thưởng, mô hình giá trị và vòng lấy mẫu biến mất, nó đơn giản để hiện thực, ổn định và chi phí thấp, và lan rộng nhanh chóng với trung tâm là cộng đồng mã nguồn mở. Tuy nhiên vì dựa vào dữ liệu ngoại tuyến, khả năng ứng phó với prompt ngoài phân bố (Out-of-distribution) hay sự đa dạng khám phá của nó có thể thấp hơn PPO trực tuyến. Về sau các kỹ thuật phái sinh nối tiếp nhau như SimPO không cần mô hình tham chiếu, KTO dùng phản hồi nhị phân, ORPO tích hợp SFT với học sở thích.

B. RLAIF (RL from AI Feedback). Gán nhãn bởi con người thì chậm, đắt và kém khả năng mở rộng. RLAIF cho việc so sánh sở thích được thực hiện bởi một LLM riêng đóng vai người phán xử (Judge), sinh phản hồi ở quy mô lớn và chi phí thấp. Nó có ưu điểm nhanh gấp hàng chục lần con người và nhất quán cao, nhưng mang rủi ro thiên lệch của LLM đánh giá bị chuyển giao nguyên vẹn và lỗi bị khuếch đại qua vòng phản hồi, nên được dùng kèm phản hồi con người hoặc với tiêu chí đánh giá được cố định một cách minh thị. Các kỹ thuật bổ trợ nhằm nâng độ tin cậy của LLM đánh giá cũng đang được đề xuất, như RLAIF theo chương trình học vốn huấn luyện theo từng bước từ các cặp so sánh dễ đến khó.

C. Constitutional AI (AI theo hiến chương). Một kỹ thuật do Anthropic đề xuất, trong đó thay vì con người gán nhãn tính gây hại từng cái một, người ta thiết lập một bộ nguyên tắc được minh văn hóa (hiến chương, Constitution) và để mô hình tự phê bình và sửa chữa phản hồi của chính nó (self-critique), rồi tạo dữ liệu sở thích từ kết quả đó để huấn luyện. Có thể xem đây là một dạng RLAIF dựa trên nguyên tắc, và nó có thế mạnh về mặt quản trị khi giảm thiểu sự can thiệp của con người vào gán nhãn tính vô hại trong khi giữ cho tiêu chí căn chỉnh minh bạch và nhất quán.

Quy trình của Constitutional AI chia thành hai pha. Trong pha có giám sát, mô hình sinh một phản hồi có thể gây hại, rồi tự phê bình nó dựa trên các nguyên tắc của hiến chương và sửa thành một phản hồi tốt hơn, và mô hình được huấn luyện lại trên phản hồi đã sửa này. Trong pha học tăng cường kế tiếp, mô hình phán định trong hai phản hồi cái nào phù hợp nguyên tắc hơn, tạo dữ liệu sở thích và huấn luyện trên đó qua RLAIF. Điểm cốt lõi là các nguyên tắc làm căn cứ cho phán đoán tính gây hại được công bố bằng văn bản và có thể kiểm toán, nên có thể truy vết "vì sao phản hồi này bị từ chối hoặc sửa", đáp ứng yêu cầu về khả năng giải thích và quản trị.

D. GRPO và RLVR (RL dựa trên phần thưởng kiểm chứng được). GRPO (Group Relative Policy Optimization), được DeepSeek-R1 phổ biến năm 2025, đã loại bỏ mô hình giá trị (Critic) và huấn luyện bằng ưu thế tương đối của nhiều phản hồi cho cùng một prompt (advantage tương đối theo nhóm), giảm mạnh chi phí bộ nhớ. Đặc biệt trong các lĩnh vực có thể tự động chấm đáp án như toán và lập trình, nó dùng phần thưởng kiểm chứng được dựa trên quy tắc (RLVR, RL with Verifiable Rewards) thay cho sở thích con người, trở thành động lực cốt lõi của dòng "mô hình suy luận" vốn giảm hack phần thưởng và nâng năng lực suy luận theo từng bước (Reasoning).

Phân loại Chủ thể phản hồi Vòng RL Mô hình phần thưởng/giá trị Đặc trưng
RLHF (PPO) con người trực tuyến cần cả hai chuẩn, chi phí cao, lưu ý hack phần thưởng
DPO con người không (có giám sát) không cần đơn giản, ổn định, chi phí thấp, hạn chế khám phá
RLAIF AI trực tuyến/ngoại tuyến cần RM khả năng mở rộng↑, rủi ro chuyển giao thiên lệch
Constitutional AI AI + nguyên tắc hỗn hợp một phần vô hại, minh bạch, thân thiện quản trị
GRPO/RLVR quy tắc/kiểm chứng trực tuyến bỏ mô hình giá trị tăng cường suy luận, hiệu quả, lĩnh vực chấm được

Bài học xuyên suốt quá trình phát triển này là "điểm nghẽn của căn chỉnh không phải mô hình mà là phản hồi". Thuở đầu, mấu chốt là làm sao bơm sở thích con người vào mô hình (RLHF), nhưng khi giới hạn về chi phí và khả năng mở rộng của phản hồi con người lộ rõ, nó tiến hóa theo hướng dời chủ thể phản hồi sang AI (RLAIF, Constitutional AI) hoặc thiết kế thẳng phần thưởng kiểm chứng được theo quy tắc (RLVR), đồng thời thuật toán huấn luyện hội tụ về phía đơn giản và rẻ hơn (DPO, GRPO). Do đó dù chọn kỹ thuật nào, kết luận là một đường ống dữ liệu bảo đảm ổn định một tín hiệu phản hồi chất lượng cao mới là mấu chốt thành bại của căn chỉnh.

5. So sánh và các trường hợp áp dụng

Các kỹ thuật căn chỉnh khác nhau được phân biệt không bởi "tối ưu cái gì" mà bởi "từ bỏ cái gì". RLHF được sự linh hoạt cao nhất và khám phá trực tuyến nhưng phải chịu lượng tính toán khổng lồ và sự bất ổn; DPO được sự ổn định và chi phí thấp nhưng bị giới hạn trong phạm vi dữ liệu ngoại tuyến; RLVR được độ tin cậy của phần thưởng nhưng lĩnh vực áp dụng bị giới hạn ở các nhiệm vụ kiểm chứng được. Do đó không có "kỹ thuật tốt nhất", chỉ có phán đoán kỹ thuật tìm ra phương án chi phối (Dominant Choice) dưới các ràng buộc về nhiệm vụ, dữ liệu và ngân sách.

Lựa chọn giữa RLHF và các phương án thay thế quy về sự đánh đổi theo ba trục: điều kiện thu thập dữ liệu, ngân sách tính toán, và bản chất nhiệm vụ. Với một tổ chức khó bảo đảm sở thích con người và không dư dả tài nguyên tính toán thì bắt đầu từ dòng DPO là hợp lý, còn dịch vụ có trách nhiệm an toàn và pháp lý càng lớn thì càng có xu hướng chạy RLHF bao gồm người rà soát cùng với Constitutional AI. Ngược lại, trong các lĩnh vực có thể tự động kiểm chứng đáp án — như toán, lập trình và nhiệm vụ dạng tác tử — RLVR có hiệu quả chi phí vượt trội.

Nhìn vào một trường hợp cụ thể, bài báo InstructGPT của OpenAI báo cáo rằng một mô hình RLHF 1.3B tham số được ưa thích hơn GPT-3 175B trong đánh giá của con người, cho thấy căn chỉnh đóng góp cho khả năng sử dụng nhiều hơn hẳn so với việc chỉ mở rộng quy mô. Nghĩa là một kỹ thuật căn chỉnh đã đảo ngược khoảng cách tham số hơn 100 lần, gợi ý rằng "căn chỉnh tốt một mô hình nhỏ" có thể có lợi hơn cho khả năng sử dụng so với "dùng một mô hình lớn mà không căn chỉnh". Ngay cả trong các thí nghiệm nhiệm vụ tóm tắt, bản tóm tắt của mô hình RLHF cũng ngang bằng hoặc được ưa thích hơn bản tóm tắt tham chiếu do con người viết.

Việc lựa chọn kỹ thuật phân nhánh thế nào theo từng lĩnh vực áp dụng cũng đáng xem xét cụ thể. Một dịch vụ mà giọng điệu, sự lịch sự, tính nhất quán thương hiệu quan trọng như chatbot chăm sóc khách hàng thì hợp với RLHF và DPO vốn tinh chỉnh chất lượng tinh tế qua so sánh sở thích của con người/AI. Ngược lại, một trợ lý lập trình có thể tự động chấm việc mã sinh ra có vượt qua bài kiểm thử hay không, nên RLVR hiệu quả; thực tế dùng việc đạt/không đạt kiểm thử đơn vị làm phần thưởng có thể nâng độ chính xác của mã mà không cần nhãn con người. Giải toán cũng vậy, có thể kiểm chứng tính đúng sai của đáp án cuối bằng quy tắc nên dòng RLVR đang trở thành chuẩn. Như vậy "có thể lấy được phần thưởng một cách rẻ và tin cậy hay không" trở thành tiêu chí thực chất để chọn kỹ thuật.

Năm 2025 DeepSeek-R1, chỉ với GRPO và phần thưởng kiểm chứng được, đã nâng mạnh hiệu năng trên các benchmark toán và lập trình phức tạp, cho thấy có thể tăng cường năng lực suy luận mà không cần gán nhãn con người đắt đỏ. Ý nghĩa của trường hợp này là nó chứng minh bằng thực nghiệm rằng đổi thiết kế phần thưởng từ "sở thích con người" sang "kiểm chứng đáp án" làm giảm dư địa hack phần thưởng và đơn giản hóa huấn luyện. Mặt khác, về chi phí, DPO giảm số mô hình lớn phải giữ cho huấn luyện từ bốn xuống hai so với PPO, hạ mạnh bộ nhớ GPU và độ phức tạp hiện thực, qua đó hạ rào cản gia nhập cho các tổ chức hạn chế tài nguyên thử căn chỉnh theo sở thích. Tại Hàn Quốc cũng ngày càng nhiều trường hợp, khi xây dựng LLM cho lĩnh vực tài chính và công, dùng phản hồi sở thích của chuyên gia lĩnh vực để điều chỉnh tính tuân thủ quy định và giọng điệu của phản hồi, và ở các lĩnh vực nhạy cảm thì phương thức lai kết hợp người rà soát với đánh giá tự động được ưa chuộng.

6. Chuyên sâu: Xu hướng mới nhất của công nghệ căn chỉnh năm 2025

Một dòng chảy chi tiết nổi lên cùng với tăng cường suy luận là vấn đề độ mịn (Granularity) của phần thưởng. Phần thưởng theo kết quả (Outcome Reward) chỉ đánh giá kết quả cuối thì dễ thiết kế nhưng không thể cho biết bước nào sai trong một quá trình suy luận dài. Đáp lại, một mô hình phần thưởng theo quá trình (PRM, Process Reward Model) đánh giá từng bước suy luận đã được đề xuất, và hướng nâng độ chính xác của suy luận toán và logic phức tạp bằng cách cấp tín hiệu mịn theo từng bước đang được nghiên cứu. Tuy nhiên vì chi phí gán nhãn theo từng bước lớn, làm sao kết hợp phần thưởng theo kết quả kiểm chứng được với phần thưởng theo quá trình vẫn là một bài toán còn lại.

Trọng tâm nghiên cứu căn chỉnh đang dịch chuyển từ "mô phỏng sở thích con người" sang "tăng cường suy luận dựa trên phần thưởng kiểm chứng được". Năm 2025 nhiều khảo sát chỉ ra rằng tuy RLHF vẫn là chuẩn, nó chia sẻ ba bài toán chưa giải: hack phần thưởng, chi phí tính toán, và thu thập phản hồi có khả năng mở rộng. Dòng DPO đang phân hóa theo hướng mô-đun hóa, ổn định và hiệu quả là loại bỏ mô hình tham chiếu và mở rộng các định dạng phản hồi, còn GRPO và RLVR đã mở ra một hạng mục mới là mô hình suy luận (Reasoning Model), tiêu biểu là DeepSeek-R1, Kimi và các mô hình khác.

Dù vậy, phần thưởng kiểm chứng được có giới hạn là chỉ áp dụng được cho các lĩnh vực mà đáp án rõ ràng, và ở các lĩnh vực mà chất lượng chủ quan quan trọng — như viết sáng tạo và đồng cảm trong hội thoại — thì vẫn cần sở thích của con người/AI. Ngoài ra, các bài toán cũng đang được nghiên cứu sôi nổi như thuế căn chỉnh (Alignment Tax) trong đó căn chỉnh quá mức làm giảm sự đa dạng và sáng tạo của mô hình, thiên lệch sở thích trong đó sở thích của một nhóm nhất định bị đại diện quá mức, và khuếch đại thiên lệch của RLAIF dùng một LLM đánh giá. Trong thực tế, thay vì một kỹ thuật đơn lẻ, một đường ống hậu huấn luyện lai kết hợp SFT→DPO/RLHF→RLVR theo từng bước đang trở thành chuẩn. Nghĩa là một sự phân vai đang định hình, trong đó SFT dựng nền tảng, căn chỉnh theo sở thích tinh chỉnh tính hữu ích và an toàn, rồi RLVR tăng cường suy luận trong các lĩnh vực kiểm chứng được.

Đo lường thành quả của căn chỉnh thế nào cũng là một vấn đề chuyên sâu. Vì một chỉ số đơn lẻ dễ gây tối ưu quá mức, trong thực tế các chỉ số như tỷ lệ tuân thủ chỉ dẫn, tỷ lệ vi phạm an toàn, tỷ lệ thắng về tính hữu ích (theo con người hoặc một mô hình phán xử mạnh), tỷ lệ ảo giác, tỷ lệ từ chối thái quá được đo đồng thời theo nhiều trục, và khoảng cách giữa điểm benchmark với mức hài lòng thực tế của người dùng được kiểm tra định kỳ. Đặc biệt khi đánh giá bằng "LLM phán xử", phải hiệu chỉnh thiên lệch đánh giá nghiêng về độ dài và định dạng của phản hồi thì mới có được so sánh đáng tin.

Một bài toán căn bản khác là giám sát có khả năng mở rộng (Scalable Oversight). Ở các lĩnh vực mà năng lực của mô hình vượt người đánh giá (ví dụ chứng minh toán độ khó cao, rà soát một kho mã dài), con người khó phán định đáng tin cậy ưu thế của các phản hồi, nên bản thân căn chỉnh dựa trên sở thích con người đụng trần. Đáp lại, người ta đang khám phá hỗ trợ tranh luận (Debate) và phê bình (Critique) trong đó mô hình giúp mô hình, cùng khái quát hóa yếu-mạnh (Weak-to-strong Generalization) căn chỉnh một mô hình mạnh bằng một người giám sát yếu. Thêm vào đó, căn chỉnh đa mục tiêu (Multi-objective Alignment) xử lý tình huống tính hữu ích và tính vô hại xung đột, cùng căn chỉnh cá nhân hóa, đa nguyên (Pluralistic Alignment) phản ánh các giá trị khác nhau theo người dùng và tổ chức, cũng đang nổi lên như những mặt trận nghiên cứu quan trọng.

Tóm lại, cảnh quan căn chỉnh năm 2025 đang trưởng thành không thành "một thuật toán đúng duy nhất" mà thành một hệ sinh thái hậu huấn luyện nhiều tầng kết hợp phản hồi của con người, AI, quy tắc với học trực tuyến và ngoại tuyến tùy đặc tính nhiệm vụ. Dưới góc nhìn Kỹ sư chuyên nghiệp, điều quan trọng hơn công thức của một kỹ thuật cụ thể là năng lực phán đoán tổ hợp nào là lựa chọn chi phối dưới các ràng buộc dữ liệu, quy định và chi phí mà tổ chức đối mặt, và quản lý rủi ro của lựa chọn đó.

7. Các điểm cân nhắc và hàm ý

  • Quản trị dữ liệu và tính đại diện của sở thích: Chất lượng RLHF phụ thuộc vào chất lượng, tính nhất quán và tính đại diện của dữ liệu sở thích. Vì một thành phần người đánh giá thiên lệch sẽ làm mô hình nghiêng về giá trị của một nhóm nhất định, cần thiết kế trước quản trị dữ liệu — bao gồm chuẩn hóa thước đánh giá (Rubric), bảo đảm sự đa dạng của người đánh giá, và quản lý nguồn gốc, sự đồng thuận và bản quyền của dữ liệu sở thích.
  • Lựa chọn kỹ thuật dựa trên hiệu quả-chi phí: Nếu khó bảo đảm sở thích con người hoặc ngân sách tính toán hạn chế thì xuất phát từ DPO; với nhiệm vụ chấm tự động được thì dùng RLVR; và với dịch vụ có rủi ro an toàn và quy định lớn thì một chiến lược danh mục chạy RLHF có người rà soát cùng với Constitutional AI là đáng mong muốn. Tổ hợp tối ưu theo từng nhiệm vụ mới là mấu chốt, hơn là bám vào một kỹ thuật đơn lẻ.
  • Giám sát hack phần thưởng và thuế căn chỉnh: Phải quan sát liên tục việc khoét lỗ hổng của mô hình phần thưởng, sự suy giảm sáng tạo do căn chỉnh quá mức, và sự từ chối thái quá (Over-refusal). Đưa vào hệ thống vận hành việc điều chỉnh hệ số KL, định kỳ huấn luyện lại mô hình phần thưởng, và thu thập các trường hợp né tránh qua đội đỏ (red team), đồng thời vận hành bộ chỉ số đánh giá đa trục đo cả hiệu năng căn chỉnh lẫn tính hữu ích.
  • Căn chỉnh liên tục dưới góc nhìn vòng đời vận hành: Căn chỉnh không nên được tiếp cận như một công việc một lần mà như một vòng đời liên tục (Continuous Alignment) trong đó, sau khi triển khai mô hình, dữ liệu sở thích được cập nhật và tái căn chỉnh theo kịp các prompt né tránh mới, sự thay đổi giá trị xã hội và sự mở rộng lĩnh vực. Vì thế nên nội tại hóa vào kiến trúc vận hành một bánh đà dữ liệu đưa nhật ký phản hồi người dùng ngược về làm dữ liệu sở thích, các bài kiểm thử hồi quy hiệu năng căn chỉnh theo từng phiên bản, và một hệ thống quay lui (rollback).
  • Liên kết an toàn-quy định và triển vọng: Các quy định như EU AI Act yêu cầu giám sát của con người và quản lý rủi ro đối với AI rủi ro cao, và RLHF cùng Constitutional AI là phương tiện chống đỡ điều này về mặt kỹ thuật. Thời gian tới sẽ cần một đường ống căn chỉnh kiểm chứng được và kiểm toán được liên kết với [[ai-trustworthiness]], [[ai-red-teaming]] và [[ai-model-risk-management]], và cùng với sự lan rộng của AI trên-thiết-bị và dạng tác tử, tầm quan trọng của các kỹ thuật căn chỉnh nhẹ và liên tục dự kiến sẽ tăng.

Tài liệu tham khảo


Tóm tắt một câu: RLHF là công thức hậu huấn luyện chuẩn chưng cất sở thích con người vào LLM qua ba giai đoạn SFT→mô hình phần thưởng→PPO để căn chỉnh tính hữu ích, trung thực và vô hại; cốt lõi là kìm hãm hack phần thưởng bằng ràng buộc KL, và nó đang tiến hóa theo hướng tăng cường suy luận qua DPO, RLAIF, Constitutional AI và GRPO/RLVR vốn thay đổi chi phí và chủ thể phản hồi.