← Về danh sách
AI & Dữ liệu
#강화학습#RL#PPO#RLHF#탐험활용
Cập nhật lần cuối · 2026-08-30

Học tăng cường (Reinforcement Learning)

1. Tổng quan

Học tăng cường (Reinforcement Learning, RL) là mô hình học máy trong đó tác tử (Agent) tương tác với môi trường (Environment) và qua thử-sai (Trial and Error) tự học chính sách tối ưu (Optimal Policy) nhằm tối đa hóa phần thưởng tích lũy (Cumulative Reward).

Trong khi học có giám sát (Supervised Learning) cần "nhãn đáp án" và học không giám sát (Unsupervised Learning) chỉ dừng ở việc tìm "cấu trúc·mẫu", nhiều bài toán thực tế lại là bài toán ra quyết định tuần tự (Sequential Decision Making) trong đó không biết đáp án ở từng thời điểm nhưng có thể đánh giá kết quả cuối cùng tốt hay xấu (phần thưởng). Trong cờ vây, không có đáp án cho từng nước đi nhưng thắng thua thì rõ ràng; trong xe tự lái, góc lái ở mỗi thời điểm không có đáp án nhưng có thể đánh giá có xảy ra tai nạn hay không. Học tăng cường ra đời chính là để xử lý những bài toán như vậy, tức bài toán mà "lựa chọn hiện tại ảnh hưởng tới kết quả tương lai".

Sự cần thiết của học tăng cường xuất phát từ ba bối cảnh lớn. Thứ nhất là tránh chi phí gán nhãn. Học có giám sát đòi hỏi lượng dữ liệu đáp án khổng lồ, còn học tăng cường có thể học chỉ với tín hiệu phần thưởng do môi trường trả về nên gánh nặng xây dựng dữ liệu nhỏ. Thứ hai là ứng phó với môi trường động·tuần tự. Trong các bài toán như điều khiển robot, trò chơi, gợi ý, giao dịch — nơi trạng thái thay đổi theo thời gian và hành động trước làm thay đổi tình huống sau — cần chiến lược dài hạn chứ không phải dự đoán một lần. Thứ ba là khả năng đạt hiệu năng vượt con người. Khác với học có giám sát bị giam trong trần kinh nghiệm của con người, học tăng cường có thể khám phá lời giải vượt con người bằng tự đối kháng (Self-play), v.v. (AlphaGo·AlphaZero). Gần đây, nó còn mở rộng sang căn chỉnh theo sở thích con người (RLHF) của mô hình ngôn ngữ lớn (LLM), khiến tầm quan trọng thực tiễn tăng vọt.

2. Các thành phần và cấu trúc tương tác của học tăng cường

Học tăng cường được hình thức hóa bằng vòng lặp tương tác tác tử-môi trường. Tác tử quan sát trạng thái (State) hiện tại và chọn hành động (Action), còn môi trường trả về trạng thái kế tiếp và phần thưởng (Reward) cho hành động đó. Vòng này lặp lại và tác tử tích lũy tri thức "ở trạng thái nào, hành động nào có lợi về dài hạn".

graph LR
    A["Tác tử<br/>Agent"] -->|"hành động aₜ"| B["Môi trường<br/>Environment"]
    B -->|"trạng thái sₜ₊₁"| A
    B -->|"phần thưởng rₜ₊₁"| A
    A -.->|"cập nhật chính sách π"| A

Giải thích các khái niệm cốt lõi bằng văn xuôi như sau. Trạng thái (State) là bản tóm tắt tình huống môi trường cần cho việc ra quyết định, giả định tính chất Markov (Markov Property): tương lai chỉ phụ thuộc vào trạng thái hiện tại chứ không phải toàn bộ quá khứ. Hành động (Action) là các lựa chọn tác tử có thể thực hiện, còn phần thưởng (Reward) là tín hiệu vô hướng biểu thị tốt xấu tức thời của hành động. Điều quan trọng ở đây là tối đa hóa không phải phần thưởng tức thời mà lợi tức (Return, Gₜ = Σ γᵏ rₜ₊ₖ) — tổng các phần thưởng tương lai đã chiết khấu, và hệ số chiết khấu (γ, 0≤γ≤1) điều chỉnh mức độ coi trọng phần thưởng tương lai theo giá trị hiện tại.

Thứ tương ứng với bộ não của tác tử là chính sách (Policy, π), hàm ánh xạ trạng thái sang hành động. Thước đo đánh giá chính sách tốt hay xấu là hàm giá trị (Value Function), chia thành giá trị trạng thái V(s) biểu thị giá trị dài hạn của trạng thái và giá trị hành động Q(s,a) biểu thị giá trị của cặp trạng thái-hành động. Chúng được liên kết bằng phương trình Bellman (Bellman Equation), tức quan hệ đệ quy "giá trị hiện tại = phần thưởng tức thời + giá trị đã chiết khấu của trạng thái kế tiếp", và đây là nền tảng toán học của phần lớn thuật toán học tăng cường. Tùy việc có mô hình hóa động lực học của môi trường hay không, chia thành dựa trên mô hình (Model-based) — học·sử dụng mô hình — và không mô hình (Model-free) — chỉ học từ kinh nghiệm.

Thành phần Ký hiệu Ý nghĩa Ví dụ (xe tự lái)
Trạng thái s Tóm tắt tình huống môi trường Làn đường·xe xung quanh·tốc độ
Hành động a Thao tác có thể chọn Tăng tốc·phanh·đánh lái
Phần thưởng r Tín hiệu đánh giá tức thời Giữ làn +1, va chạm −100
Chính sách π(a|s) Ánh xạ trạng thái→hành động Chiến lược lái
Hàm giá trị V(s), Q(s,a) Lợi tức kỳ vọng dài hạn Đánh giá mức an toàn theo tình huống
Hệ số chiết khấu γ Mức quan trọng của phần thưởng tương lai 0.99

3. Phân loại phương thức học và thuật toán tiêu biểu

Thuật toán học tăng cường được chia theo đối tượng học thành dựa trên giá trị (Value-based), dựa trên chính sách (Policy-based), và actor-critic (Actor-Critic) kết hợp cả hai. Hiểu cách phân loại này chính là hiểu bản đồ địa hình của học tăng cường.

graph TD
    RL["Thuật toán học tăng cường"] --> VB["Dựa trên giá trị (Value-based)"]
    RL --> PB["Dựa trên chính sách (Policy-based)"]
    RL --> AC["Actor-Critic"]
    VB --> QL["Q-Learning / SARSA"]
    VB --> DQN["DQN (mạng Q sâu)"]
    PB --> PG["REINFORCE (gradient chính sách)"]
    AC --> A2C["A2C / A3C"]
    AC --> PPO["PPO / SAC"]
    QL --> APP1["Phù hợp không gian hành động rời rạc"]
    PPO --> APP2["Hành động liên tục·học ổn định"]

Phương pháp dựa trên giá trị học trước hàm giá trị tối ưu Q(s,a), rồi dẫn xuất gián tiếp chính sách bằng cách chọn hành động có giá trị lớn nhất ở mỗi trạng thái. Tiêu biểu, Q-learning là kỹ thuật ngoài chính sách (Off-policy), cập nhật với giả định hành động tối ưu bất kể hành động thực tế đã thực hiện, còn SARSA là kỹ thuật theo chính sách (On-policy), cập nhật bằng hành động kế tiếp thực tế đã thực hiện. Xấp xỉ hàm Q bằng mạng nơ-ron sâu chính là DQN của DeepMind năm 2015, giảm bất ổn trong học bằng phát lại kinh nghiệm (Experience Replay) và mạng đích (Target Network), đạt trình độ con người trên các trò chơi Atari và mở màn cho học tăng cường sâu (Deep RL). Tuy nhiên, phương pháp dựa trên giá trị chỉ hiệu quả khi không gian hành động rời rạc, khó áp dụng cho hành động liên tục (mô-men khớp robot, v.v.).

Phương pháp dựa trên chính sách không đi qua hàm giá trị mà tham số hóa trực tiếp chính sách π và thực hiện leo gradient (Gradient Ascent) theo hướng tăng lợi tức kỳ vọng. Phương pháp này xử lý tự nhiên không gian hành động liên tục và chính sách ngẫu nhiên, nhưng có nhược điểm phương sai ước lượng gradient lớn khiến học không ổn định. Actor-critic kết hợp ưu điểm của cả hai, học đồng thời actor (chính sách) quyết định hành động và critic (hàm giá trị) đánh giá hành động đó để giảm phương sai. PPO (Proximal Policy Optimization) — phương pháp được dùng rộng rãi nhất trong thực tế hiện nay — giới hạn biên độ cập nhật chính sách (Clipping) để bảo đảm cân bằng giữa ổn định và hiệu năng, và cũng được áp dụng trong RLHF của ChatGPT.

Phân loại Dựa trên giá trị Dựa trên chính sách Actor-critic
Đối tượng học Hàm giá trị Q Chính sách π Chính sách + giá trị
Không gian hành động Rời rạc Rời rạc·liên tục Rời rạc·liên tục
Độ ổn định Trung bình Thấp (phương sai cao) Cao
Tiêu biểu Q-Learning, DQN REINFORCE A2C, PPO, SAC

4. Thế lưỡng nan khám phá-khai thác và so sánh với học có giám sát

Thách thức căn bản xuyên suốt học tăng cường là thế lưỡng nan khám phá-khai thác (Exploration-Exploitation Dilemma). Tác tử phải cân bằng giữa mong muốn khai thác (Exploitation) hành động tốt đã biết để nhận phần thưởng ngay, và nhu cầu khám phá (Exploration) xem có hành động tốt hơn không. Khám phá không đủ sẽ rơi vào cực trị cục bộ (Local Optimum), còn khám phá quá mức khiến học kém hiệu quả. Để điều chỉnh, người ta dùng ε-greedy thực hiện hành động ngẫu nhiên với xác suất ε, UCB ưu đãi hành động có độ bất định lớn, khám phá Boltzmann dựa trên lấy mẫu xác suất, v.v. Ví dụ, trong gợi ý quảng cáo trực tuyến, đặt ε=0.1 thì 90% hiển thị quảng cáo có tỷ lệ nhấp đã được kiểm chứng và 10% hiển thị quảng cáo mới để cải thiện doanh thu dài hạn.

Lý do học tăng cường khác biệt về bản chất so với các mô hình học khác nằm ở tính chất của phản hồi. Học có giám sát nhận đáp án tức thời·trực tiếp cho mỗi mẫu, còn phần thưởng của học tăng cường bị trễ (Delayed), mang tính đánh giá (Evaluative) và có tương quan tuần tự (Correlated). Đặc biệt, bài toán gán công trạng (Credit Assignment Problem) — xác định "hành động nào trong quá khứ đã đóng góp vào phần thưởng hiện tại" — là độ khó cốt lõi, và phương trình Bellman cùng hệ số chiết khấu là các cơ chế xử lý nó.

Trục so sánh Học có giám sát Học không giám sát Học tăng cường
Tín hiệu học Nhãn đáp án Không có (khám phá cấu trúc) Phần thưởng (trễ·đánh giá)
Mục tiêu Cực tiểu hóa sai số dự đoán Mẫu·phân cụm Tối đa hóa phần thưởng tích lũy
Dữ liệu Tập dữ liệu cố định Tập dữ liệu cố định Sinh ra qua tương tác
Bài toán tiêu biểu Phân loại·hồi quy Phân cụm Ra quyết định tuần tự

Do những khác biệt này, học tăng cường có nhược điểm thực tiễn là kém hiệu quả về mẫu (Sample Inefficiency) lớn. Có thể cần hàng triệu~hàng trăm triệu lần tương tác mới có được chính sách tốt, nên trong môi trường có chi phí thử-sai lớn như robot thực, người ta kết hợp kỹ thuật Sim-to-Real — học trong bộ mô phỏng rồi chuyển sang thực tế — với cách tiếp cận ngẫu nhiên hóa miền (Domain Randomization) để thu hẹp khoảng cách thực tế (Reality Gap).

5. Chuyên sâu: Xu hướng mới và tình huống ứng dụng thực tế

RLHF và căn chỉnh LLM: Ứng dụng có sức lan tỏa lớn nhất của học tăng cường gần đây là học tăng cường từ phản hồi của con người (RLHF, Reinforcement Learning from Human Feedback). Học mô hình phần thưởng (Reward Model) từ dữ liệu so sánh sở thích của con người, rồi dùng nó làm tín hiệu phần thưởng để tinh chỉnh LLM bằng PPO nhằm nâng cao tính hữu ích·an toàn. Tuy nhiên, việc xây dựng mô hình phần thưởng·huấn luyện PPO phức tạp, nên các phương pháp đơn giản hóa như DPO (Direct Preference Optimization), RLAIF dùng phần thưởng dựa trên quy tắc, và học tăng cường nâng cao năng lực suy luận bằng phần thưởng có thể kiểm chứng (dựa trên chấm đáp án toán·lập trình) đang được nghiên cứu sôi nổi.

Tình huống ứng dụng công nghiệp: Google DeepMind báo cáo đã điều khiển làm mát trung tâm dữ liệu bằng học tăng cường, tiết kiệm khoảng 40% năng lượng làm mát; trong logistics·sản xuất, nó được áp dụng để tối ưu bổ sung tồn kho·lập lịch công đoạn, trong tài chính là tái cân bằng danh mục và thực thi lệnh (Execution). Các ca ứng dụng cũng đã được công bố trong điều khiển cầm nắm·đi bộ ở xe tự lái·thao tác robot, và tối ưu bố trí (Floorplanning) trong thiết kế bán dẫn·chip. Trong hệ thống gợi ý, nó đang tiến hóa theo hướng lấy thời gian lưu lại và quay lại dài hạn làm phần thưởng, thay vì chỉ số tức thời như cú nhấp, để học giá trị người dùng bền vững.

Các vấn đề về sử dụng có trách nhiệm: Học tăng cường được thiết kế để "tối đa hóa phần thưởng", nên nếu thiết kế phần thưởng sai sẽ phát sinh gian lận phần thưởng (Reward Hacking) — học các mánh không mong muốn. Ví dụ tiêu biểu là trong trò chơi chỉ tối đa hóa điểm mà bỏ qua mục tiêu, hay trong gợi ý chỉ kéo dài thời gian lưu lại bằng nội dung giật gân. Do đó, thiết kế hàm phần thưởng là nhiệm vụ cốt lõi về kỹ thuật·đạo đức quyết định thành bại của học tăng cường, và học tăng cường an toàn (Safe RL) nêu rõ các ràng buộc đang nổi lên.

6. Các điểm cần cân nhắc và hàm ý

Từ góc nhìn Kỹ sư chuyên nghiệp, việc đưa vào·ứng dụng học tăng cường cần cân nhắc tổng hợp các điểm sau.

  • Phải phán đoán mức độ phù hợp của bài toán trước tiên. Học tăng cường có thế mạnh trong môi trường ra quyết định tuần tự·phần thưởng trễ·có thể tương tác, nhưng với bài toán dự đoán một lần hoặc dồi dào dữ liệu đáp án thì học có giám sát hiệu quả hơn. Cần cảnh giác với cách tiếp cận "RL là vạn năng" và trước hết xem xét cấu trúc bài toán có được biểu diễn tự nhiên bằng quá trình quyết định Markov (MDP) hay không.

  • Thiết kế phần thưởng và bảo đảm bộ mô phỏng quyết định thành bại. Hàm phần thưởng phải phản ánh chính xác mục tiêu thực tế của tổ chức (giá trị dài hạn·an toàn·tuân thủ pháp quy), và thiết kế ràng buộc·hình phạt để chống gian lận phần thưởng là bắt buộc. Ngoài ra, với các miền có chi phí thử-sai thực tế lớn, phải lập kế hoạch đồng thời bộ mô phỏng chất lượng cao, chiến lược Sim-to-Real và học tăng cường ngoại tuyến (tận dụng dữ liệu log).

  • Phải quản lý đánh đổi giữa hiệu quả mẫu và chi phí vận hành. Học tăng cường sâu đòi hỏi tính toán·dữ liệu quy mô lớn, nên phải liên kết với hạ tầng GPU, pipeline huấn luyện và hệ thống MLOps bảo đảm khả năng tái lập. Lựa chọn giữa không mô hình (đa dụng·chi phí cao) và dựa trên mô hình (hiệu quả mẫu·rủi ro sai số mô hình) được quyết định theo đặc tính miền.

  • Phải nội tại hóa tính an toàn·khả năng giải thích·quản trị. Cần kiểm chứng trước các chế độ thất bại của chính sách đã học (lệch phân phối, vi phạm an toàn) và trang bị học tăng cường an toàn, con người trong vòng lặp (Human-in-the-loop) cùng hệ thống rollback. Đặc biệt, với các miền rủi ro cao như xe tự lái·y tế·tài chính, phải thiết kế quản trị sao cho nhất quán với các yêu cầu về độ tin cậy AI·pháp quy (Luật cơ bản về AI của Hàn Quốc, AI có trách nhiệm).

  • Triển vọng: Thông qua RLHF, học tăng cường đã trở thành công nghệ cốt lõi cho căn chỉnh·tăng cường suy luận của AI tạo sinh, và phạm vi áp dụng đang mở rộng sang RL ngoại tuyến, RL dựa trên mô hình và học tăng cường đa tác tử (MARL). Trong kỷ nguyên tác tử tự chủ (Agentic AI), với tư cách là nền tảng của năng lực "ra quyết định tự chủ hướng tới mục tiêu dài hạn", tầm quan trọng chiến lược của nó sẽ còn lớn hơn nữa.

Tài liệu tham khảo


Tóm tắt một câu: Học tăng cường là mô hình học trong đó tác tử học chính sách tối ưu nhằm tối đa hóa tích lũy các phần thưởng trễ·mang tính đánh giá qua thử-sai với môi trường, lấy các họ giá trị·chính sách·actor-critic cùng cân bằng khám phá-khai thác làm trục, và đang nổi lên như công nghệ cốt lõi cho căn chỉnh AI tạo sinh thông qua RLHF.