RLHF(인간 피드백 기반 강화학습)와 LLM 정렬(Alignment)
1. 개요
RLHF(Reinforcement Learning from Human Feedback) 란 사람이 매긴 선호(Preference) 데이터로 보상 모델(Reward Model)을 학습하고, 그 보상을 신호로 강화학습을 수행하여 거대언어모델(LLM)의 출력이 인간의 의도·가치·안전 기준에 부합하도록 조정(Alignment)하는 사후학습(Post-training) 기법이다.
사전학습(Pre-training)만 마친 LLM은 방대한 웹 말뭉치의 다음 토큰 확률을 모사하도록 최적화된 모델일 뿐이어서, "유창하지만 사용자가 실제로 원하는 것"과는 체계적으로 어긋난다. 이 불일치는 세 가지 양상으로 나타난다. 첫째, 지시 미이행이다. "세 문장으로 요약하라"는 요청에 장문을 쏟아내는 식으로, 확률적으로 그럴듯한 연속을 생성할 뿐 지시를 과업으로 받아들이지 못한다. 둘째, 환각과 과신이다. 근거 없는 사실을 자신 있게 단정하는데, 이는 말뭉치에 흔한 "단정적 서술" 패턴을 모방한 결과다. 셋째, 유해성이다. 차별·폭력·불법 조력 등 학습 데이터에 섞인 유해 패턴을 그대로 재현한다. RLHF는 이처럼 학습 목적함수(다음 토큰 예측)와 실제 효용(유용성·정직성·무해성, 이른바 3H: Helpful·Honest·Harmless) 사이의 간극을 메우기 위해 등장하였다.
정렬이 추구하는 목표는 흔히 3H로 요약된다. 유용성(Helpful) 은 사용자의 실제 의도를 파악해 과업을 완수하는 능력, 정직성(Honest) 은 모르는 것을 모른다고 밝히고 사실을 왜곡하지 않는 태도, 무해성(Harmless) 은 위험·차별·불법 조력을 거부하는 안전성을 뜻한다. 문제는 이 셋이 자주 충돌한다는 점이다. 예컨대 위험한 질문에 "완전히 유용"하려면 무해성을 희생해야 하고, 지나치게 무해성에 치우치면 정당한 요청까지 거부하는 과잉 거부(Over-refusal)로 유용성이 훼손된다. RLHF는 이처럼 상충하는 가치들 사이의 균형점을 사람 선호로부터 학습하게 하는 장치라는 점에서, 단순한 성능 개선 기법을 넘어 가치 정렬(Value Alignment)의 성격을 갖는다.
RLHF가 지도 미세조정(SFT, Supervised Fine-Tuning)만으로 해결되지 않는 근본 이유는 정답을 일일이 쓰는 것보다 둘을 비교하는 것이 훨씬 쉽고 값싸기 때문이다. "좋은 답변"을 처음부터 작성하게 하면 전문가 비용이 폭증하지만, 두 응답 중 어느 쪽이 나은지 고르게 하면 비전문가도 빠르게 대량의 신호를 만들 수 있다. 또한 요약의 품질·공손함·안전성처럼 미분 불가능하고 정량화하기 어려운 목표는 손실 함수로 직접 표현하기 어렵지만, 보상 모델이라는 "학습된 평가자"를 통해 간접적으로 최적화할 수 있다. 2022년 OpenAI의 InstructGPT와 ChatGPT가 이 방식으로 사용성을 비약적으로 끌어올리면서 RLHF는 생성형 AI 정렬의 사실상 표준 레시피로 자리 잡았다.
RLHF의 뿌리는 2017년 OpenAI·딥마인드가 로봇·게임 제어에서 "사람 선호로 보상을 학습"한 연구로 거슬러 올라가며, 이후 요약 과업(2020)을 거쳐 범용 지시 수행(2022)으로 확장되었다. 즉 RLHF는 LLM을 위해 갑자기 등장한 기법이 아니라, 보상을 직접 설계하기 어려운 문제에 사람의 판단을 끌어들이는 강화학습의 오랜 흐름이 언어 모델에 접목된 결과다. 이 계보를 이해하면, 최근 RLVR이 "사람 판단" 자리에 "규칙 검증"을 넣는 것 역시 같은 문제의식의 연장선임을 알 수 있다.
2. RLHF의 3단계 파이프라인과 구성요소
RLHF는 단일 알고리즘이 아니라 SFT → 보상 모델링 → 강화학습으로 이어지는 3단계 파이프라인이다. 각 단계는 앞 단계의 산출물을 입력으로 받으며, 전체적으로 "사람의 선호를 모델 내부로 증류(Distill)하는" 과정으로 볼 수 있다.
graph TD
P["사전학습 LLM<br/>(Base Model)"] --> S["1단계: SFT<br/>지시-응답 데이터 지도학습"]
S --> G["여러 응답 샘플링"]
G --> H["사람이 응답 쌍 선호 비교<br/>(A vs B 순위)"]
H --> R["2단계: 보상 모델(RM) 학습<br/>스칼라 선호 점수 예측"]
S --> PO["3단계: 강화학습(PPO)<br/>정책 LLM 업데이트"]
R -->|"보상 신호"| PO
PO -->|"정렬된 모델"| F["Aligned LLM"]
S -.->|"KL 기준 모델"| PO
1단계 지도 미세조정(SFT) 은 고품질 지시-응답(Instruction-Response) 시연 데이터로 기반 모델을 미세조정하여, "대화 형식으로 지시를 따르는" 기본 능력을 부여한다. 수만~수십만 건의 시연으로 모델을 "출발선"에 올려놓는 단계이며, 이후 강화학습의 초기 정책(Initial Policy)이자 과도한 일탈을 막는 기준점(Reference) 역할을 겸한다. SFT가 부실하면 이후 단계가 아무리 정교해도 탐색 공간이 왜곡되므로, 실무에서는 SFT 데이터의 품질이 최종 성능을 좌우하는 경우가 많다.
2단계 보상 모델(RM) 학습 은 동일 프롬프트에 대해 정책 모델이 생성한 여러 응답을 사람이 상대 비교(랭킹) 한 데이터로 진행한다. 사람에게 1~10점의 절대 점수를 매기게 하면 평가자 간 기준이 제각각이어서 잡음이 크지만, "A가 B보다 낫다"는 쌍별 비교(Pairwise Comparison)는 일관성이 높다. 보상 모델은 기반 LLM의 헤드를 스칼라 출력으로 바꾼 구조로, 브래들리-테리(Bradley-Terry) 모델에 기반해 선호된 응답에 더 높은 점수를 부여하도록 학습한다. 즉 손실은 선호 응답과 비선호 응답의 점수 차에 로지스틱을 씌운 형태이며, 이를 통해 사람의 암묵적 효용 함수를 근사한다.
3단계 강화학습 에서는 SFT 모델을 초기 정책으로 삼아, 보상 모델이 주는 점수를 보상으로 하여 정책을 업데이트한다. 여기서 LLM은 "프롬프트(상태)에서 토큰 시퀀스(행동)를 생성하고 보상을 받는 에이전트"로 형식화되며, 가장 널리 쓰이는 알고리즘이 PPO(Proximal Policy Optimization) 다. 바둑·로봇 제어의 강화학습과 달리 언어 모델에서는 행동 공간이 수만 개 토큰의 연속 생성이라는 초고차원이고, 보상도 응답 전체에 대해 한 번만 주어진다는 점에서 난도가 높다. 이 단계의 핵심 설계는 보상만을 맹목적으로 좇지 않도록 KL 발산(Kullback-Leibler Divergence) 페널티로 정책이 SFT 기준 모델에서 지나치게 벗어나지 않게 묶어 두는 것인데, 그 이유는 다음 절에서 상술한다.
세 단계를 굳이 분리하는 이유는 각 단계가 서로 다른 성격의 신호를 다루기 때문이다. SFT는 "무엇을 써야 하는가"라는 절대적 시연을, 보상 모델링은 "둘 중 무엇이 더 나은가"라는 상대적 선호를, 강화학습은 "새로 생성한 응답이 얼마나 좋은가"라는 탐색적 신호를 각각 처리한다. 특히 강화학습 단계는 데이터셋에 없던 응답을 모델이 스스로 생성하고 그에 대한 보상을 받는 온라인 탐색을 수행하므로, 고정된 정답을 모방하는 SFT만으로는 도달하기 어려운 영역까지 정책을 이동시킬 수 있다. 이것이 "SFT만으로 충분하지 않은가"라는 물음에 대한 핵심 답이며, 실제로 InstructGPT 실험에서도 SFT 모델보다 RLHF 모델이 사람 평가에서 일관되게 높은 선호를 받았다.
RLHF에서 다루는 피드백의 형식도 구분해 둘 필요가 있다. SFT가 사용하는 "정답 시연(Demonstration)"은 작성 비용이 높지만 가장 직접적인 신호이고, 보상 모델이 쓰는 "쌍별 비교(Comparison)"는 저렴하고 일관성이 높아 대량 확보에 유리하며, 일부 기법은 "좋음/나쁨"의 이진 피드백이나 수치 점수까지 활용한다. 어떤 형식을 택하느냐에 따라 데이터 수집 비용, 평가자 일관성, 그리고 적용 가능한 학습 알고리즘(PPO·DPO·KTO 등)이 달라지므로, 과업과 예산에 맞춰 피드백 형식을 설계하는 것이 정렬 프로젝트의 첫 의사결정이 된다.
선호 데이터의 수집 절차 자체도 품질을 좌우한다. 실무에서는 동일 프롬프트에 대해 정책이 생성한 4~9개의 응답을 평가자에게 제시하고 순위를 매기게 한 뒤, 이를 다수의 쌍별 비교로 분해해 학습에 사용한다. 이때 평가 지침(Annotation Guideline)이 모호하면 평가자 간 불일치(Inter-annotator Disagreement)가 커져 보상 모델이 잡음을 학습하므로, 유용성·정직성·무해성의 우선순위와 경계 사례 처리 기준을 사전에 명문화하는 것이 중요하다.
| 단계 | 입력 | 산출물 | 데이터 성격 | 규모(예시) |
|---|---|---|---|---|
| 사전학습 | 웹 말뭉치 | 기반 모델 | 비지도(자기회귀) | 수조 토큰 |
| 1. SFT | 지시-응답 시연 | 초기 정책 | 지도(정답 작성) | 수만~수십만 건 |
| 2. 보상 모델 | 응답 쌍 선호 | 보상 모델 | 쌍별 랭킹 | 수만~수백만 쌍 |
| 3. RL(PPO) | 프롬프트+RM | 정렬 모델 | 강화(보상 신호) | 수십만 프롬프트 |
세 단계가 끝난 뒤에도 정렬은 멈추지 않는다. 배포된 모델이 받은 사용자 피드백(좋아요/싫어요, 재작성 요청, 신고)은 다시 선호 데이터로 환류되어 다음 세대 보상 모델과 정책을 개선하는 데이터 플라이휠(Data Flywheel) 을 형성한다. 이 순환이 잘 작동하는 서비스일수록 실제 사용 분포에 맞는 정렬이 가능해지며, 이것이 대규모 상용 서비스가 초기 모델 품질을 빠르게 추월하는 주요 동력이 된다.
3. 보상 모델과 PPO 최적화의 동작 원리
3단계 강화학습의 내부는 생성 → 평가 → 갱신이 반복되는 온라인 루프다. 정책이 응답을 생성하면 보상 모델이 점수를 매기고, 그 보상과 KL 페널티를 합한 신호로 정책의 파라미터를 조정한다. 이 과정을 구조적으로 보면 네 종류의 모델이 동시에 상호작용한다.
graph LR
PR["프롬프트"] --> POL["정책 모델<br/>(Policy, 학습 대상)"]
POL -->|"응답 생성"| RM["보상 모델<br/>(Reward)"]
POL -->|"로그확률"| REF["기준 모델<br/>(Reference, 고정)"]
RM -->|"보상 r"| ADV["보상 보정<br/>r - β·KL"]
REF -->|"KL 계산"| ADV
ADV --> CRI["가치 모델<br/>(Critic)"]
CRI -->|"어드밴티지"| UPD["PPO 업데이트<br/>(클리핑)"]
UPD -->|"파라미터 갱신"| POL
보상 해킹(Reward Hacking)과 KL 제약. 보상 모델은 사람 선호의 불완전한 근사일 뿐이므로, 정책이 보상을 극단적으로 추구하면 보상 모델의 허점만 파고드는 퇴행적 출력(예: 특정 상투어 반복, 과도한 아부, 무의미한 장문)으로 수렴하는 보상 해킹이 발생한다. 이를 막기 위해 최종 목적함수는 "보상 − β·KL(정책‖기준모델)" 형태로 설계되어, 정책이 SFT 기준 모델과 토큰 분포상 너무 멀어지면 패널티를 받는다. β(KL 계수)는 정렬 강도와 언어 품질 유지 사이의 트레이드오프를 조절하는 핵심 하이퍼파라미터로, 너무 작으면 보상 해킹, 너무 크면 정렬 부족이 발생한다.
KL 페널티는 단순한 안전장치를 넘어 정렬의 철학적 전제를 담고 있다. 사전학습·SFT로 이미 방대한 언어 지식과 유창성을 확보한 모델을, 정렬 단계에서 "완전히 새로 가르치는" 것이 아니라 "기존 능력을 유지한 채 선호 방향으로 미세하게 조정"하겠다는 것이다. 즉 정렬은 백지에서의 학습이 아니라 잘 훈련된 모델에 대한 보수적 교정이며, KL 거리는 그 교정이 과도해지지 않도록 하는 정량적 제동장치다.
PPO의 안정화 메커니즘. 정책 경사(Policy Gradient)는 분산이 커 학습이 불안정하기로 악명 높다. PPO는 새 정책과 옛 정책의 확률비(Ratio)를 일정 범위(예: 1±0.2)로 클리핑(Clipping) 하여 한 번의 업데이트가 정책을 급격히 바꾸지 못하게 제한함으로써 안정성을 확보한다. 또한 어드밴티지(Advantage) 추정을 위해 별도의 가치 모델(Critic) 을 두는데, 결과적으로 RLHF의 PPO 단계는 정책·보상·기준·가치의 4개 대형 모델을 동시에 메모리에 올려야 하므로 연산·메모리 비용이 매우 크다. 이 비용 문제가 바로 뒤이어 등장하는 DPO 같은 경량 대안의 동기가 된다.
신호의 희소성과 크레딧 할당. LLM은 수백 토큰을 생성한 뒤에야 단 하나의 스칼라 보상을 받으므로, "어느 토큰이 좋은 결과에 기여했는가"를 분배하는 크레딧 할당(Credit Assignment) 이 어렵다. 실무에서는 보상을 마지막 토큰에 부여하고 KL 페널티를 토큰마다 분산시키는 방식으로 이 문제를 완화하며, 이는 바둑·게임 RL과 구분되는 언어 RL 고유의 난점이다.
네 모델의 역할을 정리하면, 정책 모델은 유일하게 학습되는 대상으로 응답을 생성하고, 기준 모델은 SFT 시점에서 동결(Freeze)되어 KL 계산의 기준을 제공하며, 보상 모델은 각 응답에 스칼라 점수를 부여하고, 가치 모델은 각 시점의 기대 보상을 추정해 어드밴티지 계산을 돕는다. 정책과 가치 모델은 학습 중 갱신되지만 기준·보상 모델은 고정되는데, 이처럼 "변하는 것과 변하지 않는 것"을 분리하는 설계가 학습의 안정성을 담보한다.
인프라와 롤아웃 비용. PPO 단계는 매 반복마다 현재 정책으로 다수의 프롬프트에 대해 응답을 생성(롤아웃, Rollout)하고, 이를 보상·기준·가치 모델로 평가한 뒤 역전파하는 구조여서, 생성 추론과 학습이 한 루프 안에 뒤섞인다. 이 때문에 추론 서빙 엔진과 학습 프레임워크를 결합한 전용 분산 시스템이 필요하며, 생성(온라인 샘플링) 단계가 전체 시간의 상당 부분을 차지한다. 바로 이 공학적 복잡성이 "강화학습 루프 없이 지도학습으로 환원"하려는 DPO 계열의 실무적 매력을 키운 배경이다.
보상 모델의 과최적화와 굿하트 법칙. "측정값이 목표가 되면 더 이상 좋은 측정값이 아니다"라는 굿하트 법칙(Goodhart's Law) 은 RLHF에 그대로 적용된다. 보상 모델은 사람 선호의 대리 지표(Proxy)일 뿐이므로, 정책을 보상 모델 기준으로 지나치게 최적화하면 초반에는 실제 품질과 보상이 함께 오르다가 어느 지점부터 실제 품질은 정체·하락하는데 보상 점수만 계속 오르는 과최적화(Overoptimization)가 나타난다. 이 때문에 운영에서는 KL 거리를 모니터링해 적정 지점에서 학습을 멈추거나, 선호 데이터를 추가 수집해 보상 모델을 주기적으로 재학습(Reward Model Refresh)하는 등의 방어 장치를 둔다.
4. 선호 정렬 알고리즘의 발전
RLHF의 복잡성·불안정성·비용 문제를 완화하기 위해 다양한 변형이 제안되었다. 핵심 흐름은 "사람 → AI로 피드백 주체를 바꾸거나(RLAIF), 강화학습 루프 자체를 제거(DPO)하거나, 크리틱을 없애(GRPO) 비용을 줄이는" 방향이다. 이들을 관통하는 질문은 "정렬에 필요한 신호를 누가, 어떤 형식으로, 얼마나 싸게 제공할 것인가"이며, 아래 네 기법은 그 답을 서로 다른 지점에서 제시한다.
네 기법은 크게 두 축으로 자리매김할 수 있다. 하나는 피드백 주체 축(사람 ↔ AI ↔ 규칙)이고, 다른 하나는 학습 구조 축(온라인 강화학습 ↔ 오프라인 지도학습)이다. RLHF가 "사람 + 온라인 RL"의 원형이라면, DPO는 학습 구조를 오프라인 지도학습으로 단순화했고, RLAIF·Constitutional AI는 피드백 주체를 AI로 옮겼으며, GRPO·RLVR은 보상 산출을 규칙·검증으로 바꾸면서 학습 구조도 효율화했다.
가. DPO(Direct Preference Optimization). 2023년 제안된 DPO는 "보상 모델 학습 + 강화학습"이라는 2단계를 단일 지도학습 손실로 대체한다. 수학적으로 RLHF 최적해의 보상을 정책 확률비로 재매개화할 수 있음을 이용해, 선호 쌍 데이터만으로 분류 문제처럼 정책을 직접 미세조정한다. 보상 모델·가치 모델·샘플링 루프가 사라져 구현이 단순하고 안정적이며 비용이 낮아, 오픈소스 커뮤니티를 중심으로 빠르게 확산되었다. 다만 오프라인 데이터에 의존하므로 분포 밖(Out-of-distribution) 프롬프트 대응력이나 탐색 다양성은 온라인 PPO보다 떨어질 수 있다. 이후 기준 모델이 필요 없는 SimPO, 이진 피드백을 쓰는 KTO, SFT와 선호학습을 통합한 ORPO 등 파생 기법이 잇따랐다.
나. RLAIF(RL from AI Feedback). 사람 라벨링은 느리고 비싸며 확장성이 낮다. RLAIF는 선호 비교를 별도의 LLM이 평가자(Judge)로서 수행하게 하여 피드백을 대량·저비용으로 생성한다. 사람 대비 수십 배 빠르고 일관성이 높다는 장점이 있으나, 평가 LLM의 편향이 그대로 전이되고 피드백 루프를 거치며 오류가 증폭될 위험이 있어, 사람 피드백과 혼합하거나 평가 기준을 명시적으로 고정하는 방식이 함께 쓰인다. 쉬운 비교 쌍부터 어려운 쌍으로 단계적으로 학습시키는 커리큘럼 RLAIF처럼, 평가자 LLM의 신뢰도를 높이려는 보완 기법도 제안되고 있다.
다. Constitutional AI(헌법적 AI). Anthropic이 제안한 기법으로, 사람이 유해성을 일일이 라벨링하는 대신 명문화된 원칙(Constitution) 을 두고 모델이 스스로 자기 응답을 비평·수정(Self-critique)하게 한 뒤, 그 결과로 선호 데이터를 만들어 학습한다. RLAIF의 원칙 기반 형태로 볼 수 있으며, 무해성 라벨링의 사람 개입을 최소화하면서 정렬 기준을 투명·일관되게 유지한다는 점에서 거버넌스 관점의 강점이 있다.
Constitutional AI의 절차는 두 국면으로 나뉜다. 지도 국면에서는 모델이 유해할 수 있는 응답을 생성한 뒤, 헌법의 원칙에 비추어 스스로 비평하고 더 나은 응답으로 수정하며, 이 수정된 응답으로 모델을 재학습한다. 이어지는 강화학습 국면에서는 두 응답 중 어느 쪽이 원칙에 더 부합하는지를 모델이 판정해 선호 데이터를 만들고 이를 RLAIF로 학습한다. 핵심은 유해성 판단의 근거가 되는 원칙이 명문으로 공개·감사 가능하다는 점으로, "왜 이 응답을 거부·수정했는가"를 추적할 수 있어 설명가능성과 거버넌스 요구에 부합한다.
라. GRPO·RLVR(검증 가능 보상 기반 RL). 2025년 DeepSeek-R1이 대중화한 GRPO(Group Relative Policy Optimization) 는 가치 모델(Critic)을 제거하고, 같은 프롬프트에 대한 여러 응답의 상대적 우열(그룹 상대 어드밴티지) 로 학습하여 메모리 비용을 크게 낮췄다. 특히 수학·코딩처럼 정답을 자동 채점할 수 있는 영역에서는 사람 선호 대신 규칙 기반의 검증 가능한 보상(RLVR, RL with Verifiable Rewards) 을 써서, 보상 해킹을 줄이고 단계적 추론(Reasoning) 능력을 끌어올리는 "추론 모델" 계열의 핵심 동력이 되었다.
| 기법 | 피드백 주체 | RL 루프 | 보상/가치 모델 | 특징 |
|---|---|---|---|---|
| RLHF(PPO) | 사람 | 온라인 | 둘 다 필요 | 표준·고비용·보상 해킹 주의 |
| DPO | 사람 | 없음(지도) | 불필요 | 단순·안정·저비용, 탐색 제한 |
| RLAIF | AI | 온라인/오프라인 | RM 필요 | 확장성↑, 편향 전이 위험 |
| Constitutional AI | AI+원칙 | 혼합 | 일부 | 무해성·투명성, 거버넌스 친화 |
| GRPO/RLVR | 규칙/검증 | 온라인 | 가치 모델 제거 | 추론 강화·효율, 채점 가능 영역 |
이 발전 과정을 관통하는 교훈은 "정렬의 병목은 모델이 아니라 피드백" 이라는 점이다. 초기에는 사람 선호를 어떻게 모델에 주입할지가 관건이었으나(RLHF), 사람 피드백의 비용·확장성 한계가 드러나면서 피드백 주체를 AI로 옮기거나(RLAIF·Constitutional AI), 아예 규칙으로 검증 가능한 보상을 설계하는(RLVR) 방향으로 진화했고, 동시에 학습 알고리즘은 더 단순하고 저렴한 쪽으로(DPO·GRPO) 수렴해 왔다. 따라서 어떤 기법을 택하든 양질의 피드백 신호를 안정적으로 확보하는 데이터 파이프라인이 정렬 성패의 핵심이라는 결론에 이른다.
5. 비교 및 적용 사례
서로 다른 정렬 기법은 "무엇을 최적화하느냐"가 아니라 "무엇을 포기하느냐"로 구별된다. RLHF는 최고 수준의 유연성과 온라인 탐색을 얻는 대신 막대한 연산과 불안정성을 감수하고, DPO는 안정성과 저비용을 얻는 대신 오프라인 데이터의 범위에 갇히며, RLVR은 보상의 신뢰성을 얻는 대신 적용 영역이 검증 가능한 과업으로 제한된다. 따라서 "가장 좋은 기법"은 없고 과업·데이터·예산의 제약 조건에서 지배적 대안(Dominant Choice) 을 찾는 공학적 판단만이 있다.
RLHF와 그 대안의 선택은 데이터 확보 여건·연산 예산·과업 성격이라는 세 축의 트레이드오프로 귀결된다. 사람 선호를 확보하기 어렵고 연산 자원이 넉넉하지 않은 조직은 DPO 계열로 시작하는 것이 합리적이며, 안전·법적 책임이 큰 서비스일수록 사람 검수를 포함한 RLHF와 Constitutional AI를 병행하는 경향이 있다. 반대로 수학·코딩·에이전트형 과업처럼 정답을 자동 검증할 수 있는 영역에서는 RLVR이 비용 대비 효과가 압도적이다.
구체 사례를 보면, OpenAI의 InstructGPT 논문은 1.3B 파라미터의 RLHF 모델이 175B GPT-3보다 사람 평가에서 선호되었다고 보고하여, 정렬이 단순 규모 확장보다 사용성에 크게 기여함을 보였다. 즉 100배 이상의 파라미터 격차를 정렬 기법이 역전시킨 셈으로, "큰 모델을 정렬 없이 쓰는 것보다 작은 모델을 잘 정렬하는 것"이 사용성 면에서 유리할 수 있음을 시사한다. 요약 과업 실험에서도 RLHF 모델의 요약이 사람 작성 참조 요약과 대등하거나 더 선호되는 결과가 나왔다.
적용 영역별로 기법 선택이 어떻게 갈리는지도 구체적으로 살펴볼 만하다. 고객 응대 챗봇처럼 어조·공손함·브랜드 일관성이 중요한 서비스는 사람·AI 선호 비교로 미묘한 품질을 조정하는 RLHF·DPO가 적합하다. 반면 코딩 어시스턴트는 생성된 코드가 테스트를 통과하는지를 자동으로 채점할 수 있으므로 RLVR이 효과적이며, 실제로 단위 테스트 통과 여부를 보상으로 쓰면 사람 라벨 없이도 코드 정확도를 끌어올릴 수 있다. 수학 풀이 역시 최종 답의 정오를 규칙으로 검증할 수 있어 RLVR 계열이 표준으로 자리 잡는 추세다. 이처럼 "보상을 값싸고 신뢰성 있게 얻을 수 있는가"가 기법 선택의 실질적 기준이 된다.
2025년 DeepSeek-R1은 GRPO와 검증 가능 보상만으로 복잡한 수학·코딩 벤치마크 성능을 크게 끌어올려, 값비싼 사람 라벨링 없이도 추론 능력을 강화할 수 있음을 보였다. 이 사례는 보상 설계를 "사람 선호"에서 "정답 검증"으로 바꾸면 보상 해킹 여지가 줄고 학습이 단순해진다는 점을 실증했다는 데 의의가 있다. 한편 비용 측면에서 DPO는 PPO 대비 학습에 올려야 할 대형 모델 수를 4개에서 2개로 줄여 GPU 메모리와 구현 복잡도를 크게 낮추므로, 자원이 제한된 조직이 선호 정렬을 시도하는 진입 장벽을 낮췄다. 국내에서도 금융·공공 분야 LLM 구축 시 도메인 전문가의 선호 피드백으로 응답의 규정 준수성과 어조를 조정하는 사례가 늘고 있으며, 민감 영역에서는 사람 검수와 자동 평가를 결합한 하이브리드 방식이 선호된다.
6. 심화: 2025년 정렬 기술의 최신 동향
추론 강화와 함께 떠오른 세부 흐름이 보상의 입도(Granularity) 문제다. 최종 결과만 평가하는 결과 보상(Outcome Reward)은 설계가 쉽지만 긴 추론 과정에서 어느 단계가 틀렸는지 알려주지 못한다. 이에 추론의 각 단계를 평가하는 과정 보상 모델(PRM, Process Reward Model) 이 제안되어, 단계별로 세밀한 신호를 줌으로써 복잡한 수학·논리 추론의 정확도를 높이는 방향이 연구되고 있다. 다만 단계별 라벨링 비용이 커, 검증 가능한 결과 보상과 과정 보상을 어떻게 결합할지가 과제로 남아 있다.
정렬 연구의 무게중심은 "사람 선호 모사"에서 "검증 가능한 보상 기반 추론 강화"로 이동하고 있다. 2025년 다수의 서베이는 RLHF가 여전히 표준이지만 보상 해킹·연산 비용·확장 가능한 피드백 수집이라는 세 가지 미해결 과제를 공유한다고 지적한다. DPO 계열은 참조 모델을 제거하고 피드백 형식을 넓히는 모듈형·안정·효율 방향으로 분화하고 있으며, GRPO·RLVR은 DeepSeek-R1·Kimi 등으로 대표되는 추론 모델(Reasoning Model) 이라는 새 범주를 열었다.
다만 검증 가능 보상은 정답이 명확한 영역에만 적용 가능하다는 한계가 있고, 창의적 글쓰기·대화 공감처럼 주관적 품질이 중요한 영역에서는 여전히 사람·AI 선호가 필요하다. 또한 과도한 정렬이 모델의 다양성·창의성을 떨어뜨리는 정렬세(Alignment Tax), 특정 집단 선호가 과대대표되는 선호 편향, 평가자 LLM을 쓰는 RLAIF의 편향 증폭 등은 활발히 연구 중인 과제다. 실무에서는 단일 기법보다 SFT→DPO/RLHF→RLVR을 단계적으로 조합하는 하이브리드 사후학습 파이프라인이 표준이 되어 가고 있다. 즉 SFT로 기본기를 세우고, 선호 정렬로 유용성·안전성을 다듬은 뒤, 검증 가능한 영역에서는 RLVR로 추론을 강화하는 식의 역할 분담이 자리 잡는 중이다.
정렬의 성과를 어떻게 측정할 것인가도 심화 쟁점이다. 단일 지표로는 과최적화를 유발하기 쉬우므로, 실무에서는 지시 이행률·안전성 위반율·유용성 승률(사람 또는 강한 심판 모델 기준)·환각률·과잉 거부율 등을 다축으로 동시 측정하고, 벤치마크 점수와 실제 사용자 만족도 간의 괴리를 주기적으로 점검한다. 특히 "심판 LLM"으로 평가할 때는 응답 길이·형식에 치우치는 평가 편향을 보정해야 신뢰할 수 있는 비교가 가능하다.
또 하나의 근본 과제는 확장 가능한 감독(Scalable Oversight) 이다. 모델의 능력이 사람 평가자를 넘어서는 영역(예: 고난도 수학 증명, 장문 코드베이스 검토)에서는 사람이 응답의 우열을 신뢰성 있게 판정하기 어려워, 사람 선호에 기반한 정렬 자체가 상한에 부딪힌다. 이에 모델이 모델을 돕는 토론(Debate)·비평(Critique) 보조, 약한 감독자로 강한 모델을 정렬하는 약-강 일반화(Weak-to-strong Generalization) 등이 탐구되고 있다. 아울러 유용성과 무해성이 충돌하는 상황을 다루는 다목적 정렬(Multi-objective Alignment), 사용자·조직마다 다른 가치를 반영하는 개인화·다원적 정렬(Pluralistic Alignment) 도 중요한 연구 전선으로 부상하고 있다.
요약하면 2025년의 정렬 지형은 "하나의 정답 알고리즘"이 아니라, 과업 특성에 따라 사람·AI·규칙 피드백과 온라인·오프라인 학습을 조합하는 다층적 사후학습 생태계로 성숙하고 있다. 기술사 관점에서는 특정 기법의 수식보다, 조직이 처한 데이터·규제·비용 제약에서 어떤 조합이 지배적 선택인지 판단하고 그 선택의 리스크를 관리하는 역량이 더 중요해진다.
7. 고려사항 및 시사점
- 데이터 거버넌스와 선호의 대표성: RLHF의 품질은 선호 데이터의 품질·일관성·대표성에 좌우된다. 평가자 구성이 편향되면 모델이 특정 집단의 가치에 쏠리므로, 평가 지침(Rubric) 표준화, 평가자 다양성 확보, 선호 데이터의 출처·동의·저작권 관리를 포함한 데이터 거버넌스를 선제적으로 설계해야 한다.
- 비용-효과 기반 기법 선택: 사람 선호 확보가 어렵거나 연산 예산이 제한적이면 DPO로 출발하고, 자동 채점이 가능한 과업은 RLVR을, 안전·규정 리스크가 큰 서비스는 사람 검수 RLHF와 Constitutional AI를 병행하는 포트폴리오 전략이 바람직하다. 단일 기법 고수보다 과업별 최적 조합이 핵심이다.
- 보상 해킹·정렬세의 모니터링: 보상 모델의 허점 악용, 과잉 정렬에 따른 창의성 저하, 과도한 거부(Over-refusal)를 지속 관측해야 한다. KL 계수 조정, 보상 모델 주기적 재학습, 레드팀을 통한 회피 사례 수집을 운영 체계에 포함하고, 정렬 성능과 유용성을 함께 측정하는 다축 평가 지표를 운영해야 한다.
- 운영 수명주기 관점의 지속 정렬: 정렬은 일회성 작업이 아니라, 모델 배포 후 새로운 회피 프롬프트·사회적 가치 변화·도메인 확장에 맞춰 선호 데이터를 갱신하고 재정렬하는 연속적 수명주기(Continuous Alignment) 로 접근해야 한다. 이를 위해 사용자 피드백 로그를 선호 데이터로 환류하는 데이터 플라이휠, 버전별 정렬 성능 회귀 테스트, 롤백 체계를 운영 아키텍처에 내재화하는 것이 바람직하다.
- 안전·규제 연계와 전망: EU AI Act 등 규제는 고위험 AI의 인적 감독·위험관리를 요구하며, RLHF·Constitutional AI는 이를 기술적으로 뒷받침하는 수단이다. 향후 [[ai-trustworthiness]]·[[ai-red-teaming]]·[[ai-model-risk-management]]와 연계한 검증 가능하고 감사 가능한 정렬 파이프라인이 요구되며, 온디바이스·에이전트형 AI 확산에 따라 경량·연속 정렬 기법의 중요성이 커질 전망이다.
참고자료
- Ouyang et al., Training language models to follow instructions with human feedback (InstructGPT), 2022 — https://arxiv.org/abs/2203.02155
- Rafailov et al., Direct Preference Optimization, 2023 — https://arxiv.org/abs/2305.18290
- Bai et al., Constitutional AI: Harmlessness from AI Feedback, 2022 — https://arxiv.org/abs/2212.08073
- DeepSeek-AI, DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning, 2025 — https://arxiv.org/abs/2501.12948
한 줄 요약: RLHF는 SFT→보상 모델→PPO의 3단계로 사람의 선호를 LLM에 증류해 유용성·정직성·무해성을 정렬하는 사후학습 표준 레시피이며, 보상 해킹을 KL 제약으로 억제하는 것이 핵심이고, DPO·RLAIF·Constitutional AI·GRPO/RLVR로 비용과 피드백 주체를 달리하며 추론 강화 방향으로 진화하고 있다.