← 목록으로
AI·데이터
#PLM#LLM#사전학습#SFT#RLHF#133회
최종 업데이트 · 2026-09-29

PLM(사전학습 언어모델)에서 LLM으로의 발전

1. 개요

가. 정의

PLM(Pre-trained Language Model) 은 대규모 말뭉치로 언어의 일반 패턴을 사전학습(Pre-training) 한 뒤, 개별 다운스트림 과업에 미세조정(Fine-tuning) 해 활용하는 전이학습 기반 언어모델(BERT·초기 GPT 계열)을 말한다. LLM(Large Language Model) 은 이 PLM을 파라미터·데이터·연산 규모에서 수십~수백 배 키우고, 그 위에 지시학습과 인간 선호 정렬을 얹어 범용적으로 지시를 수행하는 초거대 언어모델을 가리킨다.

PLM의 핵심 발상은 "언어의 일반 지식을 한 번 크게 학습해 두고, 과업마다 조금씩만 조정한다"는 전이학습이다. 과업마다 처음부터 모델을 만들던 이전 방식과 달리, 방대한 텍스트에서 얻은 문맥·문법·상식을 재사용하므로 적은 라벨 데이터로도 높은 성능을 낸다. 이는 컴퓨터 비전에서 ImageNet으로 사전학습한 CNN을 여러 과업에 재활용하던 전략이 자연어처리로 옮겨온 것으로, 2018년 BERT·GPT의 등장 이후 NLP의 사실상 표준 패러다임이 되었다.

이 패러다임이 필요해진 배경에는 두 가지 현실적 제약이 있었다. 첫째, 과업별로 라벨링된 데이터를 대량으로 확보하는 일은 비용이 막대하고 도메인마다 반복해야 하는 낭비였다. 둘째, Word2Vec·GloVe 같은 정적 임베딩은 단어 하나에 벡터 하나를 고정 배정해 "배(선박)"와 "배(과일)"를 구분하지 못하는 다의어 한계가 있었다. 사전학습은 라벨 없는 텍스트만으로 언어 지식을 축적해 첫 번째 문제를, 문맥 기반 동적 임베딩으로 두 번째 문제를 동시에 해결했다.

나. PLM의 특성

PLM을 가능케 한 두 축은 자기지도학습(Self-supervised Learning) 과 트랜스포머(Transformer) 다. 자기지도학습은 사람이 라벨을 달지 않아도 텍스트 자체에서 학습 신호를 만든다. BERT는 문장 일부를 가리고 맞히는 MLM(Masked LM) 으로 좌우 양방향 문맥을 동시에 보게 하여 문장 이해(분류·개체명 인식 등)에 강하고, GPT는 다음 토큰을 예측하는 자기회귀(Autoregressive) 방식으로 앞 문맥만 보되 생성 능력을 얻는다. 이 목표 함수의 차이가 곧 BERT 계열(이해 중심)과 GPT 계열(생성 중심)의 성격 차이를 만들었고, LLM이 대화·생성으로 나아가면서 자기회귀 방식이 주류가 되었다.

트랜스포머의 Self-Attention은 문장 내 모든 토큰 쌍의 관계를 병렬로 계산해, 단어를 고정된 사전적 의미가 아니라 문맥에 따라 달라지는 동적 임베딩으로 표현하게 한다. RNN·LSTM이 토큰을 순차적으로만 처리해 긴 문장에서 앞부분 정보를 잊고 병렬화도 어려웠던 것과 달리, Self-Attention은 거리에 무관하게 관계를 직접 연결하고 GPU에서 대규모 병렬 학습을 가능케 했다. 이 병렬성이 바로 뒤에서 설명할 규모의 법칙을 현실에서 성립시킨 하드웨어적 전제다.

특성 내용
전이학습 사전학습→파인튜닝의 2단계 구조로 지식 재사용
자기지도학습 MLM(BERT)·다음 토큰 예측(GPT)으로 라벨 없이 학습
문맥 임베딩 단어를 문맥에 따라 동적으로 표현(다의어 처리)
트랜스포머 Self-Attention 기반 병렬 학습으로 대규모화 가능

2. PLM → LLM 발전의 전체 구조

PLM에서 LLM으로의 진화는 단일 도약이 아니라 규모 확장과 정렬 단계 추가라는 두 흐름이 겹쳐 일어났다. 아래 개념도는 정적 임베딩에서 출발해 PLM을 거쳐 정렬된 LLM에 이르는 전체 계보를, 그 다음 아키텍처 세부도는 트랜스포머 내부에서 토큰이 처리되는 흐름을 보여준다.

flowchart LR
  W["정적 임베딩(Word2Vec/GloVe)"] --> B["PLM: 사전학습+파인튜닝"]
  B --> G["GPT 계열(자기회귀 생성)"]
  B --> E["BERT 계열(양방향 이해)"]
  G --> SC["규모 확장(파라미터/데이터/연산)"]
  SC --> AL["정렬(SFT+RLHF/DPO)"]
  AL --> L["LLM(범용 지시 수행)"]
flowchart TB
  T["입력 토큰"] --> EM["토큰+위치 임베딩"]
  EM --> SA["Multi-Head Self-Attention"]
  SA --> AN["잔차연결+정규화"]
  AN --> FF["Feed-Forward Network"]
  FF --> AN2["잔차연결+정규화"]
  AN2 --> NX["다음 층 반복(N개)"]
  NX --> OUT["다음 토큰 확률분포"]

첫 번째 계보도가 말하는 핵심은, LLM이 PLM의 "확대판"이면서 동시에 질적으로 새로운 단계(정렬) 를 포함한다는 점이다. 사전학습만 마친 거대 모델은 다음 토큰을 매끄럽게 이어붙일 뿐 "사람이 원하는 방식으로 지시를 따르지" 않는다. 예컨대 "회의록을 요약해줘"라는 입력에 요약을 내놓는 대신 비슷한 요청 문장을 계속 생성해버리는 식이다. 이 간극을 메우는 것이 두 번째 이후 단계다.

두 번째 아키텍처도가 보여주듯, 트랜스포머 블록은 Self-Attention으로 문맥 정보를 모으고 Feed-Forward Network로 이를 변환하는 과정을 N개 층에 걸쳐 반복하며, 각 층은 잔차연결과 정규화로 깊은 학습을 안정화한다. LLM은 이 블록을 수십~수백 층 쌓고 각 층의 폭(hidden dimension)을 넓혀 파라미터를 수천억 규모로 키운 것이다.

PLM과 LLM의 차이

PLM과 LLM은 연속선상에 있지만, 활용 방식에서 뚜렷한 질적 차이를 보인다. PLM은 과업마다 별도의 파인튜닝과 라벨 데이터를 요구하는 "과업별 전문가"에 가깝고, LLM은 하나의 모델이 프롬프트만 바꿔 번역·요약·코딩·상담을 모두 처리하는 "범용 조력자"에 가깝다. 이 차이는 규모와 정렬이 결합해 In-context Learning이 창발하면서 생겼다.

구분 PLM LLM
규모 수억~수십억 파라미터 수백억~수천억 파라미터
과업 적응 과업별 파인튜닝 필요 프롬프트(In-context)로 즉시 대응
학습 단계 사전학습+파인튜닝 사전학습+SFT+정렬(RLHF/DPO)
대표 능력 문장 이해·분류 생성·추론·지시수행·대화
활용 형태 과업별 전문 모델 범용 파운데이션 모델

실무적 함의는 개발·운영 방식의 전환이다. PLM 시대에는 감성분석·문서분류마다 모델을 따로 만들고 배포·관리했으나, LLM 시대에는 하나의 API에 프롬프트를 달리 보내는 것으로 다수 과업을 처리할 수 있어 모델 관리 부담이 줄고 프롬프트 엔지니어링·RAG 같은 새로운 역량이 중요해졌다.

3. PLM → LLM 훈련 과정

flowchart LR
  D["대규모 코퍼스"] --> P["사전학습<br/>Pre-training"]
  P --> S["지도 미세조정<br/>SFT"]
  S --> R["RLHF / DPO<br/>인간 선호 정렬"]
  R --> L["LLM"]

LLM은 PLM을 단지 키운 것이 아니라, 사전학습 위에 정렬(Alignment) 이라는 새 단계를 얹어 완성된다. 각 단계는 목적이 뚜렷하게 다르며, 뒤 단계로 갈수록 데이터 규모는 작아지지만 데이터 품질과 인간 개입 비중은 커지는 "역피라미드" 구조를 이룬다.

단계 훈련 특성 목적
사전학습(Pre-training) 자기지도(다음 토큰 예측)로 언어·세계 지식 획득, 막대한 파라미터·데이터·연산 지식·언어능력의 토대 형성
지도 미세조정(SFT) 사람이 만든 지시-응답(Instruction) 데이터로 학습 지시를 이해하고 수행하는 능력 부여
정렬(RLHF/DPO) 인간 선호 보상모델(RLHF) 또는 선호쌍 직접 최적화(DPO) 유용·정직·무해(HHH)하게 행동 정렬

가. 사전학습

수백억수조 토큰의 텍스트로 다음 토큰을 예측하며, 이 과정에서 문법·사실·추론 패턴이 파라미터에 압축된다. 학습 데이터는 웹 크롤(CommonCrawl), 위키백과, 도서, 코드 저장소 등을 정제·중복제거·필터링해 구성하며, 데이터의 품질과 다양성이 최종 성능을 크게 좌우한다. 비용의 대부분(수천 개 GPU를 수 주수개월)이 이 단계에서 발생하므로, 사전학습은 소수의 조직만 수행하고 나머지는 그 결과를 내려받아 활용하는 파운데이션 모델(Foundation Model) 생태계가 형성되었다.

사전학습 목표 함수는 단순하지만 그 부산물은 놀랍다. "다음 단어 맞히기"라는 하나의 과제를 조 단위로 반복하는 것만으로 모델은 번역·요약·상식추론에 필요한 표상을 스스로 획득한다. 이는 언어를 정확히 예측하려면 세계에 대한 압축된 지식이 필요하다는 점에서 "예측이 곧 이해"라는 통찰로 설명된다. 다만 이 단계 산출물은 지식은 풍부하되 통제되지 않은 "원석"에 가깝다.

또한 사전학습 단계에서 데이터 품질 관리가 최종 성능을 좌우한다는 점은 실무적으로 매우 중요하다. 저품질·중복·유해 텍스트를 걸러내는 정제 파이프라인, 개인정보·저작권 문제가 있는 데이터의 배제, 언어·도메인 균형 조정이 모두 이 단계에서 이뤄진다. "쓰레기를 넣으면 쓰레기가 나온다(garbage in, garbage out)"는 원칙이 조 단위 토큰에서는 더 크게 증폭되므로, 최근 연구는 무작정 데이터를 늘리기보다 고품질 데이터를 선별하는 쪽이 효율적이라는 방향으로 이동하고 있다.

나. 지도 미세조정(SFT)

"질문에는 답을, 요약 요청에는 요약을" 식의 고품질 지시-응답 예시로 학습해, 사전학습 모델을 지시를 따르는 조력자로 바꾼다. 수천~수만 건의 정성껏 작성된 (지시, 이상적 응답) 쌍을 지도학습으로 다시 학습시키는 과정으로, 데이터의 절대량은 사전학습의 극히 일부이지만 모델의 행동 양식을 결정적으로 바꾼다. InstructGPT 논문이 보여준 것처럼, 잘 정렬된 13억 파라미터 모델이 정렬되지 않은 1,750억 파라미터 모델보다 사람 평가에서 선호될 수 있다는 사실은 정렬 단계의 가치를 웅변한다.

SFT 데이터의 다양성과 품질이 모델의 지시수행 범위를 결정한다는 점도 중요하다. 요약·번역·코딩·역할극 등 폭넓은 유형의 지시를 고르게 포함해야 특정 과업에만 치우치지 않는 범용 조력자가 되며, 최근에는 사람이 일일이 작성하는 대신 강력한 모델로 지시-응답 쌍을 대량 생성한 뒤 사람이 검수하는 방식으로 데이터 구축 비용을 낮추는 흐름도 나타난다.

다. 정렬(RLHF/DPO)

같은 질문에 대한 여러 답변을 사람이 선호 순으로 평가한 데이터로 보상모델(Reward Model) 을 만들고, 이 보상을 최대화하도록 정책을 강화학습(PPO 등)으로 최적화하는 것이 RLHF(Reinforcement Learning from Human Feedback) 다. 반면 DPO(Direct Preference Optimization) 는 별도 보상모델·강화학습 루프 없이 선호쌍(선호 응답, 비선호 응답)으로 정책을 직접 최적화해, 구현이 단순하고 학습이 안정적이라는 이유로 최근 널리 채택된다. 이 단계가 유해·거짓 응답을 억제하고 말투·형식·거절 기준 같은 실사용 품질을 결정한다. 요컨대 사전학습이 "무엇을 아는가", SFT가 "어떻게 지시를 따르는가", 정렬이 "어떤 가치로 답하는가"를 각각 담당한다.

정렬 단계에서는 정렬세(Alignment Tax) 라 불리는 트레이드오프도 고려해야 한다. 안전성과 유용성을 강하게 정렬하면 과도하게 조심스러워져(무해한 요청까지 거절) 성능이 일부 희생될 수 있으므로, 보상모델 설계와 선호 데이터 구성에서 "유용·정직·무해(HHH)" 사이의 균형을 세심하게 조율하는 것이 실무의 관건이다. DPO가 RLHF보다 선호되는 이유 중 하나도 강화학습 루프의 불안정성과 보상 해킹(reward hacking) 위험을 줄여 이 균형을 더 안정적으로 달성하기 때문이다.

4. 규모의 법칙(Scaling Law)과 창발

LLM으로의 질적 도약을 설명하는 열쇠가 규모의 법칙과 창발(Emergence) 이다. 파라미터·데이터·연산을 키우면 검증 손실이 멱함수(power-law) 형태로 예측 가능하게 감소하는데(Scaling Law), 흥미롭게도 특정 임계 규모를 넘어서면 작은 모델에는 없던 능력이 불연속적으로 발현(창발) 한다. 다단계 추론(Chain-of-Thought), 그리고 파라미터를 바꾸지 않고 프롬프트 속 예시만으로 새 과업을 푸는 In-context Learning이 대표적이다.

개념 내용
Scaling Law 파라미터·데이터·연산 증가 → 손실 감소가 멱함수로 예측적
창발적 능력(Emergent) 임계 규모 이상에서 추론·In-context Learning 등 발현
In-context Learning 가중치 갱신 없이 프롬프트 예시(Few-shot)로 과업 수행

규모의 법칙이 실무에 준 교훈은 연산 예산의 최적 배분이다. 초기에는 파라미터만 키우면 된다고 보았으나, DeepMind의 Chinchilla 연구(2022)는 주어진 연산량에서 모델 크기와 학습 토큰 수를 균형 있게 키워야 하며 당시 대형 모델들이 데이터에 비해 과도하게 컸음을 보였다. 예컨대 700억 파라미터를 1.4조 토큰으로 학습한 Chinchilla가 1,750억 파라미터 모델을 여러 벤치마크에서 앞선 것은, "무작정 크게"가 아니라 "데이터와 균형 있게 크게"가 정답임을 보여준 구체적 사례다.

창발도 실측 사례가 뚜렷하다. GPT-2 규모에서는 미미하던 세 자리 산술·다단계 추론 능력이 GPT-3(1,750억 파라미터) 규모에서 Few-shot으로 갑자기 유의미해졌고, "단계별로 생각해봐(Let's think step by step)"라는 한 줄 프롬프트만으로 추론 정확도가 크게 오르는 현상 역시 일정 규모 이상에서만 관측된다. 다만 최근 연구는 이런 "불연속 창발"의 상당 부분이 평가 지표(정답/오답 이분법)의 선택 때문에 과장돼 보일 수 있다고 지적하므로, 창발을 절대적 마법이 아니라 규모에 따른 능력 향상의 한 양상으로 신중히 해석하는 태도가 필요하다.

In-context Learning이 실무에 주는 의미는 특히 크다. 가중치를 전혀 바꾸지 않고 프롬프트에 예시 몇 개(Few-shot)나 지시만 넣어 새로운 과업을 처리할 수 있다는 것은, 모델 재학습 없이 즉시 응용을 바꿀 수 있음을 뜻한다. 이 능력이 프롬프트 엔지니어링이라는 새로운 실무 분야를 낳았고, 값비싼 파인튜닝을 생략하고도 다양한 과업에 하나의 모델을 재활용하는 LLM 운영 방식의 토대가 되었다.

5. 심화: 도메인 적용과 최신 동향

거대 LLM을 실제 업무에 적용할 때는 전체 재학습(비용·시간이 막대)을 피하고 부분 적응 기법을 조합하는 것이 표준이 되었다. 능력·형식은 PEFT(Parameter-Efficient Fine-Tuning) 로, 최신·전용 지식은 RAG(Retrieval-Augmented Generation) 로 주입하는 이원화 전략이 핵심이다.

PEFT의 대표인 LoRA(Low-Rank Adaptation) 는 원본 가중치를 동결한 채 각 층에 저차원(low-rank) 행렬 쌍만 추가로 학습해, 전체의 1% 미만 파라미터만 갱신하고도 풀 파인튜닝에 근접한 성능을 낸다. 여기에 4비트 양자화를 결합한 QLoRA는 수백억 파라미터 모델도 단일 고성능 GPU에서 미세조정할 수 있게 해, 개별 기업·연구실이 도메인 특화 모델을 만드는 문턱을 크게 낮췄다. 이는 사전학습을 소수 조직이 독점하던 구도에서 응용 단계의 민주화로 이어졌다.

RAG는 파라미터에 지식을 새겨 넣는 대신, 질의 시점에 외부 지식베이스(사내 문서·최신 뉴스 등)를 벡터 검색으로 찾아 프롬프트에 붙여 넣는 방식이다. 환각을 줄이고 최신성을 확보하며 출처를 제시할 수 있어, 사내 지식 챗봇·고객 상담 등 사실 정확성이 중요한 현장에서 사실상 필수 아키텍처로 자리 잡았다. 비용·지연·데이터 유출이 문제인 경우에는 양자화·지식 증류로 경량화한 sLLM(소형 LLM) 을 온프레미스에 두는 전략도 늘고 있다. 최근에는 여기에 도구 호출·검색·코드 실행을 스스로 계획·수행하는 에이전트(Agent) 로의 확장이 활발하다.

산업 적용 사례를 보면 이 조합의 실효성이 분명하다. 소프트웨어 개발 현장의 코드 자동완성 도구는 방대한 공개 코드로 사전학습한 LLM에 사내 코드베이스를 RAG로 연결해 팀 고유의 관례에 맞는 제안을 내놓고, 금융·법률 분야에서는 규제 문서·판례를 검색해 근거와 함께 답하도록 설계해 환각으로 인한 오답 위험을 낮춘다. 고객 상담에서는 상담 이력·매뉴얼을 검색하는 RAG와, 회사 톤에 맞춘 SFT를 결합해 일관된 응대 품질을 확보하는 식이다. 이처럼 "범용 LLM + 도메인 지식(RAG) + 형식 조정(PEFT/SFT)"의 삼단 구성이 산업 전반의 표준 레시피로 굳어지고 있다.

6. 고려사항 및 시사점

  • 역할 분담 설계: "능력은 파인튜닝(PEFT), 지식은 RAG, 안전은 정렬·거버넌스"로 책임을 나누어 신뢰성·비용·보안을 균형 있게 설계하는 것이 기술사 관점의 핵심이다. 무엇을 파라미터에 새기고 무엇을 외부에서 검색할지의 경계 설정이 아키텍처 품질을 좌우한다.
  • 위험 관리(환각·편향·정렬 실패): 규모가 커지며 능력과 함께 위험도 커진다. 사실과 다른 답을 그럴듯하게 만드는 환각은 RAG·출처 인용·불확실성 표현으로, 학습 데이터에서 유래한 편향은 데이터 정제와 레드팀 평가로, 의도와 어긋나는 정렬 실패는 RLHF/DPO와 가드레일로 다층 방어해야 한다.
  • 비용·지연·주권의 트레이드오프: 초거대 API 모델의 성능과 sLLM 온프레미스의 보안·비용·데이터 주권 사이에서, 과업 난이도와 규제 요건에 따라 모델을 계층화(라우팅)하는 설계가 현실적이다.
  • 거버넌스·규제 대응: EU AI Act 등 규제와 기업 내부 정책에 맞춰 데이터 출처·저작권·개인정보·모델 감사 추적을 확보해야 하며, 프롬프트 인젝션·데이터 유출 같은 신종 보안 위협에 대한 방어 체계를 함께 갖춰야 한다.
  • 평가·검증 체계: 창발 사례에서 보듯 벤치마크 지표 하나로 능력을 단정하기 어려우므로, 과업별 정량 지표와 사람 평가·레드팀·실사용 로그 분석을 병행하는 다면적 검증 체계를 갖춰야 도입 후 품질 저하나 안전 이슈를 조기에 포착할 수 있다.
  • 전망: 멀티모달(텍스트·이미지·음성 통합), 장문 컨텍스트, 자율 에이전트, 온디바이스 sLLM으로 확장이 이어지고 있어, 단일 거대 모델보다 여러 모델·도구·검색을 조합하는 복합 AI 시스템 설계 역량이 갈수록 중요해진다.

참고자료


한 줄 요약: PLM은 사전학습+미세조정의 전이학습 모델이며, 여기에 SFT와 RLHF/DPO 정렬을 더하고 규모를 키우면 규모의 법칙에 따라 In-context Learning 등 창발적 능력을 갖춘 LLM으로 발전하고, 실무에서는 PEFT·RAG·정렬로 능력·지식·안전을 분담해 적용한다.