파운데이션 모델(Foundation Model)
1. 개요
가. 정의
파운데이션 모델은 방대한 데이터로 사전학습(Pre-training) 되어 다양한 하위 과제(downstream task)에 적응·활용할 수 있는 범용 대규모 AI 모델이다. GPT·BERT·CLIP·Llama 등이 대표적이며, 파인튜닝(Fine-tuning)이나 프롬프트(Prompt)만으로 여러 응용에 재사용된다. 2021년 스탠퍼드 HAI 연구진이 "다수 과제의 기반(foundation)이 되는 모델"이라는 의미로 이 용어를 명명했다.
파운데이션 모델이 가져온 것은 AI 개발 방식의 패러다임 전환이다. 핵심은 '과제마다 모델을 새로 만들던 방식에서, 하나의 범용 모델을 여러 과제에 적응시키는 방식으로'의 이동이다. 과거에는 번역기, 감성분석기, 챗봇을 각각 별도의 데이터셋으로 처음부터 학습해야 했다. 각 모델은 자신의 좁은 과제만 알았고, 새 과제가 생기면 다시 대규모 레이블링과 학습을 반복해야 했다.
파운데이션 모델은 대규모 사전학습을 통해 언어·이미지의 일반적 표현(세상에 대한 폭넓은 지식과 통계적 패턴)을 먼저 익힌 뒤, 소량의 데이터나 프롬프트만으로 번역·요약·분류·생성 등 다양한 과제를 수행한다. 하나의 '기초(Foundation)' 위에 여러 응용을 올리는 것이다. 이는 AI 개발의 진입장벽을 획기적으로 낮추고 재사용성을 극대화해, AI 산업의 구조 자체를 '모델 개발 중심'에서 '모델 활용·적응 중심'으로 재편했다.
나. 등장 배경과 필요성
파운데이션 모델의 부상에는 세 가지 기술적 배경이 맞물려 있다. 첫째, 규모의 법칙(Scaling Law) 의 발견이다. 오픈AI의 연구(Kaplan et al., 2020)는 데이터·연산량·모델 파라미터를 함께 키우면 모델의 성능(손실)이 멱함수(power-law) 형태로 예측 가능하게 향상됨을 보였다. 이는 "더 크게 만들면 더 좋아진다"는 투자 근거를 제공했다.
둘째, Transformer 구조(2017, Attention Is All You Need) 의 등장이다. 순환 구조 없이 병렬 학습이 가능한 Self-Attention은 GPU 대규모 병렬 처리와 궁합이 맞아 초대규모 학습을 현실화했다. 셋째, 자기지도학습(Self-Supervised Learning) 이다. 레이블 없는 방대한 원시 텍스트·이미지를 "다음 단어 맞히기"나 "가려진 부분 복원"으로 학습해, 값비싼 사람 레이블링 없이도 대규모 데이터를 활용할 수 있게 되었다. 이 세 요소가 결합되면서 GPT-3(1,750억 파라미터, 2020)를 기점으로 초대규모 사전학습 모델이 본격화되었다.
2. 파운데이션 모델의 개념 구조
파운데이션 모델의 작동 원리는 '사전학습 → 적응 → 다양한 과제'라는 하나의 파이프라인으로 요약된다. 아래 전체 구조도는 데이터에서 응용까지의 흐름을 보여준다.
flowchart LR
D["대규모 데이터<br/>텍스트·이미지·음성"] --> P["사전학습<br/>Foundation Model"]
P --> A["적응<br/>파인튜닝·프롬프트·RAG"]
A --> T1["번역"]
A --> T2["요약"]
A --> T3["분류·생성"]
A --> T4["코드·추론"]
style P fill:#e8f0fe,stroke:#2f6fed,stroke-width:2px
style A fill:#fef3e8,stroke:#ed8a2f,stroke-width:2px
위 그림의 핵심은 가운데의 단일 모델(P)이 오른쪽의 수많은 과제로 분기한다는 점이다. 과거에는 왼쪽에서 오른쪽까지 과제별로 독립된 파이프라인이 여러 개 필요했지만, 파운데이션 모델은 사전학습이라는 무거운 공정을 한 번만 수행하고 이후에는 가벼운 적응만 반복한다. 이 '한 번 학습, 여러 번 활용' 구조가 비용 효율과 확산 속도의 원천이다.
파운데이션 모델의 특징은 서로 인과적으로 연결되어 있다. 대규모 파라미터·데이터가 범용성(하나의 모델을 여러 과제에 사용)을 낳고, 규모가 일정 임계를 넘으면 명시적으로 학습하지 않은 능력—산술 추론, 다단계 사고 등—이 갑자기 나타나는 창발성(Emergent Ability) 이 관찰된다. 이렇게 확보된 범용 표현을 파인튜닝·프롬프트·RAG로 특정 도메인에 적응시키며, 최근에는 텍스트·이미지·음성을 함께 다루는 멀티모달(Multimodal) 로 확장되고 있다.
| 특징 | 내용 | 실무적 함의 |
|---|---|---|
| 범용성 | 하나의 모델을 다양한 과제에 활용 | 과제별 개발 비용 절감 |
| 대규모 | 방대한 파라미터·데이터로 사전학습 | 막대한 연산·전력 필요 |
| 창발성 | 규모 확대 시 예상치 못한 능력 발현 | 성능의 비선형적 도약 |
| 적응성 | 파인튜닝·프롬프트·RAG로 도메인 특화 | 소량 데이터로 특화 가능 |
| 멀티모달 | 텍스트·이미지·음성 통합 처리 | 응용 범위 확장 |
전통적 AI 모델과 파운데이션 모델의 차이는 개발 경제학의 관점에서 특히 두드러진다. 전통 방식에서는 과제 하나에 대해 데이터 수집·레이블링·모델 설계·학습·배포의 전 과정을 반복했으므로, 과제가 N개면 비용도 대략 N배로 늘었다. 파운데이션 모델 방식에서는 사전학습이라는 고정비(fixed cost)를 한 번 지불한 뒤, 과제마다 발생하는 한계비용(marginal cost)이 프롬프트 작성이나 소규모 파인튜닝 수준으로 급감한다. 이 비용 구조의 전환이 생성형 AI가 폭발적으로 확산된 경제적 원동력이며, 동시에 사전학습을 감당할 수 있는 소수 기업으로 역량이 집중되는 독점화의 배경이기도 하다.
3. 기반 기술과 학습 아키텍처
파운데이션 모델은 여러 기술의 집약체다. 아래 세부도는 사전학습부터 정렬·활용에 이르는 기술 스택의 계층을 보여준다.
flowchart TB
subgraph PRE["사전학습 단계"]
T["Transformer·Self-Attention"]
SSL["자기지도학습"]
HW["분산학습·멀티GPU(HBM·InfiniBand)"]
end
subgraph ADAPT["적응·정렬 단계"]
FT["파인튜닝·PEFT(LoRA)"]
AL["정렬(RLHF·DPO)"]
RAG["RAG(검색증강생성)"]
end
PRE --> ADAPT --> APP["실제 응용 서비스"]
style PRE fill:#e8f0fe,stroke:#2f6fed,stroke-width:2px
style ADAPT fill:#fef3e8,stroke:#ed8a2f,stroke-width:2px
첫째, Transformer의 Self-Attention 은 문장 내 모든 토큰이 서로를 참조해 문맥의 장거리 의존성을 학습하는 핵심 구조다. 순차 처리하는 RNN과 달리 병렬 연산이 가능해 대규모 학습의 속도 병목을 해소했다. 둘째, 자기지도학습 은 레이블 없이 원시 데이터의 일부를 가리고 예측하게 해 사전학습을 가능하게 한다. GPT 계열은 다음 토큰 예측(Autoregressive), BERT 계열은 가려진 토큰 복원(Masked LM) 방식을 쓴다.
셋째, 분산학습·멀티GPU 인프라(HBM 고대역폭 메모리, InfiniBand 초고속 네트워크, 데이터·텐서·파이프라인 병렬화)는 수천 장의 GPU를 하나의 학습 클러스터로 묶어 초대규모 모델의 훈련을 물리적으로 뒷받침한다. 파라미터가 수천억 개에 이르면 단일 GPU 메모리에 모델이 올라가지 않으므로, 모델을 여러 장치에 쪼개는 텐서·파이프라인 병렬화와, 데이터를 나누어 처리하는 데이터 병렬화를 조합하는 3차원 병렬화가 필수가 된다.
넷째, 정렬(Alignment) 은 사전학습만으로는 부족한 부분을 메운다. 사전학습된 모델은 방대한 지식을 가졌지만 인간이 원하는 방식으로 응답하도록 조율되지 않았기 때문에, 지시 튜닝(Instruction Tuning)으로 명령을 따르게 만든 뒤, 인간 피드백 기반 강화학습(RLHF)이나 더 단순한 직접 선호 최적화(DPO)로 유용성·무해성·정직성을 강화한다. 이 정렬 단계가 있어야 비로소 실제 대화형 서비스에 쓸 수 있는 품질이 나온다.
다섯째, RAG(검색증강생성)와 PEFT(LoRA 등 경량 파인튜닝) 는 최신·도메인 지식을 효율적으로 주입한다. RAG는 질의 시점에 외부 지식베이스를 검색해 근거 문서를 프롬프트에 함께 넣음으로써, 모델을 재학습하지 않고도 최신 정보를 반영하고 환각을 줄인다. LoRA는 거대한 원본 파라미터는 고정한 채 소수의 저계수(low-rank) 행렬만 학습해, 특화 비용과 저장 공간을 수십분의 일로 낮춘다.
| 기술 | 역할 | 대표 사례 |
|---|---|---|
| Transformer·Self-Attention | 장거리 문맥 병렬 학습 | GPT, BERT |
| 자기지도학습 | 레이블 없이 대규모 사전학습 | 다음 토큰 예측, MLM |
| 분산학습·멀티GPU | 초대규모 모델 훈련 | 데이터·텐서 병렬화 |
| 정렬(RLHF·DPO) | 인간 선호 반영 미세조정 | ChatGPT, Claude |
| RAG·PEFT(LoRA) | 최신·도메인 지식 효율 주입 | 기업 지식 챗봇 |
4. 활용 사례와 구현 시 고려사항
파운데이션 모델은 산업 전반으로 확산되고 있다. 구체적으로, 마이크로소프트의 GitHub Copilot은 코드 파운데이션 모델을 활용해 개발 생산성을 유의미하게 높였다는 연구 결과가 보고되었고, 금융·의료에서는 도메인 특화 파인튜닝(BloombergGPT 등)으로 전문 문서 분석에 쓰인다. 이미지-텍스트를 함께 학습한 CLIP·DALL·E 계열은 검색·생성·콘텐츠 제작에 활용된다. 이처럼 하나의 기반 위에 산업별 응용이 층층이 쌓이는 것이 현재의 흐름이다.
기업이 파운데이션 모델을 도입하는 방식은 대체로 세 갈래로 나뉜다. 첫째는 상용 API 호출로, 초기 비용이 거의 없고 즉시 활용할 수 있지만 데이터가 외부로 나가고 사용량에 비례해 과금되는 종속성이 있다. 둘째는 오픈웨이트 모델(예: Llama 계열)을 자체 인프라에 올려 파인튜닝하는 방식으로, 데이터 주권과 규제 대응에 유리하나 GPU 인프라와 MLOps 역량이 요구된다. 셋째는 소규모 특화 모델(sLLM)을 온프레미스에 두어 민감 데이터를 내부에서만 처리하는 방식이다. 기술사는 데이터 민감도·규제·비용·성능 요구를 종합해 이 세 방식의 트레이드오프를 판단하고, 필요하면 RAG로 내부 지식을 결합하는 하이브리드 구성을 설계할 수 있어야 한다.
파운데이션 모델은 크게 세 계보로 나눌 수 있어, 응용 목적에 따라 선택이 달라진다. 인코더(Encoder) 계열인 BERT는 문장 전체를 양방향으로 이해하는 데 강해 분류·검색·개체명 인식 같은 이해 과제에 적합하다. 디코더(Decoder) 계열인 GPT는 다음 토큰을 순차 생성하는 데 특화되어 생성·대화·요약에 강하다. 인코더-디코더(예: T5) 계열은 입력을 이해하고 새로운 출력을 생성하는 번역·요약형 과제에 균형이 좋다. 실무에서는 대화형 서비스가 늘면서 디코더 계열이 주류가 되었지만, 검색·임베딩 용도로는 여전히 인코더 계열이 널리 쓰인다.
그러나 강력한 만큼 세 층위의 책임이 따른다. 법적으로는 학습 데이터의 저작권·라이선스(뉴욕타임스의 오픈AI 제소 등 실제 소송이 진행 중), 개인정보, 결과물의 책임소재, EU AI Act·국내 AI 기본법 같은 규제 준수가 문제가 된다. 환경적으로는 초대규모 모델의 훈련이 막대한 전력과 탄소를 소모하므로 그린 AI(Green AI)·경량화가 요구된다. 사회적으로는 학습 데이터의 편향이 증폭되는 차별, 허위정보·딥페이크, 일자리 변화, 오남용, 소수 빅테크의 모델 독점과 공정한 접근성 문제가 제기된다.
| 측면 | 고려사항 | 대응 방향 |
|---|---|---|
| 법적 | 학습데이터 저작권·라이선스, 개인정보, 책임소재, 규제 | 데이터 출처 관리, 규제 준수 체계 |
| 환경적 | 훈련의 전력·탄소배출 | 그린 AI·경량화·효율적 학습 |
| 사회적 | 편향·차별, 허위정보·딥페이크, 일자리·독점 | 정렬·가드레일, 개방형 모델 |
5. 심화: 최신 동향과 기술 진화
파운데이션 모델 생태계는 빠르게 진화하고 있다. 첫째, 효율화·경량화(sLLM) 흐름이다. 수천억 파라미터의 거대 모델뿐 아니라, 수십억 파라미터의 소형 모델(sLLM)을 양자화(Quantization)·증류(Distillation)·MoE(Mixture of Experts, 전문가 혼합)로 최적화해 온디바이스·비용 절감형 응용이 늘고 있다. MoE는 입력마다 일부 전문가 서브네트워크만 활성화해 연산량을 줄이면서 대규모 용량을 유지하는 방식으로, 최신 모델들의 핵심 기술로 자리잡았다.
둘째, 에이전트(Agent)로의 확장이다. 파운데이션 모델이 단순 응답을 넘어 도구(검색·코드 실행·API 호출)를 스스로 사용하고 다단계 작업을 계획·수행하는 에이전트의 두뇌 역할을 하면서, 응용의 자율성이 크게 높아지고 있다. 셋째, 멀티모달 통합이 가속되어 텍스트·이미지·음성·영상을 하나의 모델에서 처리하는 방향으로 나아가고 있다.
넷째, 평가·거버넌스의 정교화다. 모델이 커지고 활용이 넓어지면서 단순 정확도 지표를 넘어 벤치마크(MMLU 등)와 안전성·편향·유해성 평가가 표준화되고 있으며, 레드팀(Red-teaming)으로 악용 가능성을 사전에 점검하는 절차가 개발 파이프라인에 편입되고 있다. 모델 카드(Model Card)·데이터시트로 학습 데이터와 한계를 문서화하는 투명성 관행도 확산되고 있다.
기출·출제 방향 관점에서, 정보관리기술사 시험은 파운데이션 모델을 LLM·생성형 AI·Transformer·RAG와 연계해 개념·기반기술·리스크를 묻는 형태로 출제해 왔다. 답안은 "패러다임 전환의 의미 → 규모의 법칙과 기반 기술 → 적응·정렬 메커니즘 → 법·환경·사회 리스크 → 경량화·에이전트 등 최신 동향"이라는 흐름으로 구성하면 깊이와 최신성을 함께 확보할 수 있다.
6. 고려사항 및 시사점
응용 생태계의 확산이 핵심 흐름이다. 파운데이션 모델 위에 파인튜닝·프롬프트·에이전트로 무수한 응용이 만들어지며, 기업 경쟁력은 '모델을 만드는 능력'에서 '모델을 잘 적응·조합하는 능력'으로 이동하고 있다. 기술사는 자체 개발과 API 활용, 오픈소스 모델 파인튜닝 사이의 전략적 선택을 조언할 수 있어야 한다.
신뢰성·안전성·비용이 실용화의 관건이다. 환각(Hallucination)·편향을 줄이는 신뢰성, 정렬과 가드레일을 통한 안전성, 그리고 sLLM·양자화·MoE로 추론 비용을 낮추는 효율화가 실제 서비스 도입의 성패를 가른다. 특히 RAG는 최신성과 근거 제시로 환각을 줄이는 실무 표준으로 자리잡았다.
법·환경·사회적 리스크의 설계 단계 내재화(Responsible AI by Design)가 필요하다. 강력한 범용 기술일수록 부작용도 크므로, 개발 초기부터 데이터 거버넌스·저작권 관리·편향 완화·탄소 측정을 통합해야 한다. 사후 대응은 비용과 신뢰 손실이 크다.
주권·독점 리스크와 개방형 생태계. 소수 빅테크의 모델 독점은 종속과 접근성 불균형을 낳으므로, 개방형 모델(오픈웨이트)·국가 차원의 AI 인프라(소버린 AI) 확보가 전략 과제로 부상하고 있다. 데이터 주권과 안보 관점에서도 중요하다.
규제 정합성 확보. EU AI Act의 위험 기반 규제와 국내 AI 기본법 등 규제 환경이 빠르게 형성되고 있어, 고위험 활용 분야일수록 투명성·설명가능성·기록 의무를 사전에 설계에 반영해야 한다.
참고자료
- Bommasani et al., "On the Opportunities and Risks of Foundation Models", Stanford HAI, https://arxiv.org/abs/2108.07258
- Vaswani et al., "Attention Is All You Need", https://arxiv.org/abs/1706.03762
- Kaplan et al., "Scaling Laws for Neural Language Models", https://arxiv.org/abs/2001.08361
- Stanford, "Artificial Intelligence Index Report", https://aiindex.stanford.edu/report/
한 줄 요약: 파운데이션 모델은 규모의 법칙·Transformer·자기지도학습을 기반으로 대규모 사전학습된 범용 AI로, 파인튜닝·프롬프트·정렬(RLHF)·RAG로 다양한 과제에 적응하며, 최근 sLLM·MoE·에이전트·멀티모달로 진화하되 학습데이터 저작권·전력·편향 등 법·환경·사회적 리스크를 설계 단계부터 통합 관리해야 한다.