← 목록으로
AI·데이터
#베이지안최적화#하이퍼파라미터#가우시안프로세스#획득함수#AutoML#132회
최종 업데이트 · 2026-07-07

베이지안 최적화(Bayesian Optimization)

1. 개요

가. 정의

평가 비용이 크고 미분이 불가능한 블랙박스 목적함수 $f(x)$ 를, 지금까지의 관측을 확률적으로 요약한 대리모델(Surrogate) 과 다음에 어디를 평가할지 결정하는 획득함수(Acquisition Function) 를 반복적으로 갱신하여, 소수의 시행만으로 최적점을 탐색하는 순차적 최적화 기법.

베이지안 최적화의 핵심 발상은 "목적함수 자체를 직접 다루는 대신, 목적함수가 어떻게 생겼을지에 대한 믿음(사후분포) 을 모델링하고, 관측이 쌓일 때마다 베이즈 정리로 그 믿음을 갱신"하는 것이다. 즉 최적화 문제를 "다음 한 점을 어디서 평가하는 것이 가장 이득인가"라는 의사결정 문제로 바꾼다. 함수값을 한 번 얻는 것이 비싸기 때문에, 매 시행을 최대한 정보가치가 높은 지점에 쓰는 것이 목표다.

나. 등장 배경 및 필요성

딥러닝 하이퍼파라미터 튜닝, 신약·재료 실험, 공정 최적화처럼 한 번의 평가가 수 시간의 GPU 학습이나 실제 실험을 요구하는 문제가 늘면서, 수천~수만 번 평가를 전제로 하는 그리드·랜덤 탐색이나 경사기반 최적화는 현실성을 잃었다. 그리드 탐색은 차원이 늘면 조합이 지수적으로 폭증하고, 랜덤 탐색은 과거 관측을 학습에 활용하지 못해 같은 실패를 반복한다. 베이지안 최적화는 과거 관측을 대리모델로 누적 학습해 유망한 영역에 시행을 집중하므로, 통상 수십 회 이내의 평가로 경쟁력 있는 해에 도달한다. 여기에 각 예측의 불확실성까지 정량화해 "아직 안 가본 곳"과 "좋아 보이는 곳"을 원칙적으로 저울질할 수 있다는 점이 결정적 장점이다.

2. 동작 원리

flowchart LR
  S[대리모델 학습<br/>Gaussian Process] --> A[획득함수로 다음점 선택]
  A --> E[목적함수 실제 평가]
  E --> U[관측 데이터 갱신]
  U --> S

한 사이클은 다음과 같이 돈다. 먼저 지금까지의 관측 ${(x_i, y_i)}$ 으로 대리모델을 학습해, 미평가 지점 $x$ 마다 예측 평균 $\mu(x)$ 와 불확실성 $\sigma(x)$ 를 얻는다. 다음으로 획득함수가 이 두 값을 결합해 "가장 평가할 가치가 큰" 지점 $x_{next}$ 를 고른다. 그 지점에서 실제 목적함수를 딱 한 번 평가하고, 결과를 관측에 추가한 뒤 다시 대리모델을 갱신한다. 이 과정을 예산(평가 횟수)이 소진되거나 개선이 정체될 때까지 반복한다.

순서 내용 산출물
1 관측 데이터로 대리모델(주로 GP) 학습 각 지점의 $\mu(x),\ \sigma(x)$
2 획득함수로 다음 평가 지점 결정(탐험·활용 균형) $x_{next}$
3 목적함수 실제 평가(비싼 연산) $y_{next}=f(x_{next})$
4 관측 추가 후 1로 반복 → 수렴 갱신된 사후분포

여기서 왜 이 구조가 효율적인가는 "대리모델이 값싼 근사 함수 역할을 하기 때문"이다. 비싼 진짜 함수는 최소 횟수만 부르고, 실제 탐색·비교는 값싼 대리모델 위에서 수행하므로 총 비용이 크게 줄어든다.

3. 핵심 구성요소

가. 대리모델(Surrogate Model)

대리모델은 관측을 바탕으로 목적함수의 사후분포를 추정한다. 가장 널리 쓰이는 것은 가우시안 프로세스(GP) 로, 임의의 지점 집합에서의 함수값이 다변량 정규분포를 따른다고 가정한다. GP의 강점은 예측을 점추정이 아니라 평균과 분산(신뢰구간) 으로 주므로, "관측이 없는 영역일수록 분산이 크다"는 성질을 자연스럽게 표현한다는 점이다. 이 분산이 뒤에 탐험을 유도하는 근거가 된다. 다만 GP는 커널 행렬 역연산 때문에 관측 수 $n$ 에 대해 $O(n^3)$ 로 비싸져, 고차원·대량 관측에서는 TPE(Tree-structured Parzen Estimator) 나 랜덤포레스트 기반 대리모델(SMAC)로 대체하기도 한다.

나. 획득함수(Acquisition Function)

획득함수는 대리모델의 $\mu,\ \sigma$ 를 하나의 점수로 합쳐 다음 평가 지점을 정한다. 대표적으로 EI(Expected Improvement, 기대 개선량) 는 현재 최적값 대비 개선의 기댓값을 최대화하고, UCB(Upper Confidence Bound) 는 $\mu(x)+\kappa,\sigma(x)$ 처럼 평균에 불확실성 가중치를 더해 낙관적으로 고른다. PI(개선 확률) 는 개선이 일어날 확률만 본다. 이들은 모두 "좋아 보이는 $\mu

불러오는 중…

quot;와 "안 가본 $\sigma

불러오는 중…

quot;를 어떤 비율로 섞느냐가 다를 뿐, 본질적으로 탐험-활용 저울의 서로 다른 설정이다.

요소 설명 대표
대리모델(Surrogate) 함수 분포를 확률적으로 근사, 불확실성 제공 GP·TPE·랜덤포레스트
획득함수 $\mu,\sigma$ 를 결합해 다음점 선택 EI·PI·UCB
탐험 vs 활용 불확실 영역 탐색 ↔ 유망 영역 집중 $\kappa,\ \xi$ 로 조절

다. 탐험(Exploration)과 활용(Exploitation)의 균형

베이지안 최적화의 성패는 이 균형에 달려 있다. 활용만 하면(=$\mu$ 큰 곳만) 초반에 우연히 좋았던 국소 최적에 갇히고, 탐험만 하면(=$\sigma$ 큰 곳만) 랜덤 탐색과 다를 바 없어진다. 예컨대 UCB의 $\kappa$ 를 키우면 탐험이, 줄이면 활용이 강해진다. 좋은 획득함수는 초반에는 넓게 탐험하다 관측이 쌓여 불확실성이 줄면 자연스럽게 활용으로 옮겨가도록 이 저울을 자동으로 기울인다.

4. 장단점

장점 이유 단점 이유
적은 평가로 최적점 탐색 과거 관측을 대리모델로 누적 활용 고차원서 성능 저하 공간이 커져 GP 근사·탐색 난이도↑
미분 불필요(블랙박스 대응) 함수값만 있으면 됨 GP 계산량 $O(n^3)$ 커널 역행렬 연산 비용
불확실성 정량화 GP가 분산 제공 병렬화가 상대적으로 어려움 본질적으로 순차적 의사결정

예를 들어 20차원 하이퍼파라미터 공간에서는 관측이 유효 공간을 촘촘히 덮기 어려워 성능이 떨어지는데, 이때는 차원축소·부분공간 탐색(REMBO)이나 TPE·BOHB로 보완한다. 순차성 문제는 한 번에 여러 후보를 뽑는 배치 베이지안 최적화로 완화한다.

5. 고려사항 및 시사점

  • AutoML·하이퍼파라미터 최적화의 사실상 표준: Optuna·Hyperopt·Ray Tune 등이 TPE·BOHB를 내장한다. 랜덤 탐색 대비 같은 성능에 도달하는 시행 수를 뚜렷이 줄여, 비싼 GPU 예산을 절약한다.
  • 고차원 대응 전략: 차원축소, TPE, 조기 종료를 결합한 BOHB(Hyperband+BO) 로 "값싼 저해상도 평가로 후보를 빨리 쳐내고, 유망 후보만 정밀 평가"하는 절충을 취한다.
  • 실험 설계(DOE)로의 확장: A/B 테스트, 신소재·촉매 탐색, 반도체 공정 레시피 최적화처럼 실제 실험 한 회가 매우 비싼 도메인에서 시행 횟수 절감 효과가 크다.
  • 트레이드오프: 대리모델·획득함수 자체를 계산·튜닝하는 오버헤드가 있으므로, 목적함수 평가가 충분히 비쌀 때(수 분 이상) 이득이 분명하고, 값싼 함수라면 랜덤·그리드가 더 나을 수 있다.

한 줄 요약: 베이지안 최적화는 대리모델(GP)로 목적함수의 사후분포를, 획득함수(EI·UCB)로 다음 평가점을 정하며 탐험-활용을 균형 있게 조절해 소수 시행으로 비싼 블랙박스 함수의 최적점을 찾는 기법으로, 하이퍼파라미터 튜닝·AutoML·실험설계에 널리 쓰이나 고차원에서는 TPE·BOHB 등으로 보완한다.