← 목록으로
인프라·클라우드
#BCP#DRS#RTO#RPO#재해복구#133회
최종 업데이트 · 2026-07-07

BCP 주요 지표와 DRS 구축 고려사항

1. 개요

가. 정의

BCP(Business Continuity Planning, 업무연속성계획) 는 재해·장애 상황에서도 핵심 업무를 중단 없이(또는 최소 중단으로) 지속하도록 수립하는 종합 계획·체계이며, DRS(Disaster Recovery System, 재해복구시스템) 는 그중 IT 시스템·데이터를 복구하는 기술적 실현 수단이다.

BCP와 DRS는 상위-하위 관계다. BCP는 인력·프로세스·시설·IT를 아우르는 경영 차원의 연속성 전략이고, DRS는 그 안에서 "IT 시스템을 어떻게 복구할 것인가"를 담당한다. 즉 DRS는 BCP의 필요조건이지 충분조건이 아니며, 시스템이 복구돼도 업무 절차·인력 대응이 없으면 연속성은 달성되지 않는다.

나. 필요성

재해는 지진·화재 같은 물리적 사건뿐 아니라 랜섬웨어·시스템 장애 등 사이버 위협까지 포함하며, 디지털 의존도가 높아진 오늘날 업무 중단은 곧 매출·신뢰 손실로 직결된다. 특히 금융권은 전자금융감독규정, 공공은 재해경감활동 관리체계 등 규제가 DR 체계 구축을 의무화하고 있어, BCP/DRS는 선택이 아닌 필수가 되었다.

2. BCP 수립 절차와 주요 지표

flowchart LR
  B[BIA<br/>업무영향분석] --> R[위험평가]
  R --> S[복구전략 수립]
  S --> P[BCP 수립·훈련]

BCP의 출발점은 BIA(Business Impact Analysis, 업무영향분석) 다. 모든 업무를 똑같이 보호하는 것은 비효율적이므로, BIA로 각 업무의 중단 시 영향을 분석해 우선순위와 목표 복구 수준을 정한다. 여기서 도출되는 핵심 지표가 RTO와 RPO다. RTO(목표복구시간) 는 "얼마나 빨리 복구해야 하는가"로 시스템 이중화 수준을 결정하고, RPO(목표복구시점) 는 "얼마만큼의 데이터 손실을 감수할 수 있는가"로 백업·복제 주기를 결정한다.

두 지표의 관계를 예로 들면, RPO가 "1시간"이면 최소 1시간마다 백업(또는 복제)해야 하고, RTO가 "2시간"이면 2시간 안에 시스템을 되살릴 인프라가 준비돼야 한다. RTO/RPO를 0에 가깝게 요구할수록 비용이 급증하므로, BIA 결과에 근거해 업무별로 차등 설정하는 것이 원칙이다.

지표 의미
RTO(목표복구시간) 장애 발생~복구 완료까지 허용 시간
RPO(목표복구시점) 허용 가능한 데이터 손실 범위(백업·복제 주기)
RSO(복구범위목표) 복구 대상 업무·시스템의 범위
MTD(최대허용중단시간) 업무가 견딜 수 있는 최대 중단(BIA 기반)
RCO/RCapO 복구 시 통신·처리용량 목표

3. DRS 구축 유형(복구 수준)

DRS 유형은 결국 RTO 목표와 비용의 균형에서 갈린다. 복구를 빠르게 하려면 대기 시스템을 상시 가동해야 하고 그만큼 비용이 든다. Mirror Site 는 실시간 이중화로 RTO가 0에 수렴하지만 가장 비싸고, Cold Site 는 공간·설비만 두어 저렴하지만 복구에 수주가 걸린다. Hot/Warm은 그 사이의 절충안이다. 핵심 업무일수록 상위 유형을, 우선순위가 낮은 업무는 하위 유형을 택하는 식으로 조합한다.

유형 RTO 특징
Mirror Site 즉시(0) 실시간 이중화, 최고 비용
Hot Site 수 시간 가동 상태로 대기
Warm Site 수 일 핵심 자원만 부분 구성
Cold Site 수 주 공간·설비만, 최저 비용

4. DRS 구축 핵심 고려사항

flowchart LR
  T[RTO/RPO 목표] --> D[센터 간 거리]
  D --> C[데이터 복제 방식]
  C --> E[전환·복구 절차]
  E --> M[모의훈련·검증]

DRS 설계에서 가장 미묘한 트레이드오프는 센터 간 거리와 데이터 복제 방식이 얽히는 지점이다. 재해가 두 센터를 동시에 덮치지 않으려면 지역을 충분히 떨어뜨려야 하지만, 거리가 멀면 동기 복제의 전송 지연이 커져 운영 성능이 떨어진다. 그래서 무손실(RPO=0)이 필요한 금융 거래는 동기 복제를 쓰되 거리 제약을 감수하고, 지연에 민감한 시스템은 약간의 손실을 허용하는 비동기 복제로 원거리 센터를 두는 식으로 결정한다. 또한 전환(Failover)과 복구(Failback) 절차를 자동/수동 중 무엇으로 할지, RunBook에 명문화했는지가 실제 위기 시 복구 성공을 좌우한다.

고려사항 내용
RTO/RPO vs 비용 목표 수준과 투자 규모의 균형
센터 간 거리 동시 피해 회피(원거리) vs 동기복제 지연(근거리)
데이터 복제 동기(무손실·지연↑) / 비동기(성능↑·손실 가능)
전환 절차 자동/수동 Failover·Failback, RunBook 문서화
검증 정기 모의훈련으로 복구 가능성 실증

무엇보다 DRS는 한 번 구축했다고 끝이 아니다. 시스템 구성은 계속 바뀌므로, 정기 모의훈련으로 실제 복구가 목표 시간 안에 되는지 검증하지 않으면 위기 때 무용지물이 될 수 있다. 훈련 없는 DR 계획은 "종이 위의 복구"에 불과하다.

5. 고려사항 및 시사점

  • 클라우드 DR로 비용 효율화: 파일럿 라이트·웜 스탠바이 같은 클라우드 DR 패턴은 평상시 최소 자원만 유지하다 재해 시 확장(Scale-out)해, 물리 DR센터보다 낮은 비용으로 상위 복구 수준을 달성한다.
  • 문서가 아닌 훈련으로 실효성 확보: BCP/DRS의 가치는 계획서가 아니라 주기적 훈련·검증에서 나온다. 복구 절차를 실제로 돌려보며 갱신해야 한다.
  • 사이버 복원력(Cyber Resilience) 연계: 랜섬웨어에 대비해 변경 불가능한 백업(Immutable Backup)·망 분리된 복구 환경을 함께 설계한다.
  • RTO/RPO의 지속 재산정: 업무 변화에 맞춰 BIA를 주기적으로 갱신해 목표 지표를 현실에 맞게 유지한다.

한 줄 요약: BCP는 BIA 기반 RTO·RPO·RSO·MTD 지표로 업무 연속성을 계획하고, DRS는 복구 수준(Mirror~Cold)·센터 거리·복제방식·전환절차·모의훈련 을 핵심 고려사항으로 구축하되, 실효성은 문서가 아닌 정기 훈련·검증에서 확보된다.