BCP 주요 지표와 DRS 구축 고려사항
1. 개요
가. 정의
BCP(Business Continuity Planning, 업무연속성계획) 는 재해·장애 상황에서도 핵심 업무를 중단 없이(또는 최소 중단으로) 지속하도록 수립하는 종합 계획·체계이며, DRS(Disaster Recovery System, 재해복구시스템) 는 그중 IT 시스템·데이터를 복구하는 기술적 실현 수단이다.
BCP와 DRS는 상위-하위 관계다. BCP는 인력·프로세스·시설·IT를 아우르는 경영 차원의 연속성 전략이고, DRS는 그 안에서 "IT 시스템을 어떻게 복구할 것인가"를 담당한다. 즉 DRS는 BCP의 필요조건이지 충분조건이 아니며, 시스템이 복구돼도 업무 절차·인력 대응이 없으면 연속성은 달성되지 않는다.
나. 필요성
재해는 지진·화재 같은 물리적 사건뿐 아니라 랜섬웨어·시스템 장애 등 사이버 위협까지 포함하며, 디지털 의존도가 높아진 오늘날 업무 중단은 곧 매출·신뢰 손실로 직결된다. 특히 금융권은 전자금융감독규정, 공공은 재해경감활동 관리체계 등 규제가 DR 체계 구축을 의무화하고 있어, BCP/DRS는 선택이 아닌 필수가 되었다.
2. BCP 수립 절차와 주요 지표
flowchart LR
B[BIA<br/>업무영향분석] --> R[위험평가]
R --> S[복구전략 수립]
S --> P[BCP 수립·훈련]
BCP의 출발점은 BIA(Business Impact Analysis, 업무영향분석) 다. 모든 업무를 똑같이 보호하는 것은 비효율적이므로, BIA로 각 업무의 중단 시 영향을 분석해 우선순위와 목표 복구 수준을 정한다. 여기서 도출되는 핵심 지표가 RTO와 RPO다. RTO(목표복구시간) 는 "얼마나 빨리 복구해야 하는가"로 시스템 이중화 수준을 결정하고, RPO(목표복구시점) 는 "얼마만큼의 데이터 손실을 감수할 수 있는가"로 백업·복제 주기를 결정한다.
두 지표의 관계를 예로 들면, RPO가 "1시간"이면 최소 1시간마다 백업(또는 복제)해야 하고, RTO가 "2시간"이면 2시간 안에 시스템을 되살릴 인프라가 준비돼야 한다. RTO/RPO를 0에 가깝게 요구할수록 비용이 급증하므로, BIA 결과에 근거해 업무별로 차등 설정하는 것이 원칙이다.
| 지표 | 의미 |
|---|---|
| RTO(목표복구시간) | 장애 발생~복구 완료까지 허용 시간 |
| RPO(목표복구시점) | 허용 가능한 데이터 손실 범위(백업·복제 주기) |
| RSO(복구범위목표) | 복구 대상 업무·시스템의 범위 |
| MTD(최대허용중단시간) | 업무가 견딜 수 있는 최대 중단(BIA 기반) |
| RCO/RCapO | 복구 시 통신·처리용량 목표 |
3. DRS 구축 유형(복구 수준)
DRS 유형은 결국 RTO 목표와 비용의 균형에서 갈린다. 복구를 빠르게 하려면 대기 시스템을 상시 가동해야 하고 그만큼 비용이 든다. Mirror Site 는 실시간 이중화로 RTO가 0에 수렴하지만 가장 비싸고, Cold Site 는 공간·설비만 두어 저렴하지만 복구에 수주가 걸린다. Hot/Warm은 그 사이의 절충안이다. 핵심 업무일수록 상위 유형을, 우선순위가 낮은 업무는 하위 유형을 택하는 식으로 조합한다.
| 유형 | RTO | 특징 |
|---|---|---|
| Mirror Site | 즉시(0) | 실시간 이중화, 최고 비용 |
| Hot Site | 수 시간 | 가동 상태로 대기 |
| Warm Site | 수 일 | 핵심 자원만 부분 구성 |
| Cold Site | 수 주 | 공간·설비만, 최저 비용 |
4. DRS 구축 핵심 고려사항
flowchart LR
T[RTO/RPO 목표] --> D[센터 간 거리]
D --> C[데이터 복제 방식]
C --> E[전환·복구 절차]
E --> M[모의훈련·검증]
DRS 설계에서 가장 미묘한 트레이드오프는 센터 간 거리와 데이터 복제 방식이 얽히는 지점이다. 재해가 두 센터를 동시에 덮치지 않으려면 지역을 충분히 떨어뜨려야 하지만, 거리가 멀면 동기 복제의 전송 지연이 커져 운영 성능이 떨어진다. 그래서 무손실(RPO=0)이 필요한 금융 거래는 동기 복제를 쓰되 거리 제약을 감수하고, 지연에 민감한 시스템은 약간의 손실을 허용하는 비동기 복제로 원거리 센터를 두는 식으로 결정한다. 또한 전환(Failover)과 복구(Failback) 절차를 자동/수동 중 무엇으로 할지, RunBook에 명문화했는지가 실제 위기 시 복구 성공을 좌우한다.
| 고려사항 | 내용 |
|---|---|
| RTO/RPO vs 비용 | 목표 수준과 투자 규모의 균형 |
| 센터 간 거리 | 동시 피해 회피(원거리) vs 동기복제 지연(근거리) |
| 데이터 복제 | 동기(무손실·지연↑) / 비동기(성능↑·손실 가능) |
| 전환 절차 | 자동/수동 Failover·Failback, RunBook 문서화 |
| 검증 | 정기 모의훈련으로 복구 가능성 실증 |
무엇보다 DRS는 한 번 구축했다고 끝이 아니다. 시스템 구성은 계속 바뀌므로, 정기 모의훈련으로 실제 복구가 목표 시간 안에 되는지 검증하지 않으면 위기 때 무용지물이 될 수 있다. 훈련 없는 DR 계획은 "종이 위의 복구"에 불과하다.
5. 고려사항 및 시사점
- 클라우드 DR로 비용 효율화: 파일럿 라이트·웜 스탠바이 같은 클라우드 DR 패턴은 평상시 최소 자원만 유지하다 재해 시 확장(Scale-out)해, 물리 DR센터보다 낮은 비용으로 상위 복구 수준을 달성한다.
- 문서가 아닌 훈련으로 실효성 확보: BCP/DRS의 가치는 계획서가 아니라 주기적 훈련·검증에서 나온다. 복구 절차를 실제로 돌려보며 갱신해야 한다.
- 사이버 복원력(Cyber Resilience) 연계: 랜섬웨어에 대비해 변경 불가능한 백업(Immutable Backup)·망 분리된 복구 환경을 함께 설계한다.
- RTO/RPO의 지속 재산정: 업무 변화에 맞춰 BIA를 주기적으로 갱신해 목표 지표를 현실에 맞게 유지한다.
한 줄 요약: BCP는 BIA 기반 RTO·RPO·RSO·MTD 지표로 업무 연속성을 계획하고, DRS는 복구 수준(Mirror~Cold)·센터 거리·복제방식·전환절차·모의훈련 을 핵심 고려사항으로 구축하되, 실효성은 문서가 아닌 정기 훈련·검증에서 확보된다.