← 목록으로
AI·데이터
#이상탐지#이상치#Isolation Forest#오토인코더#FDS
최종 업데이트 · 2026-09-29

이상탐지(Anomaly Detection)

1. 개요

가. 정의와 등장 배경

이상탐지(Anomaly Detection)란 정상 데이터가 형성하는 분포·패턴에서 유의하게 벗어난 관측치(이상치, Anomaly/Outlier)를 식별하는 데이터 분석 기법으로, 대부분이 정상이고 이상은 드물다는 불균형·희소성 가정 위에서 정상의 경계를 학습하고 그 경계 밖을 탐지한다.

전통적 규칙 기반 감시는 "임계값을 넘으면 경보"처럼 사람이 미리 정한 조건에 의존했다. 그러나 디지털 전환으로 서버·네트워크·IoT 센서·금융 거래가 초당 수만 건의 로그와 시계열을 생산하면서, 사람이 모든 정상 패턴을 규칙으로 열거하는 방식은 한계에 부딪혔다. 정상 상태 자체가 시간·부하·계절성에 따라 변하고, 공격자와 사기범은 알려진 규칙을 우회하도록 진화하기 때문이다.

이상탐지는 이 문제를 "무엇이 비정상인지"를 나열하는 대신 "무엇이 정상인지"를 데이터로 학습하고, 그 정상 모델에서 벗어나는 정도(이상 점수, Anomaly Score)를 정량화하는 방향으로 전환한다. 미지의(zero-day) 위협·고장·사기까지 포착할 수 있다는 점이 규칙 기반 대비 결정적 차별점이다. 라벨이 거의 없는 현실에서 대부분 비지도(Unsupervised) 또는 준지도(Semi-supervised) 로 접근한다는 점도 일반 분류(Classification) 문제와 구분되는 특징이다.

나. 필요성과 특징

이상탐지가 필요한 이유는 이상 사건 하나가 초래하는 손실이 비대칭적으로 크기 때문이다. 카드 부정거래 한 건, 제조 설비의 미세 진동 이상 하나, 침입 초기의 비정상 트래픽 하나를 조기에 잡으면 대형 사고를 예방하지만, 놓치면 금전·안전·평판 피해가 연쇄된다. 반대로 정상을 이상으로 오인하면(오탐, False Positive) 운영자가 경보 피로(Alert Fatigue)에 빠져 진짜 경보를 무시하게 된다. 따라서 이상탐지는 미탐(False Negative)과 오탐의 균형을 핵심 설계 목표로 삼는다.

특징은 세 가지로 요약된다. 첫째, 극단적 클래스 불균형으로 이상 비율이 보통 0.1~1% 수준이라 정확도(Accuracy)는 무의미하며 정밀도·재현율·PR-AUC 같은 지표가 필요하다. 둘째, 정답 라벨의 희소성으로 지도학습을 그대로 적용하기 어렵다. 셋째, 맥락 의존성으로 같은 값도 시간·주변 상황에 따라 정상일 수도 이상일 수도 있다(예: 새벽 3시의 대량 결제).

이러한 특성 때문에 이상탐지는 일반 예측·분류 과제와 문제 정의부터 다르게 접근해야 한다. 분류가 "이 데이터가 A인지 B인지"를 묻는다면, 이상탐지는 "이 데이터가 학습된 정상 세계에 속하는가"를 묻는 개방형(Open-set) 문제에 가깝다. 미리 정의되지 않은 새로운 이상까지 포착해야 하므로, 정상의 경계를 얼마나 정교하게 추정하느냐가 성능을 좌우하며, 이는 곧 데이터의 대표성과 특징 설계의 품질 문제로 귀결된다.

2. 이상의 유형과 탐지 프로세스

이상탐지를 설계하려면 먼저 탐지 대상 이상의 성격을 규정해야 한다. 이상은 크게 세 가지로 나뉜다. 점 이상(Point Anomaly) 은 개별 관측치가 전체 분포에서 홀로 벗어난 경우로, 평소 5만 원대 결제 이력에서 갑자기 500만 원 결제가 발생하는 사례가 여기에 속한다. 맥락 이상(Contextual Anomaly) 은 값 자체는 정상 범위지만 특정 맥락에서 비정상인 경우로, 여름철에는 정상인 전력 사용량이 겨울 심야에 나타나면 이상으로 본다. 집단 이상(Collective Anomaly) 은 개별 값은 정상이나 연속된 패턴 전체가 비정상인 경우로, 심전도에서 개별 파형은 정상 범위지만 특정 구간의 리듬 패턴이 부정맥을 나타내는 경우가 대표적이다.

이 구분이 중요한 이유는 유형마다 적합한 기법과 특징(Feature) 설계가 달라지기 때문이다. 점 이상은 값 자체의 분포로 잡히지만, 맥락 이상은 시간·위치 같은 맥락 변수를 함께 모델링해야 하고, 집단 이상은 시퀀스·윈도우 단위의 표현학습이 필요하다. 유형을 잘못 규정하면 아무리 좋은 알고리즘도 놓친다.

전체 탐지 파이프라인은 데이터 수집부터 대응까지 하나의 순환 구조를 이룬다. 아래 구조도는 정상 모델을 학습하고 이상 점수를 산출해 임계값으로 판정한 뒤, 운영자 피드백으로 모델을 갱신하는 폐루프를 보여준다.

flowchart LR
  A["데이터 수집(로그·시계열·거래)"] --> B["전처리·정규화·결측 처리"]
  B --> C["특징 추출(Feature Engineering)"]
  C --> D["정상 모델 학습"]
  D --> E["이상 점수(Anomaly Score) 산출"]
  E --> F["임계값·판정"]
  F --> G["경보·시각화·대응"]
  G --> H["운영자 피드백·라벨링"]
  H --> D
이상 유형 정의 예시 핵심 설계 포인트
점 이상 단일 값이 분포에서 이탈 고액 단건 결제 값 분포·밀도 모델
맥락 이상 맥락상 비정상 심야의 대량 트래픽 시간·위치 등 맥락 변수
집단 이상 패턴·시퀀스가 비정상 부정맥 파형, 서서히 증가하는 지연 윈도우·시퀀스 표현

전처리 단계에서 정규화(스케일링)와 결측·잡음 처리가 특히 중요하다. 거리·밀도 기반 기법은 스케일에 민감해 표준화하지 않으면 큰 척도의 변수가 거리 계산을 지배하기 때문이다. 특징 추출 단계에서는 시계열의 경우 이동평균·변화율·주기 성분(FFT), 로그의 경우 세션·엔티티 단위 집계 통계가 탐지력을 좌우한다.

3. 이상탐지 기법의 분류

이상탐지 기법은 정상을 어떻게 표현하느냐에 따라 통계 기반, 거리·밀도 기반, 트리 기반, 딥러닝 기반으로 나눌 수 있다. 아래 세부 아키텍처는 하나의 시스템에서 여러 탐지기(Detector)를 앙상블로 결합하고 점수를 통합해 판정하는 실무 구조를 보여준다.

flowchart TB
  subgraph Input["입력"]
    X["정규화된 특징 벡터"]
  end
  subgraph Detectors["탐지기 앙상블"]
    S1["통계(Z-score·IQR)"]
    S2["거리·밀도(kNN·LOF)"]
    S3["트리(Isolation Forest)"]
    S4["딥러닝(Autoencoder·LSTM)"]
  end
  X --> S1
  X --> S2
  X --> S3
  X --> S4
  S1 --> AGG["점수 통합·정규화"]
  S2 --> AGG
  S3 --> AGG
  S4 --> AGG
  AGG --> T["임계값·순위 기반 판정"]
  T --> O["이상 목록·설명(XAI)"]

가. 통계 기반 기법

통계 기반 기법은 데이터가 특정 분포(주로 정규분포)를 따른다고 가정하고, 그 분포에서 확률적으로 희박한 영역을 이상으로 본다. 가장 단순한 Z-score는 평균에서 표준편차의 몇 배 떨어졌는지를 계산해 보통 절댓값 3(약 상·하위 0.13%)을 넘으면 이상으로 판정한다. 분포가 치우쳐 평균·표준편차가 극단값에 왜곡될 때는 중앙값과 사분위수를 쓰는 IQR(사분위수 범위) 방식이 견고하다. IQR은 Q1-1.5×IQR 미만 또는 Q3+1.5×IQR 초과를 이상으로 규정한다.

통계 기법의 장점은 계산이 가볍고 임계값의 통계적 의미가 명확해 규제·감사 대응이 쉽다는 점이다. 실제로 금융권의 1차 이상거래탐지(FDS) 필터나 제조 공정의 관리도(Control Chart, ±3σ)가 대표적이다. 그러나 다변량·비선형 관계나 분포 가정이 깨지는 데이터에는 취약해, 고차원 로그·이미지 같은 복잡 데이터에서는 후술할 기법과 병행해야 한다.

여기서 주의할 점은 분포 가정이 성립하는지 반드시 검증해야 한다는 것이다. 예컨대 네트워크 패킷 크기나 응답시간은 대부분 롱테일(오른쪽 꼬리가 긴) 분포라 정규분포를 전제한 Z-score를 그대로 쓰면 정상 꼬리를 대량 오탐한다. 이럴 때는 로그 변환 후 적용하거나 분위수 기반 기법으로 전환한다.

나. 거리·밀도 기반 기법

거리·밀도 기반 기법은 "이상치는 정상 군집에서 멀거나 밀도가 낮은 곳에 있다"는 직관을 형식화한다. kNN 기반은 각 점에서 k번째 최근접 이웃까지의 거리를 이상 점수로 삼아, 거리가 크면 고립된 이상으로 본다. LOF(Local Outlier Factor) 는 한발 더 나아가 이웃의 밀도 대비 자신의 밀도 비율을 계산해, 전역이 아니라 국소적으로 밀도가 낮은 점을 잡는다. 밀도가 불균일한 실데이터(예: 도심과 교외의 결제 패턴 밀도가 다른 경우)에서 LOF가 전역 거리 기법보다 우수하다.

이 계열의 강점은 분포 가정 없이 데이터의 기하학적 구조만으로 작동한다는 점이다. 반면 고차원에서 거리 개념이 무의미해지는 차원의 저주(Curse of Dimensionality) 와, 모든 쌍의 거리를 계산할 때 O(n²)에 이르는 연산량이 약점이다. 따라서 수백만 건 이상의 대규모나 수백 차원 이상에서는 차원 축소(PCA·오토인코더)나 근사 최근접(ANN) 색인과 결합한다.

실무 적용 예로, 통신사의 로밍 부정 사용 탐지에서 가입자별 사용 패턴을 벡터화하고 LOF를 적용하면 평소와 국소적으로 다른 사용 급증을 잡아낼 수 있다. 이때 k값(이웃 수) 선택이 민감해, 너무 작으면 잡음에, 너무 크면 국소성 상실에 취약하므로 검증 데이터로 튜닝한다.

다. 트리(격리) 기반 기법

Isolation Forest는 이상치가 "적은 분할만으로 쉽게 고립된다"는 성질을 이용한다. 특징과 분할점을 무작위로 골라 이진 트리를 반복 생성했을 때, 이상치는 정상치보다 얕은 깊이에서 홀로 분리되므로 평균 경로 길이가 짧다. 이 경로 길이를 정규화한 값이 이상 점수가 된다. 정상의 밀집 영역을 모델링할 필요 없이 이상을 직접 격리한다는 발상의 전환이 핵심이다.

Isolation Forest의 실무적 매력은 선형에 가까운 O(n) 확장성, 분포 가정 불요, 고차원에서의 상대적 강건성이다. 샘플링(서브샘플)만으로도 잘 작동해 대규모 로그·거래 데이터의 1차 스크리닝에 널리 쓰인다. 다만 축에 평행한 분할만 하므로 축과 비스듬한 복잡 경계는 잘 못 잡으며, 이 경우 Extended Isolation Forest나 딥러닝 기법으로 보완한다.

라. 딥러닝·머신러닝 기반 기법

복잡한 비선형·고차원·시계열 데이터에는 표현학습 기반 기법이 강력하다. 오토인코더(Autoencoder) 는 입력을 저차원으로 압축했다가 복원하도록 정상 데이터로만 학습한 뒤, 복원이 잘 안 되어 복원오차(Reconstruction Error) 가 큰 입력을 이상으로 판정한다. 정상만 학습했으므로 처음 보는 이상 패턴은 잘 복원하지 못한다는 원리다. 시계열에는 LSTM/Transformer 기반 예측·복원 모델이 다음 값을 예측하고 예측오차가 큰 구간을 이상으로 잡는다. 이미지·산업 검사에는 정상 이미지 분포를 학습한 뒤 이탈을 탐지하는 방식이 쓰인다.

이 계열은 원본 특징을 사람이 설계하지 않아도 복잡 패턴(집단 이상 포함)을 포착한다는 장점이 있다. 대신 학습 데이터·연산 자원이 많이 들고, 왜 이상인지 설명하기 어려워 XAI(설명가능 AI) 기법과 결합이 필요하다. 준지도 계열인 One-Class SVM은 정상 데이터를 감싸는 최소 경계를 학습해 경계 밖을 이상으로 보며, 중소 규모 정상 집합에 유효하다.

생성 모델을 응용한 접근도 있다. GAN 기반 이상탐지(AnoGAN 계열)는 정상 데이터의 생성 분포를 학습한 뒤 입력을 가장 잘 재현하는 잠재벡터를 찾아 그 재현 차이를 이상 점수로 삼고, 최근에는 확산모델(Diffusion)로 정상을 복원해 이탈을 잡는 연구도 활발하다. 다만 이런 고급 모델일수록 학습 안정성·해석성·연산비용 부담이 커지므로, 문제의 난도와 운영 제약을 고려해 과도한 복잡성을 피하는 것이 실무 원칙이다. 즉 통계·격리 기법으로 대부분을 처리하고, 딥러닝은 그것으로 잡히지 않는 복잡·시계열 이상에 선택적으로 투입하는 계층적 전략이 비용 대비 효과적이다.

4. 기법 비교와 적용 사례

기법 선택은 "성능이 가장 높은 것"이 아니라 데이터 규모·차원·라벨 유무·설명 요구·실시간성이라는 제약의 교집합에서 결정된다. 통계 기법은 가볍고 설명이 쉬우나 표현력이 낮고, 거리·밀도 기법은 구조를 잘 반영하나 고차원·대규모에 약하다. Isolation Forest는 확장성과 무가정이 강점이지만 복잡 경계에 한계가 있고, 딥러닝은 표현력이 최고지만 자원·설명성·데이터 요구가 크다. 이 차이는 각 기법이 "정상"을 표현하는 방식(분포·거리·격리·복원)이 다르기 때문에 발생한다.

기법 라벨 필요 고차원 확장성 설명성 대표 용도
통계(Z·IQR) 불필요 낮음 매우 높음 높음 관리도, 1차 필터
거리·밀도(LOF) 불필요 낮음 낮음(O(n²)) 중간 국소 이상, 소·중규모
Isolation Forest 불필요 중간 높음(O(n)) 중간 대규모 스크리닝
오토인코더/LSTM 준지도 높음 중간 낮음 시계열·이미지·복잡패턴
One-Class SVM 준지도 중간 낮음 중간 중소 정상집합

첫째 사례는 금융 이상거래탐지(FDS) 다. 국내 카드사는 통상 규칙 기반 1차 필터로 명백한 이상을 걸러 오탐을 줄이고, 그 뒤 머신러닝(Isolation Forest·오토인코더) 2차 모델로 미묘한 사기 패턴을 잡는 다단계 구조를 쓴다. 사기 비율이 0.1% 안팎으로 극도로 불균형해, 재현율을 높이되 오탐으로 인한 정상 거래 차단(고객 불편)을 억제하는 임계값 조정이 관건이다.

둘째 사례는 제조 설비 예지정비(PdM) 다. 진동·온도·전류 센서 시계열을 오토인코더나 LSTM으로 학습해 정상 가동 패턴을 모델링하고, 복원오차 급증으로 베어링 마모 등 초기 고장 징후를 며칠~몇 주 전에 포착한다. 실제로 설비 이상을 조기 감지하면 계획 정비로 전환해 비계획 정지(다운타임)를 유의하게 줄일 수 있다.

셋째 사례는 IT 운영·보안 관제(AIOps·UEBA) 다. 서버 메트릭·로그·사용자 행위(UEBA)에 이상탐지를 적용해 트래픽 급변, 비정상 로그인, 내부자 위협을 포착한다. 예컨대 평소 업무시간·특정 IP에서만 접속하던 계정이 심야 해외 IP에서 대량 다운로드를 시도하면 맥락 이상으로 잡아 SIEM/SOAR로 자동 대응한다.

이 세 사례를 관통하는 공통 교훈은, 단일 만능 알고리즘을 찾기보다 도메인 지식으로 특징을 설계하고 여러 탐지기를 계층·앙상블로 결합하는 편이 견고하다는 점이다. FDS의 다단계 필터, PdM의 센서별 모델 결합, 관제의 규칙+ML 병행이 모두 같은 원리를 따른다. 또한 세 사례 모두 탐지 자체보다 탐지 이후의 운영자 검토·라벨 축적·모델 갱신이라는 폐루프가 장기 성능을 좌우한다는 공통점을 보인다.

5. 심화: 최신 동향과 평가 전략

최근 흐름은 세 방향이다. 첫째, 딥러닝·기초모델 활용이다. 정상 이미지 분포를 학습하는 산업 검사용 모델, 시계열용 Transformer, 그래프 신경망(GNN) 기반 금융·소셜 네트워크 이상탐지가 확산된다. 특히 사전학습된 표현을 활용해 소량 데이터로도 탐지 성능을 끌어올리는 접근이 주목된다. 둘째, 설명가능성(XAI) 결합이다. 규제 산업(금융·의료)에서는 "왜 이상인가"를 제시해야 하므로 SHAP·복원오차 기여도 분석 등으로 탐지 근거를 함께 제공한다. 셋째, 실시간 스트리밍·개념 변화(Concept Drift) 대응으로, 정상 패턴이 시간에 따라 변하므로 온라인 학습과 모델 재학습 파이프라인(MLOps)이 필수가 되었다.

평가 지표 설계는 이상탐지 성패를 가른다. 클래스가 극도로 불균형하므로 정확도는 오해를 부른다(전부 정상이라 예측해도 99%가 나온다). 대신 정밀도(Precision), 재현율(Recall), F1, PR-AUC를 쓰고, 놓치면 안 되는 도메인(안전·보안)은 재현율을, 경보 피로가 심각한 도메인은 정밀도를 우선한다. 시계열에서는 이상이 "구간"으로 존재하므로 점 단위 지표 대신 구간 단위 평가나 탐지 지연(Detection Delay)을 함께 본다. 또한 임계값은 고정값이 아니라 운영 비용(오탐 처리 비용 대 미탐 손실)을 반영한 비용민감(Cost-sensitive) 관점에서 정한다.

6. 고려사항 및 시사점

기술사 관점에서 이상탐지 도입은 알고리즘 선택을 넘어 데이터·운영·거버넌스를 아우르는 전략적 결정이다. 첫째, 라벨과 데이터 품질 전략이다. 이상 라벨은 희소하고 지연되므로(사기 확정까지 수개월) 비지도로 시작해 운영자 피드백으로 라벨을 축적하고 점차 준지도·능동학습으로 고도화하는 로드맵이 현실적이다. 정상 데이터에 이상이 섞여 학습을 오염시키지 않도록 초기 데이터 정제도 병행한다.

둘째, 오탐·미탐 트레이드오프의 비용 기반 관리다. 임계값 하나로 두 오류가 반비례하므로, 도메인별 손실함수를 정의해 임계값을 정하고 다단계(규칙→ML→사람 검토) 구조로 오탐을 흡수한다. 경보 피로를 줄이기 위해 경보를 심각도로 등급화하고 유사 경보를 상관·집계하는 것이 운영 성공의 관건이다.

셋째, 설명가능성과 규제·감사 대응이다. 금융·의료·개인정보 영역에서는 자동 판정의 근거 제시와 이의 절차가 요구된다. 따라서 성능만 높은 블랙박스보다, 근거를 제시할 수 있는 모델이나 XAI 결합 구조를 택하고, 판정 이력·모델 버전·데이터 계보를 감사 가능하게 남긴다.

넷째, 운영 지속성과 연계 기술이다. 개념 변화에 대응하는 재학습 파이프라인(MLOps·모델 드리프트 모니터링), 실시간 스트리밍 처리(Kafka·Flink), 탐지 후 자동 대응(SOAR)과의 연계로 "탐지에서 대응까지"의 폐루프를 완성해야 실제 가치가 난다. 또한 적대적 회피(Adversarial Evasion)에 대비해 다양한 탐지기를 앙상블하고 주기적으로 탐지 우회 시나리오를 점검하는 것이 바람직하다. 전망으로는 기초모델·자기지도학습이 라벨 부족 문제를 완화하고, 이상탐지가 관측가능성(Observability)·데이터 관측성(Data Observability)과 통합되어 시스템 신뢰성의 표준 구성요소로 자리 잡을 것으로 보인다.

참고자료


한 줄 요약: 이상탐지는 "정상"을 데이터로 학습해 그 경계를 벗어난 희소·비정상 관측치를 탐지하는 기법으로, 점·맥락·집단 이상 유형과 통계·거리·격리·딥러닝 기법을 데이터 제약과 비용에 맞게 조합하고 오탐·미탐 균형과 설명성·운영 폐루프를 함께 설계해야 실무 가치를 낸다.