← 목록으로
보안·개인정보
#PET#개인정보#차분프라이버시#동형암호#연합학습#익명화#134회#128회
최종 업데이트 · 2026-10-01

개인정보 보호 강화기술(PET, Privacy Enhancing Technologies)

1. 개요

가. 정의

데이터의 유용성(활용성)을 유지하면서 개인정보 식별 위험을 제거·최소화하기 위한 기술의 총칭. 데이터 3법·GDPR 준수와 데이터 활용을 동시에 달성한다.

PET는 단일 기술이 아니라 목적(프라이버시 보호와 활용의 양립)을 공유하는 기술군을 묶은 우산 개념이다. 따라서 "PET를 도입한다"는 말은 특정 제품을 사는 것이 아니라, 보호 대상·위협 모델·활용 목적에 맞는 기법을 골라 조합하는 설계 행위에 가깝다. 이 점이 PET를 이해할 때 가장 먼저 잡아야 할 관점이다.

나. 등장 배경 및 필요성

데이터 활용과 프라이버시 보호는 전통적으로 제로섬 관계로 여겨졌다. 활용하려면 데이터를 공유해야 하는데, 공유하면 개인이 노출되기 때문이다. 기업은 "분석하려면 원본을 모아야 한다"고 믿었고, 규제는 "모으면 유출된다"며 이동을 막았다. 그 결과 가치 있는 데이터가 각 기관의 사일로에 갇혀 활용되지 못하는 교착이 반복됐다.

특히 단순 익명화만으로는 다른 데이터와 결합해 개인을 다시 특정하는 재식별 공격(Re-identification) 을 막지 못한다는 것이 여러 사례로 드러났다. 대표적으로 넷플릭스가 공개한 익명 영화 평점 데이터가 외부 IMDb 공개 평점과 교차 결합되어 상당수 사용자가 재식별된 사건, 또 익명화된 공공 의료 데이터가 투표인 명부와 결합돼 특정 주지사의 진료기록이 식별된 고전적 사례는, "식별자만 지우면 안전하다"는 통념이 틀렸음을 보여줬다. 생년월일·성별·우편번호 몇 개만 결합해도 인구의 상당 비율이 유일하게 특정된다는 연구도 이를 뒷받침한다.

PET는 이 제로섬을 깨기 위해 등장한 기술군으로, "데이터를 보여주지 않고도 계산 결과만 얻는다"거나 "개인 기여를 수학적으로 숨긴다"는 방식으로 활용과 보호를 양립(포지티브섬) 시킨다. 즉 데이터를 "모아서 보호"하는 대신 "모으지 않고 활용"하거나 "암호화된 채 활용"하는 발상의 전환이다. AI 학습을 위한 대규모 데이터 공유 수요가 폭증하고, 동시에 GDPR·국내 개인정보보호법 등 규제가 강화되면서, PET는 "규제를 지키면서 데이터를 쓰는" 유일하게 현실적인 수단으로 부상하고 있다.

다. 특징

PET를 관통하는 공통 특징은 세 가지다. 첫째, 유용성-보호의 동시 추구로, 둘 중 하나를 희생하는 전통적 접근과 달리 양립 지점을 수학적·구조적으로 설계한다. 둘째, 정량화 가능성으로, 차분 프라이버시의 ε처럼 "얼마나 보호되는가"를 측정 가능한 지표로 제시해 위험을 관리한다. 셋째, 조합 전제(Composable) 로, 어느 기법도 단독으로 만능이 아니므로 위협 모델에 맞춰 여러 기법을 겹쳐 쓰는 것을 전제로 한다. 이 특징들은 뒤의 분류·조합 논의에서 반복적으로 확인된다.

2. 분류 체계

PET는 접근 원리에 따라 세 갈래로 나뉜다. 아래 분류도는 "데이터를 변형할 것인가, 암호화한 채 계산할 것인가, 아예 모으지 않을 것인가"라는 세 가지 전략을 보여준다.

flowchart TB
  P["PET"] --> A["비식별 기술"]
  P --> B["암호 기반"]
  P --> C["분산·협력 학습"]
  A --> A1["가명화/익명화"]
  A --> A2["차분 프라이버시"]
  B --> B1["동형암호"]
  B --> B2["영지식증명 ZKP"]
  B --> B3["다자간 연산 MPC"]
  C --> C1["연합학습 FL"]

비식별 기술은 데이터 자체를 변형해 식별성을 낮추는 계열로, 처리 후 데이터를 그대로 활용할 수 있어 간단하지만 재식별 위험이 완전히 사라지지는 않는다. 가장 전통적이고 법·제도와 가장 밀착된 영역으로, 가명정보 제도의 근간을 이룬다.

암호 기반 계열은 데이터를 암호화한 상태로 계산하거나(동형암호), 원본을 드러내지 않고 사실만 증명하거나(ZKP), 여러 참여자가 각자 데이터를 숨긴 채 공동 계산한다(MPC). 수학적으로 강력한 보안을 보장하나 연산·통신 비용이 크다는 공통 약점을 지녀, 성능 최적화가 실무 도입의 관건이 된다.

분산·협력 학습 계열은 데이터를 한곳에 모으지 않고 각자 위치에서 학습해 모델만 공유하는 연합학습으로, 데이터 이동 자체를 없앤다는 점에서 발상이 다르다. "보호"가 아니라 "애초에 옮기지 않음"으로 위험을 제거하는 접근이다.

세 계열은 보호의 "위치"가 다르다. 비식별은 데이터 자체에, 암호 기반은 연산 과정에, 분산 학습은 데이터의 소재(위치) 에 보호의 초점을 둔다. 이 차이를 이해해야 상황에 맞는 조합을 설계할 수 있다.

3. 주요 기술

각 기술은 "무엇을 숨기고 무엇을 얻는가"의 트레이드오프가 다르다. 아래 아키텍처 도식은 연합학습(FL)을 예로, 원본 데이터는 각자 두고 학습된 모델 파라미터만 중앙으로 모이는 흐름을 보여준다.

flowchart LR
  subgraph Site1["병원 A"]
    D1["로컬 데이터"] --> M1["로컬 학습"]
  end
  subgraph Site2["병원 B"]
    D2["로컬 데이터"] --> M2["로컬 학습"]
  end
  M1 -->|"파라미터만"| G["중앙 집계(글로벌 모델)"]
  M2 -->|"파라미터만"| G
  G -->|"갱신 모델 배포"| M1
  G -->|"갱신 모델 배포"| M2

가명화/익명화는 이름·주민번호 같은 식별자를 가명·마스킹으로 대체하는 가장 기본적 방법으로, 법적 근거가 명확하고 처리가 간단하다. 그러나 앞서 본 재식별 사례처럼, 직접 식별자를 지워도 준식별자(나이·지역·직업 등)의 조합으로 개인이 다시 특정될 수 있어 k-익명성·l-다양성 같은 추가 모델로 결합 위험을 통제한다. 간단하지만 "얼마나 지워야 안전한가"의 판단이 어렵다는 점이 본질적 한계다.

차분 프라이버시(DP) 는 통계 결과에 정교하게 계산된 잡음을 더해 "특정 개인이 데이터에 포함됐는지 여부가 결과에 미치는 영향"을 수학적으로 제한한다. 이 영향의 상한을 ε(엡실론) 로 정량화하며, ε이 작을수록 보호는 강하지만 결과의 정확도는 떨어진다. 개별 응답자를 보호하면서도 전체 통계의 유용성은 지키는 원리로, 수학적 증명 가능성이 다른 비식별 기법과 구별되는 강점이다.

동형암호(HE) 는 복호화 없이 암호문 상태에서 덧셈·곱셈 연산을 수행해, 민감 데이터를 암호화한 채 클라우드에 맡겨 계산시켜도 원본이 노출되지 않는다. "열어보지 않고 계산한다"는 점에서 가장 이상적이나, 연산이 평문 대비 수천~수만 배 느릴 수 있어 성능이 최대 걸림돌이다. 영지식증명(ZKP) 은 비밀값을 공개하지 않고 "그 값을 안다/조건을 만족한다"는 사실만 증명해, 나이를 밝히지 않고 성인임만 증명하거나 블록체인에서 잔액을 숨긴 채 거래 유효성을 증명하는 데 쓰인다.

다자간 연산(MPC) 은 여러 기관이 각자 데이터를 공개하지 않고 공동 함수만 계산하는 기법으로, 어느 참여자도 남의 입력을 알 수 없지만 최종 결과는 함께 얻는다. 연합학습(FL) 은 원본 대신 로컬 학습으로 얻은 모델 파라미터만 중앙에 모아 통합하므로 데이터 이동이 없지만, 공유된 파라미터에서 원본 일부를 역추론하는 공격 가능성이 남아 보통 DP 등과 결합해 보강한다.

기술 원리 강점 한계(트레이드오프)
가명화/익명화 식별자 대체·제거 간단·법적 근거 재식별 위험 잔존
차분 프라이버시(DP) 통계에 잡음 추가 수학적 보장(ε) 정확도 손실
동형암호(HE) 암호 상태 연산 강력한 기밀성 높은 연산 비용
영지식증명(ZKP) 노출 없이 사실 증명 인증·블록체인 활용 증명 설계 복잡
다자간 연산(MPC) 공유 없이 공동 연산 다기관 협업 분석 통신 오버헤드
연합학습(FL) 파라미터만 공유 데이터 이동 없음 모델 역추론 위험

4. 적용 사례

PET는 데이터 이동이 법·경쟁상 곤란한 도메인에서 특히 진가를 발휘한다. 금융에서는 여러 은행이 고객 데이터를 서로 넘기지 않고 MPC로 공동 사기탐지 모델을 돌려, 단독으로는 못 잡던 여러 은행에 걸친 자금세탁·이상거래를 탐지한다. 경쟁사이자 규제 대상인 은행들이 "데이터는 각자 두고 결과만 공유"할 수 있다는 점이 핵심이며, 이는 전통적 데이터 공유로는 불가능했던 협업이다.

의료에서는 환자 데이터를 병원 밖으로 낼 수 없는 규제·윤리적 제약이 강하므로, 각 병원이 로컬 학습만 하고 모델 파라미터를 모으는 연합학습으로 질병 진단·영상판독 모델을 공동 개발한다. 예컨대 여러 병원이 각자의 희귀질환 영상을 모델 학습에만 쓰고 원본은 공유하지 않아, 단일 병원 데이터로는 부족했던 학습량을 확보하면서도 환자 프라이버시를 지킨다.

통계·공공에서는 인구 통계를 공개할 때 차분 프라이버시로 잡음을 더해 개별 응답자 보호와 통계 유용성을 동시에 확보한다. 미국 인구조사국(US Census Bureau)이 2020년 센서스에 차분 프라이버시를 실제 채택한 것이 대표적 사례로, 국가 통계라는 거대한 규모에서 DP가 실용적으로 적용될 수 있음을 입증했다. 또한 데이터 결합 영역에서는 가명정보를 결합전문기관을 통해 안전하게 결합하고, 외부 반출을 통제하는 데이터 안심구역(Secure Processing Environment)에서 분석하게 함으로써 제도와 기술을 병행한다.

광고·마케팅 분야도 대표적 적용처다. 서드파티 쿠키 폐지 흐름에 맞춰, 개별 사용자를 추적하지 않고도 광고 효과를 측정하려는 수요가 커지면서 차분 프라이버시·집계 기반 측정 같은 PET가 도입되고 있다. 광고주와 매체사가 각자의 고객 데이터를 직접 교환하지 않고 데이터 클린룸(Data Clean Room) 안에서 집계 결과만 확인하는 방식이 그 예로, 개인 단위 식별 없이 캠페인 성과만 얻는 포지티브섬의 전형을 보여준다.

분야 활용
금융 기관 간 사기탐지 공동분석(MPC)
의료 병원 간 연합학습(FL)
통계·공공 차분 프라이버시 기반 통계 공개
데이터 결합 가명정보 결합·데이터 안심구역

5. 심화: 규제·표준·시장 동향

PET는 이제 학술 개념을 넘어 규제기관이 적극 권장하는 수단으로 자리 잡고 있다. 영국 ICO와 UN 등은 PET 활용 가이드를 발표했고, 미국·영국은 PET 기반 혁신을 겨루는 공동 챌린지를 운영하는 등 정책적 드라이브가 걸리고 있다. GDPR이 요구하는 데이터 보호 중심 설계(Data Protection by Design) 를 기술적으로 구현하는 사실상의 표준 수단으로 PET가 지목되는 흐름이다.

기술 표준화도 진전되고 있다. 동형암호는 국제 HomomorphicEncryption.org 커뮤니티를 중심으로 파라미터·보안수준 표준화가 논의되고, ISO/IEC에서도 비식별·프라이버시 기술 관련 표준(예: ISO/IEC 20889 비식별 용어·기법 분류)이 정비되고 있다. 표준화는 "각 기관이 제각각 주장하던 안전성"을 공통 척도로 비교·검증할 수 있게 해, PET가 연구실을 넘어 조달·감사 대상이 되는 제도권 기술로 안착하는 토대가 된다. 산업적으로는 구글·애플 등 빅테크가 자사 OS·브라우저 통계 수집에 로컬 차분 프라이버시를 적용해온 것이 상용화의 신호탄이 되었고, 최근에는 신뢰실행환경(TEE) 같은 하드웨어 기반 기밀컴퓨팅이 소프트웨어 PET와 결합해 성능 한계를 보완하는 방향으로 발전하고 있다.

시장 관점에서 PET는 "비용 센터(규제 대응)"에서 "가치 창출 수단(데이터 협업·수익화)"으로 재해석되고 있다. 과거에는 규제를 피하기 위한 방어적 지출로 여겨졌으나, 이제는 경쟁사·타 산업과 안전하게 데이터를 결합해 새로운 분석 가치를 만들어내는 협업의 전제 조건으로 인식이 바뀌고 있다. 이 인식 전환이 PET 시장의 성장을 견인하는 근본 동력이다.

예상 출제 방향 관점에서, PET는 "AI·데이터 활용"과 "개인정보 보호"가 충돌하는 지점을 묻는 문제에서 단골 해법으로 등장한다. 따라서 답안에서는 개별 기법 나열에 그치지 말고 "왜 조합해야 하는가(단일 기법의 한계)"와 "제도와 어떻게 맞물리는가(가명정보·안심구역)" 를 연결해 서술하는 것이 고득점 전략이다.

6. 고려사항 및 시사점

  • 단일 기술의 한계와 조합: 어느 하나로 완결되지 않으므로 기법을 조합한다. 예컨대 연합학습(FL)만으로는 파라미터에서 원본이 역추론될 수 있어 FL + DP로 잡음을 더하고, MPC와 HE를 결합해 협업과 기밀성을 함께 확보하는 식으로 위협 모델에 맞춰 중첩 방어를 구성해야 한다.
  • 성능-정확도의 실용적 튜닝: HE·MPC의 연산·통신 비용과 DP의 정확도 손실은 실무 도입의 걸림돌이므로, 보호 수준(ε 등)과 성능·정확도를 업무 요구 수준에 맞춰 조정하는 운영 역량이 관건이다. 과한 보호는 데이터를 무용하게 만들고, 부족한 보호는 규제 위반을 낳는다.
  • 제도·거버넌스 병행: 기술만으로는 부족하고 개인정보보호법·가명정보 제도와 프라이버시 중심 설계(PbD) 원칙을 함께 적용해, 설계 단계부터 프라이버시를 내재화해야 지속가능하다. 기술은 수단이고 거버넌스가 틀이다.
  • 검증·투명성 확보: PET 적용 결과가 "정말 안전한지"를 조직 스스로 주장하는 데 그치지 않고, 재식별 위험 평가·프라이버시 영향평가(PIA)와 외부 검증을 통해 입증해야 신뢰를 얻는다. ε 값 등 보호 파라미터의 선정 근거도 문서화해야 한다.
  • 미래 위협 대비(암호 민첩성): 동형암호·ZKP 등 암호 기반 PET는 향후 양자컴퓨팅 등 연산 환경 변화에 영향을 받을 수 있으므로, 특정 알고리즘에 고착되지 않고 교체 가능한 구조(암호 민첩성, Crypto-agility)로 설계해 장기 안전성을 확보해야 한다.

참고자료


한 줄 요약: PET는 가명·익명화, 차분 프라이버시, 동형암호, ZKP, MPC, 연합학습 등으로 데이터 활용과 프라이버시 보호를 양립시키는 기술군으로, 보호의 초점(데이터·연산·소재)이 다른 세 계열을 이해해 위협 모델에 맞게 조합(FL+DP 등)하고 가명정보 제도·PbD와 병행하는 것이 관건이다.