← Back to projects
2025.12.29 - 2026.03.06 · KT AIVLE School 8기 Bigproject · AI 트랙 대상(1위)

PIILOT - AI 기반 개인정보 보호 플랫폼

기업 인프라에 산재된 개인정보를 AI 모델로 자동 탐지하고 비식별화하여 보안 및 법적 리스크를 최소화하는 통합 관제 플랫폼.

Background

생성형 AI 기술의 확산과 함께 기업의 개인정보 유출 사고가 급격히 증가하고 있다. 국내 기업 개인정보 유출 건수는 2022년 167건에서 2025년 451건 이상으로 3년간 170% 증가하였다. 대형 통신사 2,324만 명 개인정보 유출로 과징금 1,348억 원이 부과되는 등 사회적 피해 규모가 역대 최대 수준을 기록하고 있다.

법적 환경도 빠르게 변화하고 있다. 2025년 개정된 개인정보보호법에 따라 위반 시 과징금 상한이 매출의 3% → 10%로 대폭 상향되어 기업의 법적 리스크가 크게 커졌다. 그러나 기업 현장에서는 아래 세 가지 구조적 문제가 해결되지 않은 채 방치되어 있었다.

PIILOT은 이 세 가지 문제를 AI 자동화로 해결하는 것을 목표로 설계되었다. 수동 점검 중심의 기존 방식과 달리, AI 기반 자동 탐지로 관리 범위를 확대하고 사후 대응이 아닌 사전 탐지 기반 예방으로 패러다임을 전환하였다.

Overview

기업 환경의 DB·파일 서버에 분산된 개인식별정보(PII)를 AI 모델이 자동으로 탐지·비식별화하는 통합 관제 플랫폼이다. 개인정보 유출을 사전에 방지하고 탐지하는 것을 목적으로, 문서·이미지 하이브리드 비식별화 파이프라인과 2단계 XGBoost 분류 아키텍처를 핵심 AI 엔진으로 구성하였다.

총 54일간(2025.12.29 - 2026.02.20) 진행된 KT AIVLE School 8기 Bigproject로, AI 6명, BE 4명, FE 2명, Infra 2명으로 구성된 14인 팀이 개발하였다. 최종 발표에서 AI 트랙 대상(1위)을 수상하였다.

PIILOT 로그인 화면
PIILOT 서비스 로그인 화면 - "개인정보 유출을 사전에 방지하고 탐지하는 AI 기반 파일럿 관제 플랫폼"

Demo

대시보드 모니터링부터 DB·파일 서버 스캔, AI 자동 마스킹, 법령/내규 AI 어시스턴트까지 PIILOT의 핵심 플로우를 담은 서비스 시연 영상이다.

Key Features

대시보드에서 연결된 서버 수, 개인정보 포함 컬럼/파일 수, 총 이슈 개수를 한눈에 파악할 수 있으며, DB·파일 서버별 암호화 추세와 개인정보 유형 분포를 실시간 차트로 제공한다.

PIILOT 대시보드
대시보드 - DB·파일 서버 암호화 추세, 개인정보 유형 분포, 이슈 목록 실시간 모니터링

DB 서버와 파일 서버를 연결하여 개인정보가 포함된 컬럼·파일을 탐지하고, 암호화 여부·위험도·스캔 이력을 관리한다. DB 스캔은 변경된 테이블만 재스캔하는 Change Signature 방식으로 재스캔 시 약 93% 시간 단축을 달성하였다.

DB 개인정보 목록
DB 개인정보 목록 - 컬럼별 PII 유형, 암호화 여부, 위험도 조회
파일 개인정보 목록
파일 개인정보 목록 - 파일별 마스킹 상태, 위험도, 스캔 이력 관리

법령/내규 검색 메뉴에서는 RAG 기반 AI 어시스턴트가 개인정보보호법·GDPR·사내 보안 가이드라인 등을 벡터 DB에서 검색해 질의에 근거 문서와 함께 답변한다. DB 이슈 목록에 대해 "법령에 위배되는 내용이 뭐야?"와 같은 자연어 질의를 던지면 위험도별 이슈와 관련 법 조항을 함께 제시한다.

법령/내규 검색 화면
법령/내규 검색 - 자연어 질의에 대해 근거 법령·내부 규정 문서를 함께 제시하는 RAG 검색

System Architecture

AWS 위에 Public/Private Subnet을 3개 가용영역(AZ)으로 분리한 구조로, Web Server와 AI Server를 Private Subnet에 배치하고 ALB를 통해서만 트래픽을 받도록 구성하였다. DB는 PostgreSQL Master-Standby 복제로 이중화하고, 사내 DB/파일 서버는 별도 Private Subnet에서 관리형 연결을 유지한다. GitHub Actions로 CI/CD 파이프라인을 구성해 코드 푸시 시 자동 빌드·배포되며, 프론트엔드는 AWS Amplify로 별도 배포한다.

PIILOT AWS 시스템 아키텍처
AWS 3-AZ 아키텍처 - Public/Private Subnet 분리, Web/AI Server 이중화, PostgreSQL Master-Standby 복제, GitHub Actions CI/CD

AI 자동 마스킹 (Auto Masking)

PIILOT의 AI 엔진은 Vision(YOLOv12n-face, EasyOCR), NLP(KoELECTRA 기반 PIILOT NER), Audio(faster-whisper-large-v3), LLM/Search(KT 믿:음 2.0, FlashRank) 4개 축으로 구성된다. 각 모델은 독립적으로 동작하되 문서·이미지·음성·영상이라는 파일 유형에 맞게 조합되어 하나의 하이브리드 비식별화 파이프라인을 이룬다.

PIILOT AI 모델 구성도
AI Core - Vision / Machine Learning / LLM & Search / Audio & NLP 4개 축으로 구성된 AI 모델 스택

이미지·문서·오디오·비디오 파일 내의 개인정보를 AI 모델이 자동으로 감지하여 마스킹 처리한다. 얼굴·개인식별 정보가 담긴 이미지를 선택하면 변환 결과를 실시간으로 미리볼 수 있으며, 비식별화 전·후를 나란히 비교할 수 있다. 마스킹된 파일은 Redis에 30분간 캐싱하여 저장 시 AI 서버 재호출 없이 즉시 처리되며, 원본 파일은 ZIP AES 암호화 후 별도 저장된다.

마스킹 전 - 파일 선택 화면
마스킹 전 - 파일 선택 및 변환 대기 상태
마스킹 후 - 얼굴 비식별화 결과
마스킹 후 - 얼굴 자동 블러 처리 결과 비교

Approach

AI - PII 합성 데이터셋 설계 및 동적 생성

Zero-Shot PII NER 평가 결과
Zero-Shot 평가 - 사전 학습 모델의 PII 식별 F1-Score 0.0021, 사실상 식별 불가능한 수준을 확인하고 Fine-Tuning으로 전환
데이터셋 불균형 해결 - 동적 가중치 알고리즘
동적 가중치 알고리즘 - Exponential Weighting으로 8개 클래스를 약 450개씩 균일화
BIO 태깅 전처리 예시
BIO 태깅 - Sequence Labeling으로 연속된 개체 간 경계를 구분

AI - 문서/이미지 하이브리드 비식별화 파이프라인

텍스트 개인정보 마스킹 파이프라인
텍스트 마스킹 파이프라인 - 8,500건 BIO 태깅 데이터셋으로 KoELECTRA NER Fine-Tuning
이미지 개인정보 마스킹 파이프라인
이미지 마스킹 - YOLOv12n-face(mAP 0.89) + EasyOCR 좌표 기반 블러 처리
음성 개인정보 마스킹 파이프라인
음성 마스킹 - faster-whisper STT(4배 가속) + NER 타임스탬프 기반 구간 마스킹
Kalman Filter 기반 영상 객체 추적
Kalman Filter 트래킹 - IoU 매칭(신규 탐지 ≥0.45, 트래킹 유지 ≥0.25)과 최대 30프레임 트랙 유지로 가려짐 구간에서도 마스킹 연속성 확보
NER Fine-Tuning 테스트 결과
Fine-Tuning 테스트 결과 - Recall 96.3%, F2 Score 86.1% (미탐(FN)이 법적 리스크로 직결되므로 Recall 극대화 목표)

AI - DB 레코드 암호화 여부 판별 모델 (2단계 XGBoost)

XGBoost 암호화 판별 모델 고도화
일반 XGBoost 대비 도메인 특징 추가·혼동 케이스 학습 강화·2단계 분류 아키텍처 적용 - 최종 정확도 94.4%(84/89)
레코드 암호화 여부 판별 흐름
레코드 암호화 여부 판별 흐름 - 1차(계좌 ↔ 기타) → 2차(7종 PII ↔ NONE) XGBoost로 평문 개인정보(Dangerous) / 암호화됨(Safe) 판정

AI - DB 컬럼 개인정보 탐지 (RAG + LLM)

BE - 백엔드 API 구현

Role - 팀원 AI: PII 합성 데이터셋 설계 및 동적 생성, 문서/이미지 하이브리드 비식별화 파이프라인 설계, DB 레코드 암호화 여부 판별 모델(2단계 XGBoost) 구축
BE: 파일 개인정보 목록 API 구현, 개인 알림 시스템 API 구현

Tech Stack

Python KoELECTRA XGBoost YOLOv12n-face EasyOCR faster-whisper KT 믿:음 2.0 RAG / LangGraph Kalman Filter Java 21 Spring Boot 3.5 PostgreSQL Redis AWS (EC2 / ALB / Amplify) GitHub Actions Next.js QueryDSL pgvector

Results