← Back to projects
2024.07.01 - 2024.08.06 · DACON · SW중심대학 디지털 경진대회 · 전국 7위 (후원기업상)

생성 AI의 가짜 음성 검출 및 탐지

생성 AI 기술로 합성된 가짜(Fake) 음성을 실제(Real) 음성과 구별하는 분류 모델 개발. Noise Overlay, Pseudo Labeling 등 다양한 기법으로 제한된 데이터 환경에서 성능을 극대화하였다.

Overview

최근 생성 AI 기술의 발전으로 가짜 음성 합성이 점점 정교해지고 있다. 가짜 음성을 통해 유명인의 음성을 모방하거나 중요 인사의 발언을 조작할 수 있어 개인 및 기업의 명예 실추, 금전적 피해, 사회적 혼란 등 다양한 문제를 야기할 수 있다.

본 프로젝트는 DACON에서 주최한 SW중심대학 디지털 경진대회(2024)의 「SW와 생성 AI의 만남 - 생성 AI의 가짜(Fake) 음성 검출 및 탐지」 대회 참가 프로젝트로, 제한된 데이터 환경에서 Noise Overlay, Pseudo Labeling 등 다양한 기법을 적용하여 전국 7위(후원기업상)를 달성하였다.

데이터 분석 (Data Analysis)

샘플 당 음성 개수 차이
샘플 당 음성 개수 차이 - Train은 1개, Test·Unlabeled는 최대 2개
방음 환경 여부 스펙트로그램 비교
방음 환경 여부 - Train은 방음 환경만 존재, Test·Unlabeled는 방음·비방음 혼재
Train data의 Fake/Real 음성 길이 분포
Train data의 Fake(빨강)·Real(파랑) 음성 길이 분포 - 0~39초로 다양하며 Fake는 1~2초에, Real은 3~4초에 편중

Approach

데이터 분석 및 전처리

Mel-Spectrogram, MFCC, CQT 비교
Audio Transformation 비교 - Mel-Spectrogram / MFCC / CQT 중, 저주파 대역 해상도와 시간·주파수 해상도를 모두 확보하는 CQT를 최종 채택
CQT로 변환한 Fake 음성과 Real 음성 비교
CQT로 변환한 Fake(좌)·Real(우) 음성 - Formant가 분포하는 저주파 대역에서 Fake/Real 간 패턴 차이가 뚜렷하게 드러남
Unlabeled noise extractor - noise 제거 전후
Noise Extractor - Unlabeled data에서 음성 구간을 제거해 순수 배경 소음만 추출
훈련 데이터셋 구성 다이어그램
훈련 데이터셋 구성 - Fake/Real 조합 overlay + 추출한 noise overlay (약 248,400개)

AI 모델링

AST(Audio Spectrogram Transformer) 모델 구조
AST 모델 구조 - CQT 스펙트로그램을 패치 단위로 분할해 Transformer Encoder에 입력 (Gong, Chung & Glass, 2021)
Teacher-Student 기반 학습 파이프라인
학습 파이프라인 - Train Data로 학습한 Teacher AST가 Unlabeled Data에 Pseudo label을 부여하고, 이를 원본 Train Data에 합쳐 Student AST를 재학습
추론 파이프라인
추론 파이프라인 - Trained AST의 예측과 Silero·Wav2vec·Wav2vec2 기반 VAD의 비음성(Non-speech) 판별을 OR 연산으로 결합해 최종 출력 산출
Voice Active Detector 구성 모델 - Silero, Wav2vec, Wav2vec2
Voice Active Detector - Silero(VAD)·Wav2vec(STT)·Wav2vec2(STT)로 음성/비음성 구간을 판별해 AST 예측의 오탐을 보정
pad2D 데이터 증강 예시
pad2D - 5초 미만/초과 음성 길이를 5초로 통일
CutMix, MixUp 데이터 증강 예시
CutMix(좌) / MixUp(우) - CQT로 변환된 음성 2개를 결합
Pseudo Labeling 기반 Semi-supervised Learning 개념도
Pseudo Labeling - Labeled Data로 학습한 모델이 Unlabeled Data에 라벨을 부여해 학습 데이터에 합류
Augmentation 기법별 Accuracy 개선
AugmentationAccuracy개선폭
Base93.04%-
Train data + Noise Overlay94.48%+1.44
2 Voice Overlay94.53%+1.49
CutMix94.29%+1.25
Pseudo Label95.23%+2.19
pad2D95.42%+2.38
MixUp96.52%+3.48
Role (팀원) 데이터 분석 및 전처리: Train data 구조적 문제점 분석, Audio Transformation 비교, Noise Extractor 설계 및 Noise Overlay, 조합 오디오 증강  |  AI: pad2D 함수 설계, CutMix/Mixup 실험, Pseudo Labeling 적용

Tech Stack

Ubuntu Python PyTorch Docker AST Wav2vec2 Silero VAD STFT / MFCC / CQT Pseudo Labeling Noise Overlay CutMix / Mixup Semi-supervised Learning

Team

국립한밭대학교 정보통신공학과 연구실 AiRLab (총 5명)

Results & Insights

DACON 최종 리더보드 - AiRLab 전국 7위
DACON 최종 리더보드(AWARDS) - Team AiRLab 전국 7위 (Private Score 0.19001)
2024 SW중심대학 디지털 경진대회 AI부문 최종 산출물 포스터
2024 SW중심대학 디지털 경진대회 AI부문 최종 산출물 포스터 (Team AiRLab)