검색 상세

클래스 불균형 금융 데이터 생성을 위한 소수 클래스 정보 보존 디퓨전 프레임워크

A Minority-Class Information Preservation Diffusion Framework for Imbalanced Financial Data Generation

초록(요약문)

최근 국내 금융 산업에서 기업이 축적한 금융거래·고객정보 데이터를 학습한 AI를 통해 복잡한 금융 패턴을 예측하는 업무가 확대되고 있으며, 이러한 AI의 신뢰성을 확보하려면 충분한 학습 데이터 표본이 뒷받침되어야 한다. 그러나 이상 금융 이벤트는 희소하여 소수 클래스의 표본이 정상 다수 클래스에 비해 부족하다. 또한 「개인정보 보호법」, 「신용정보법」 등 관련 법·규제가 정보 활용을 제한하고, 시장 변화에 따라 새로운 이상 사례가 지속적으로 출현하는 특성이 더해져, 실제 데이터만으로는 적시에 충분한 표본을 확보하기 어렵다. 이에 대한 대안으로 합성 데이터 생성 기법이 부상하였으며, 디퓨전 기반 생성 모델인 TabDiff(ICLR 2025)는 클래스가 균형 잡힌 혼합 자료형 데이터에서 우수한 분포 재현을 달성하였다. 그러나 기존 합성 기법의 대다수는 클래스 불균형 상황을 고려하지 않은 설계로 인해 소수 표본이 부족한 금융 도메인에서 순방향 노이즈 부여 단계에서 소수 클래스 분포 신호가 다수 클래스와 동일하게 손상되어 합성 데이터의 다운스트림 분류 성능이 낮다. 본 논문에서는 TabDiff를 베이스라인으로 소수 클래스 보존을 위한 모듈을 제안한다. (1) 샘플링 단계에서 소수 클래스 노출 빈도를 증강하고, (2) 순방향 단계에서 소수 클래스 피처의 분류 기여도에 따라 노이즈를 차등 부여하며, (3) 손실 단계에서 시간 단계에 따라 소수 클래스의 손실 가중치를 차등 조절하는 세 모듈을 학습 파이프라인에 계층적으로 결합한다. 카드연체(소수 비율 3%), 소득예측(3%), 신용위험(6.93%), 계좌사기(1.10%) 데이터셋에서 5개의 고정 시드로 평균과 표준편차를 산출한 결과, 제안모델은 F1(min)에서 베이스라인 대비 카드연체 +126.5%(p〈.001), 소득예측 +23.1%(p〈.01) 향상되었다. 또한, |MIA(min)−0.5|를 전체 데이터셋 0.05 이하로 유지하여 유용성과 프라이버시 균형을 확보하였으며, 합성 데이터의 실사용 적합성을 평가하는 TSTR/TRTR 비율은 카드연체에서 87.11%를 달성하였다.

more

초록(요약문)

In Korea's financial industry, AI trained on accumulated transaction and customer-information data is increasingly used to predict complex financial patterns, but anomalous events are rare and regulations such as the Personal Information Protection Act and the Credit Information Act further restrict data use, making it difficult to secure adequate minority-class samples from real sources alone. Synthetic data generation has emerged as an alternative, and TabDiff (ICLR 2025), a diffusion-based generative model, achieves strong distributional fidelity on class-balanced mixed-type tabular data. However, most existing synthesis methods do not account for class imbalance: in financial domains where minority samples are scarce, the minority-class distributional signal is corrupted at the same rate as the majority class during the forward noise process, degrading the downstream classification performance of the synthesized data. This thesis proposes a set of modules built on the TabDiff baseline for minority-class preservation, hierarchically integrated into the training pipeline: (1) amplifying minority-class exposure during sampling, (2) applying differentiated noise intensity according to the per-feature classification contribution of the minority class during the forward process, and (3) modulating the minority-class loss weight by timestep during the loss stage. Experiments on four datasets — card-payment delinquency (minority 3%), income prediction (3%), credit risk (6.93%), and account fraud (1.10%) — were conducted over five fixed seeds. The proposed model improves minority-class F1 over the baseline by +126.5% (p〈.001) on card-payment delinquency and +23.1% (p〈.01) on income prediction, keeps |MIA(min)−0.5| below 0.05 across all four datasets, and attains a TSTR/TRTR usability ratio of 87.11% on card-payment delinquency.

more

목차

제 1 장 서론 1
1.1 연구 배경 1
1.2 문제 정의 2
1.3 연구 방법 3
1.4 논문 구성 4

제 2 장 관련 연구 5
2.1 합성 데이터 생성 모델 선행연구 5
2.2 클래스 불균형 학습 선행연구 7
2.3 금융 데이터의 특성 9
2.4 본 연구의 차별점 11

제 3 장 제안 방법 12
3.1 프레임워크 구조 12
3.2 클래스 균형 배치 샘플링(Class-Balanced Batch Sampling, CBBS) 13
3.3 클래스 조건부 노이즈 스케줄(Class-Conditional Noise Schedule, CC) 15
3.4 시간 단계별 클래스 가중치(Timestep-Stratified Class Weighting, TSCW) 17

제 4 장 실험 설계 19
4.1 데이터셋 19
4.1.1 UCI Default of Credit Card Clients (카드연체) 데이터셋 19
4.1.2 Adult Income (소득예측) 데이터셋 20
4.1.3 Give Me Some Credit (신용위험) 데이터셋 21
4.1.4 Bank Account Fraud (계좌사기) 데이터셋 22
4.1.5 데이터셋 분할 방법 23
4.2 비교모델 24
4.2.1 TabDiff 24
4.2.2 TabSyn 24
4.2.3 TabDDPM 25
4.2.4 CTGAN 25
4.3 평가지표 25
4.3.1 유용성 지표 26
4.3.2 분포 충실도 지표 28
4.3.3 프라이버시 지표 30
4.4 분류모델 33
4.5 실험 환경 33

제 5 장 결과 및 분석 35
5.1 평가 설계 및 통계 검정 35
5.2 하이퍼파라미터 영향도 분석 36
5.2.1 하이퍼파라미터 영향도 분석 – Default (카드연체) 36
5.2.2 하이퍼파라미터 영향도 분석 – Adult (소득예측) 39
5.3 Default (카드연체) 및 Adult (소득예측) 데이터셋 통제 실험 41
5.4 GMSC (신용위험) 및 BAF (계좌사기) 데이터셋 확장 연구 43
5.5 모델 비교분석 44
5.5.1 모델별 유용성 비교분석 45
5.5.2 모델별 분포 충실도 비교분석 47
5.5.3 모델별 프라이버시 비교분석 50

제 6 장 결론 및 한계 53
6.1 결론 53
6.2 한계점 및 후속 연구 55

제 7 장 부록 56
7.1 Default (카드연체) 평가 세부 결과 56
7.1.1 Default(minority 3%) – TabDiff Vanilla 베이스라인 시드별 평가 결과 56
7.1.2 Default(minority 3%) – 연구 제안모델 하이퍼파라미터 탐색 결과 58
7.1.3 Default(minority 3%) – 연구 제안모델 모듈 통제 실험 결과 61
7.1.4 Default(minority 3%) – 연구 비교모델 시드별 평가 결과 63
7.2 Adult (소득예측) 평가 세부 결과 66
7.2.1 Adult(minority 3%) – TabDiff Vanilla 베이스라인 시드별 평가 결과 66
7.2.2 Adult(minority 3%) – 연구 제안모델 하이퍼파라미터 탐색 결과 67
7.2.3 Adult(minority 3%) – 연구 제안모델 모듈 통제 실험 결과 70
7.2.4 Adult(minority 3%) – 연구 비교모델 시드별 평가 결과 72
7.3 GMSC (신용위험) 평가 세부 결과 75
7.3.1 GMSC – TabDiff Vanilla 베이스라인 시드별 평가 결과 75
7.3.2 GMSC – 연구 제안모델 하이퍼파라미터 탐색 결과 76
7.3.3 GMSC – 연구 제안모델 시드별 평가 결과 77
7.3.4 GMSC – 연구 비교모델 시드별 평가 결과 78
7.4 BAF (계좌사기) 평가 세부 결과 80
7.4.1 BAF – TabDiff Vanilla 베이스라인 시드별 평가 결과 80
7.4.2 BAF – 연구 제안모델 하이퍼파라미터 탐색 결과 81
7.4.3 BAF – 연구 제안모델 시드별 평가 결과 82
7.4.4 BAF – 연구 비교모델 시드별 평가 결과 83

참고문헌 86

more