답변불가능한 질문의 필터링을 통한 자연어 의료임상 데이터 검색의 신뢰성 확보 방안
Ensuring the Reliability of Natural Language Clinical Data Retrieval by Filtering Unanswerable Questions
- 주제(키워드) 대규모 언어 모델 , 임상 NL2SQL , 전자의무기록 , EHRSQL , TrustSQL , 거절 , 신뢰성 파이프라인 , large language models , clinical NL2SQL , electronic health records , EHRSQL , TrustSQL , abstention , reliability pipeline
- 발행기관 서강대학교 AI.SW대학원
- 지도교수 장두성
- 발행년도 2026
- 학위수여년월 2026. 8
- 학위명 석사
- 학과 및 전공 AI.SW대학원 데이터사이언스 · 인공지능
- 세부분야 해당없음
- 실제URI http://www.dcollection.net/handler/sogang/000000083295
- UCI I804:11029-000000083295
- 본문언어 한국어
- 저작권 논문은 저작권에 의해 보호받습니다.
초록(요약문)
본 논문은 자연어 임상 데이터 검색 질의에 대해 답변 가능한 질문에는 SQL 기반 답을 제공하고, 답변 불가능하거나 오답 위험이 큰 질문에는 명시적으로 거절을 반환하는 신뢰성 중심 임상 NL2SQL 파이프라인 CARP 를 제안한다. 임상 데이터 검색에서 잘못된 SQL 결과는 코호트 구축, 의사결정 지원, 환자 안전 모니터링 등 후속 판단으로 전파될 수 있으므로, 시스템은 높은 실행 정확도뿐 아니라 불확실한 경우 답하지 않는 능력을 함께 가져야 한다. PLUQ 계열의 엔트로피 기반 거절 전략을 최신 모델 세대에서 재현한 결과, 검증 분할 오답의 38.9%가 토큰 엔트로피 0.001 미만에 분포하였다. 이는 단일 모델 내부 확신도 신호만으로는 고확신 오답을 충분히 격리하기 어렵다는 점을 보여준다. 이를 보완하기 위해 CARP 는 답변 가능성 분류, 다중 모델 SQL 생성, 실행 결과 기반 합의 라우팅, 지식 검증, 출력 신뢰도 필터, 진단-수정, 생성 모델 다양성 기반 거절 신호(GDAS)의 일곱 단계를 결합한다. 각 단계는 정답 후보 회수, 외부 검증, 잔존 위험 차단의 역할을 나누어 수행하며, 거절 사유를 추적 가능한 형태로 기록한다. EHRSQL 2024 평가 분할 1,167 건에서 CARP 는 RS(0) 91.35, RS(5) 87.92, RS(10) 84.49, RS(N=1167) −708.65 를 달성하여 기존 SOTA 인 PLUQ 를 모든 Reliability Score 조건에서 상회하였다. 특히 오답 수는 PLUQ 와 동일한 8 건으로 유지하면서 정답 수를 1,029 건에서 1,066 건으로 늘리고 거절 수를 130 건에서 93 건으로 줄였다. 또한 TrustSQL-EHRSQL 의 신규 답변 불가능 질의 934 건에 대해 98.7%의 거절 재현율을 보여, 동일 임상 스키마 계열 내에서 새롭게 구성된 답변 불가능 질의에도 높은 거절 견고성을 보였다. 본 논문의 기여는 세 가지이다. 첫째, 임상 NL2SQL 에서 단일 모델 엔트로피 기반 거절의 한계를 정량적으로 보였다. 둘째, 다중 모델 합의와 외부 검증 신호를 결합한 7 단계 신뢰성 파이프라인을 제안하였다. 셋째, EHRSQL 2024 와 TrustSQL- EHRSQL 검증을 통해 오답 위험을 통제하면서 답변 가능한 질의를 추가 회수할 수 있음을 보였다.
more초록(요약문)
This thesis proposes CARP, a reliability-oriented clinical NL2SQL pipeline that generates SQL answers for answerable clinical questions while explicitly abstaining from unanswerable or high-risk questions. In clinical data retrieval, an incorrect SQL result can propagate to cohort construction, decision support, and patient-safety monitoring; therefore, reliability requires not only high execution accuracy but also the ability to withhold answers under uncertainty. A reproduction of a PLUQ-style entropy-based abstention strategy showed that 38.9% of validation wrong answers fell below token entropy 0.001, indicating that single-model internal confidence signals are insufficient for isolating confidently wrong outputs. To address this limitation, CARP combines seven stages: answerability classification, multi-model SQL generation, execution-result consensus routing, knowledge validation, output confidence filtering, diagnose-and-repair, and Generator-Diversity-as- Abstention-Signal (GDAS). These stages are organized as complementary components for candidate recovery, external validation, and residual-risk filtering, and each abstention is recorded with an interpretable reason. Experiments on the EHRSQL 2024 test split of 1,167 questions show that CARP achieves RS(0) 91.35, RS(5) 87.92, RS(10) 84.49, and RS(N=1167) −708.65, outperforming PLUQ across all Reliability Score conditions. CARP preserves the same number of wrong answers as PLUQ while increasing correct answers from 1,029 to 1,066 and reducing abstentions from 130 to 93. Additional evaluation on 934 infeasible questions from TrustSQL-EHRSQL shows a 98.7% abstention recall, suggesting that the proposed pipeline remains robust on newly constructed unanswerable questions within the same clinical schema family. The contributions of this thesis are threefold: it quantifies the limitation of entropy-based abstention in clinical NL2SQL, proposes a seven-stage reliability pipeline combining consensus and external validation signals, and demonstrates improved reliability with traceable abstention reasons.
more목차
제 1 장 서 론 11
1.1 연구 배경 11
1.2 문제 정의 14
1.3 제안 파이프라인: CARP 15
1.4 주요 기여 16
1.5 논문의 구성 18
제 2 장 관 련 연 구 19
2.1 NL2SQL 기술 개관 19
2.2 임상 도메인 NL2SQL 과 임상 데이터셋 21
2.3 EHRSQL 2024 주요 방법론 23
2.4 LLM 자체 신뢰도 신호의 한계와 CONFIDENTLY WRONG 26
2.5 다중 모델 합의와 생성 모델 다양성 신호 29
2.6 답변 불가능 질문 필터링과 거절 메커니즘 32
2.6.1 선택적 분류와 선택적 질의 응답 32
2.6.2 단일 출력 기반 거절 신호와 한계 34
2.6.3 외부 지식 결합과 LLM 기반 출력 진단 35
2.7 본 연구의 위치 및 차별점 37
제 3 장 방 법 론 . 40
3.1 시스템 개관 40
3.2 데이터셋과 평가 지표 44
3.3 공통 입력 자원과 답변 가능성 분류 46
3.3.1 의료 용어-테이블 매핑 사전 46
3.3.2 BM25 기반 few-shot 예시 검색 47
3.3.3 답변 가능성 분류 48
3.4 다중 모델 합의 라우팅 49
3.5 지식 검증 55
3.5.1 지식 결손 판별 55
3.5.2 스키마 어휘 검사 56
3.6 다중 신호 기반 출력 신뢰도 필터 57
3.6.1 토큰 엔트로피 필터 58
3.6.2 출력 검증기 59
3.7 진단-수정 60
3.8 생성 모델 다양성 기반 거절 신호(GENERATOR-DIVERSITY-AS-ABSTENTION-SIGNAL;
GDAS) 64
3.9 거절 사유 분류 66
제 4 장 실 험 결 과 . 70
4.1 실험 설정 70
4.2 기준 모델 분석: 단일 모델 신호와 단순 합의의 한계 71
4.3 검증 분할에서의 단계별 측정 73
4.4 평가 분할 결과와 EHRSQL 2024 SOTA 비교 76
4.5 CARP 설계 비교 실험 81
4.5.1 생성 모델 풀의 효과 분석 82
4.5.2. 위험 신호 결합 방식 비교 84
4.6 TRUSTSQL-EHRSQL 기반 외부 거절 견고성 검증 87
제 5 장 고 찰 92
5.1 단일 내부 확신도 기반 거절의 실패 원인 92
5.2 거절 FINE-TUNING 과 분포 외 일반화의 TRADE-OFF 94
5.3 의료 도메인 배치 관점에서의 CARP 설계 의미 97
5.4 시스템의 한계와 향후 작업 99
제 6 장 결 론 . 103
참 고 문 헌 . 106
부 록 111
부록 A. 답변 불가능 질의의 15 CANONICAL 카테고리와 증강 가중치 111
부록 B. 단일 모델 후처리 신호의 REDUNDANCY 분석 113
부록 C. 합의 라우팅 규칙별 정확도와 거절율 비대칭 115
부록 D. GDAS RULE 변종과 CATEGORIZE 재현성 세부 116

