HTP 심리검사 그림 분석을 위한 Multi-VLM 프레임워크
Multi-VLM Framework for HTP Psychological Drawing Analysis
- 주제(키워드) HTP 심리검사 , 시각언어 모델(VLM) , 다중 모델 합의 , 객체 식별 , 시각적 환각 , 제로샷 분석
- 발행기관 서강대학교 AI.SW대학원
- 지도교수 최준석
- 발행년도 2026
- 학위수여년월 2026. 8
- 학위명 석사
- 학과 및 전공 AI.SW대학원 데이터사이언스 · 인공지능
- 세부분야 해당없음
- 실제URI http://www.dcollection.net/handler/sogang/000000083491
- UCI I804:11029-000000083491
- 본문언어 한국어
- 저작권 논문은 저작권에 의해 보호받습니다.
초록(요약문)
본 연구는 학습 데이터 없이 House-Tree-Person(HTP) 그림의 객체 유무와 위치를 식별하는 Multi-VLM 프레임워크를 제안한다. HTP 자동화에는 세 가지 한계가 있다. 첫째, 객체 유무 와 위치를 사람이 직접 확인하는 과정은 반복적이고 시간이 많이 들며 평가자에 따라 결과 가 달라질 수 있다. 둘째, YOLO 계열의 기존 객체 탐지 방식은 대규모 라벨링 데이터에 의 존하므로 검사 도구나 라벨 체계가 바뀔 때마다 데이터를 다시 구축해야 한다. 셋째, 별도 학습이 필요 없는 zero-shot 단일 VLM은 객체 누락과 오인, 이미지에 없는 객체를 보고하는 환각, 빈 응답이나 형식 오류와 같은 응답 실패를 일으킬 수 있다. 본 연구는 별도 학습 없이 다중 모델 합의와 이미지 재검증을 결합해 이러한 문제를 줄이고자 하였다. 평가 데이터인 AI Hub 266은 카테고리별 정답 라벨 구성이 거의 고정되어 있다. 따라서 정 답 항목만 체크리스트로 제시하면 모델이 그림을 충분히 분석하지 않고 목록을 그대로 긍 정해도 높은 점수를 얻을 수 있다. 이를 방지하기 위해 정답 14~18개, 준정답 2~3개, 나비· 양말처럼 그림에 나타날 법하지만 해당 카테고리의 정답 라벨에는 없는 교란 항목 29~34개 를 섞은 50항목 체크리스트를 공통 프롬프트로 제공하였다. 서로 다른 세 VLM은 이 체크 리스트를 바탕으로 동일한 그림을 독립적으로 분석한다. 세 응답 중 2개 이상이 일치한 객 체는 합의 객체로 확정하고, 한 모델만 보고한 보류 객체는 검증 모델이 응답에 포함된 객 체명·경계 상자와 원본 이미지를 대조해 최종 채택 여부를 정한다. 그림당 호출은 독립 분 석 3회와 이미지 재검증 1회의 총 4회이며, 모든 환경에는 형식이 깨진 출력에서도 객체를 복원하는 동일한 파서를 적용하였다. AI Hub 266에서 추출한 64장(카테고리별 16장, 평균 정답 객체 수 16.3개/장)을 저사양 로 컬, 고사양 로컬, 상용 API의 세 환경에서 평가하였다. 최종 F1은 저사양 로컬 79.6%, 고사 양 로컬 94.6%, 상용 API 96.8%였다. 그림별 최저 F1은 단독 모델에서 각각 10.5%, 10.5%, 72.0%까지 떨어졌으나, 프레임워크 적용 후 42.6%, 64.0%, 85.7%로 높아졌다. 형식 오류 복 원 파서를 적용한 결과, JSON이 잘리거나 형식이 깨진 응답에서도 객체를 추출할 수 있었 고, 형식 오류 때문에 F1이 0%가 된 그림은 발생하지 않았다. 최고 성능 단독 모델 대비 평 균 F1 이득은 저사양·고사양 로컬에서 각각 +3.0%p, 상용 API에서 +0.1%p였다. 이는 평균 성능 향상보다 모델이 특정 그림에서 크게 실패할 때 성능 하한을 높이는 효과가 세 환경에 서 공통적으로 나타났으며, 단독 모델이 불안정한 환경일수록 평균 이득도 커짐을 보여준 다. 위치 산출에서는 여러 모델의 경계 상자를 평균하지 않고 위치 보고가 가장 정확한 단일 모 델의 경계 상자를 우선 채택하였다. 이 방식은 고사양 로컬에서 9-구역 위치 정확도를 좌 표 평균화 방식의 76.1%에서 91.9%로 높였다. 같은 프레임워크는 로컬 모델과 상용 API 모 델에 모두 적용할 수 있으며, 로컬 구성은 민감한 아동 그림을 외부로 전송하지 않는 온프 레미스 운용을 지원한다. 본 연구는 학습·라벨링 없이 객체 식별과 위치 산출 단계의 적용 가능성을 확인하였다.
more초록(요약문)
The House-Tree-Person (HTP) projective drawing test is a widely used clinical instrument, but its automation has faced three obstacles. First, manual scoring — including the initial screening of which objects are present — is time-consuming and subject to rater variability. Second, existing detection-based automation relies on thousands of labeled drawings per category, and this labeling must be rebuilt whenever the test instrument or label taxonomy changes. Third, single zero-shot vision-language models (VLMs) avoid the training burden but suffer from three risks: identification limits (missed or misrecognized objects), visual hallucination (reporting absent objects), and response failure (empty or malformed outputs). This study proposes a Multi-VLM framework that controls these risks without any training, through multi-model consensus and image re-verification. The proposed framework performs object identification with no training data. Three heterogeneous VLMs independently analyze the same drawing under a per-category 50-item checklist prompt — composed of ground-truth items, near-answer items, and distractor items (objects plausibly drawn but absent from the ground truth of that category, such as butterflies or socks) — where the distractors are mixed in to block answer leakage from the fixed canonical label set. A majority vote (2/3) then fixes the consensus objects, and for objects left pending the judge re-examines the original image, guided by the reported bounding box to decide final acceptance. Each drawing requires four calls (three Round-1 analyses plus one image re- verification), and all environments share a single robust parser that recovers identified objects from malformed output. The framework was evaluated on 64 drawings (16 per category; mean 16.3 ground-truth objects per drawing). It attained F1 scores of 79.6% in the low-resource local environment, 94.6% in the strong-local environment, and 96.8% with commercial APIs. Out-of-label reports in the strong- local and API environments were checked against the original images before scoring. The minimum per-drawing F1 of the single models fell to 10.5%, 10.5%, and 72.0% in the three environments, whereas the framework raised these minima to 42.6%, 64.0%, and 85.7%, respectively. The robust parser recovered objects from truncated or malformed JSON, and no drawing received 0% F1 because of a format failure. Gains over the strongest single model were +3.0%p, +3.0%p, and +0.1%p, showing that the framework is most useful when single-model reliability is low. Single-model-first localization achieved 91.9% 9-region accuracy in the strong- local environment, compared with 76.1% for coordinate averaging. The framework supports both API and on-premise local deployment.
more목차
제1장 서론 11
1.1 HTP 심리검사 배경 11
1.2 AI Hub 266 데이터셋 특성과 체크리스트 설계 결정 12
1.3 문제 정의 및 연구 질문 13
1.4 본 연구의 기여 15
1.5 논문 구성 16
제2장 관련 연구 17
2.1 HTP 심리검사의 임상 이론적 토대 17
2.2 HTP 자동 분석 선행 연구 19
2.2.1 CNN 시기의 분류 접근 19
2.2.2 YOLO 기반 부위 객체 탐지 19
2.2.3 PsyDraw — 멀티에이전트 시도 20
2.2.4 HTP 평가 척도 — 박희진[1]과의 연관성 20
2.3 시각언어 모델(VLM)의 발전과 환각 문제 21
2.3.1 VLM의 발전사 21
2.3.2 VLM 환각 문제와 학술 흐름 22
2.4 멀티에이전트 토의의 학술 흐름 23
2.4.1 Multi-Agent Debate [11] 23
2.4.2 MAD with Roles [20] 24
2.4.3 Blind Judge — Adhikari & Lapata (2025) 24
2.4.4 Debate vs Voting 효율성 비교 25
2.4.5 신뢰도 가중 투표·도구 활용 에이전트 25
2.5 Self-Refine 논의와 본 연구의 설계 근거 26
2.6 'Can LLM Agents Really Debate?' (2025) 비판 27
2.7 관련 연구와의 접점과 차별점 28
제3장 제안 방법 29
3.1 프레임워크 개요 29
3.2 Round 1 — 다중 VLM 독립 분석 31
3.2.1 이종 3사 모델 선정 근거 — 환각의 독립성 32
3.2.2 객체명과 경계 박스 JSON 스키마 33
3.2.3 카테고리별 50항목 체크리스트 프롬프트 — 정답·준정답·교란 구성 34
3.2.4 출력 형식 편차에 대한 파싱 처리 36
3.3 다수결 투표 — 2/3 합의 통과·1개 보류 38
3.4 이미지 재검증 — 보류 객체의 시각적 채택·기각 39
3.5 최종 객체 확정과 9-구역 위치 산출 42
3.6 채점 원칙 — 체크리스트와 정답 라벨의 일치, 유의어 매핑 제거 44
3.7 실험 환경 45
제4장 실험 및 결과 48
4.1 데이터셋과 카테고리 균형 표집 48
4.2 모델 및 설정 — 세 가지 실행 환경 49
4.3 평가 지표 50
4.4 종합 성능 — 세 환경 64장 52
4.5 그림별 최저 성능 분석 54
4.6 환각 분석 56
4.7 재검증의 역할 — 이미지 재검증 설계 근거 57
4.8 적용 조건 — 로컬 vs 상용 API 59
4.9 9-구역 위치 정확도 61
4.10 카테고리별 성능 63
4.11 대안 방법과의 구성요소 비교 실험 64
제5장 결론 66
5.1 본 연구의 기여 요약 66
5.2 Multi-VLM 프레임워크의 주요 의의 67
5.2.1 그림별 최저 성능 개선 — 판독 실패 완화 67
5.2.2 환각 통제의 일관성 67
5.2.3 로컬 4bit 양자화로 F1 90% 이상 달성 68
5.2.4 임상적 활용 측면의 의의 69
5.3 한계 및 향후 연구 69
참고문헌 72

