검색 상세

시각-언어 모델의 속성 환각 완화를 위한 분리 표현 및 검색 기반 교정에 대한 단계별 분석

Stage-wise Analysis of Disentangled Representation and Retrieval-Based Correction for Mitigating Attribute Hallucination in Vision-Language Models

초록(요약문)

시각-언어 모델(Vision-Language Model, VLM)은 시각적 질의응답(Visual Question Answering, VQA) 등에서 높은 성능을 보이지만, 객체의 색상·형태·재질 등 세부 속성을 실제 이미지와 다르게 생성하는 속성 환각(attribute hallucination) 문제를 여전히 보인다. 본 논문은 속성 라벨이 완전한 CLEVR/CoGenT 합성 장면에서, 가우시안 마스크 풀링 기반 객체 임베딩, 색상·형태·재질 분류와 3D 좌표 회귀로 학습한 속성 분리 인코더, FAISS Top-1 검색, 1차 오답에 대한 RAG 재질의로 이어지는 파이프라인을 단계별로 평가한다. 비교는 LLaVA-1.5 + Vicuna-7B로 통제하되, 기준 모델(Base)은 사전학습된 projector를 그대로 사용하고, 분리 인코더 모델(Ours)은 비전 타워만 교체한 뒤 projector를 새로 학습하고 언어 모델을 LoRA로 미세조정한다. 속성 분리 인코더는 ValA 검색 Exact Match를 31.07%에서 99.43%로 끌어올렸으나, ValB(OOD)에서는 형태 정확도가 45.63%까지 떨어져 과적합되었고, 같은 임베딩을 VQA에 연결하면 QA Accuracy가 13~14%p 하락하였다. RAG는 검색이 99% 정확해도 오답의 10~13%(LoRA 변형 15%)만 교정하였으며, 개수·공간 질문은 거의 고쳐지지 않았다. projector와 언어 모델을 함께 학습시켰음에도 검색의 이득이 생성으로 전달되지 않은 것은, 분리 표현이 검색에는 유리하지만 생성에는 불리한 비대칭적 효과와 RAG 병목을 보여주며, 검색과 생성의 표현 요구를 분리하는 이중 인코더나 증거 반영을 강화하는 정렬 학습이 후속 과제로 필요함을 시사한다.

more

목차

표 차례 iv
그림 차례 v
국문 초록 vi

제 1 장 서론 1
1.1 연구 배경 및 동기 1
1.2 연구 기여 3

제 2 장 관련 연구 4
2.1 시각-언어 모델의 속성 환각 4
2.1.1 VLM의 구조와 시각-언어 정렬 4
2.1.2 속성 결합 문제와 환각의 구조적 원인 5
2.1.3 환각 평가와 진단 데이터셋 5
2.1.4 기존 완화 접근 6
2.2 분리 표현 학습 7
2.2.1 생성 모델 기반 분리 학습 7
2.2.2 분리 표현의 평가 지표 8
2.2.3 시각-언어 맥락에서의 속성 분리 8
2.3 검색 증강 생성 10
2.3.1 RAG의 발전 10
2.3.2 멀티모달 RAG와 환각 교정 10
2.3.3 벡터 검색과 효율적 모델 적응 11

제 3 장 분석 방법 12
3.1 전체 구조 12
3.2 객체 중심 임베딩 추출 13
3.2.1 가우시안 마스크 기반 풀링 13
3.2.2 적응적 σ 설정 14
3.3 속성 분리 인코더 학습 15
3.3.1 보조 감독을 통한 속성 정렬 15
3.3.2 학습 목적 함수 15
3.4 객체 임베딩 기반 검색 16
3.4.1 벡터 데이터베이스 구축 16
3.4.2 검색 품질 평가 17
3.5 VQA 생성 모델 통합 17
3.6 RAG 기반 사후 교정 19
3.6.1 교정 절차 19
3.6.2 프롬프트 설계 19
3.6.3 교정 대상 선별 20
3.6.4 증거 신뢰도와 한계 21

제 4 장 실험 및 결과 23
4.1 실험 설정 23
4.1.1 데이터셋 23
4.1.2 모델 구성 및 학습 25
4.1.3 평가 지표 25
4.2 인코더 학습 및 검색 평가 26
4.2.1 속성 예측 정확도 26
4.2.2 검색 정합률 27
4.2.3 검색 혼동 패턴 27
4.3 VQA 성능 분석 30
4.3.1 전체 정확도 비교 30
4.3.2 질문 유형별 분석 30
4.3.3 VQA 응답 사례 분석 32
4.4 RAG 교정 성능 분석 34
4.4.1 교정 성능 34
4.4.2 교정 조건 분석 35
4.4.3 RAG 교정 사례 분석 36

제 5 장 결론 38
5.1 연구 요약 38
5.2 논의 39
5.2.1 표현 공간의 불일치 문제 39
5.2.2 RAG 교정의 병목 39
5.2.3 미관측 조합에 대한 취약성과 복잡도 영향 40
5.3 한계 및 향후 연구 40

영문 초록 48

more