O-CoV: 멀티 LLM 에이전트 환경에서의 온톨로지 기반 상호 검증 및 자가 교정 프레임워크
O-CoV: An Ontology-based Cross-Validation and Self- Correction Framework for Multi-LLM Agent Environments
- 주제(키워드) 대규모 언어 모델 , 멀티 에이전트 시스템 , 온톨로지 , 상호 검증 , 자가 교정 , SPARQL , 환각 , Large Language Models , Multi-Agent Systems , Ontology , Cross-Validation , Self- Correction , SPARQL , Hallucination
- 발행기관 서강대학교 AI.SW대학원
- 지도교수 박수용
- 발행년도 2026
- 학위수여년월 2026. 8
- 학위명 석사
- 학과 및 전공 AI.SW대학원 데이터사이언스 · 인공지능
- 세부분야 해당없음
- 실제URI http://www.dcollection.net/handler/sogang/000000083106
- UCI I804:11029-000000083106
- 본문언어 한국어
- 저작권 논문은 저작권에 의해 보호받습니다.
초록(요약문)
대규모 언어 모델(LLM) 기반 멀티 에이전트 시스템의 확산과 함께, 복수 에이전트가 공유 온톨로지에 부합하는 일관된 응답을 생성하도록 보장하는 것이 시스템 신뢰성 확보의 핵심 과제로 부상하였다. 기존의 단일 에이전트 방식은 개별 모델의 편향에 취약하며, 토큰 유사도 기반 다수결 앙상블은 온톨로지 구조에 대한 명시적 검증을 결여한다. 본 연구는 이를 해결하기 위해 온톨로지 기반 상호 검증 및 자가 교정 프레임워크인 O-CoV 를 제안한다. O-CoV 는 복수 에이전트가 독립적으로 생성한 후보 응답을 온톨로지 스키마와 대조하여 최적 후보를 선택하는 상호 검증(CV) 단계와, 선택된 후보의 일관성이 임계값 미만일 때 위반 항목을 명시적으로 식별하여 LLM 에 피드백 기반 교정을 요청하는 자가 교정(SC) 단계로 구성된다. CWD 벤치마크(ACME Insurance, 44 개 질문)를 Qwen2.5-7B-Instruct(4-bit, Ollama)로 평가한 결과, O-CoV 는 온톨로지 일관성 0.989 를 달성하여 단일 에이전트(0.914; Cohen's d = 0.562, p = 4.3×10⁻⁴) 및 medoid 앙상블(0.915; d = 0.531, p = 6.5×10⁻⁴) 대비 통계적으로 유의한 개선을 보였으며, 3 조건 Friedman 검정(χ² = 20.31, p = 3.9×10⁻⁵)과 Holm-Bonferroni 보정 후에도 유의성이 유지되었다. 본 연구는 제안 기법의 타당성을 세 가지 측면에서 심화 검증한다. 첫째, 환각 판정 기준의 민감도를 분석하기 위해 이진 일관성 지표를 부분일치, 연속 점수로 일반화하고, 기준을 완화하면 기준선과의 격차가 +0.075 에서 +0.024 로 줄지만 모든 임계값에서 O-CoV 가 최상위를 유지함을 보여 개선이 엄격한 이진 기준의 산물이 아님을 입증하였다. 둘째, 후보 다양성의 원천을 검토하기 위해 4 개 family(Qwen2.5-7B, Llama-3.1-8B, Mistral-7B, Gemma-2-9B)의 크로스모델 실험을 수행하여, 이질 풀+O-CoV(0.995)가 최우수 단일 모델(Gemma-2-9B, 0.967)과 동질 풀(0.981)을 모두 능가하며 질문별 승자 분포에서 단일 모델이 지배하지 않음을 확인하였다. 셋째, 온톨로지 품질과 검증 효과의 관계를 규명하기 위해 온톨로지 커버리지 ablation 을 수행하여, 100% 완전한 온톨로지를 제공해도 단일 에이전트의 환각(0.913)이 사라지지 않으며 온톨로지가 불완전할수록 검증 계층의 가치가 커짐(25% 커버리지에서 이득 +0.172)을 보여 온톨로지 작성과 런타임 검증이 직교하는 별개의 축임을 실증하였다. 자가 교정은 τ = 0.8 분포에서 0/44 회 발동하였으나 τ = 0.95 에서는 4/44 발동되어 평균 +0.136 의 개선을 산출하여, 어려운 케이스에 대한 조건부 안전망으로 기능함을 확인하였다.
more초록(요약문)
With the proliferation of multi-agent systems based on Large Language Models (LLMs), ensuring that multiple agents generate responses consistent with a shared ontology has emerged as a key challenge for system reliability. Conventional single-agent approaches are vulnerable to individual model biases, while token-similarity medoid ensembles lack explicit verification against the ontology structure. This study proposes O-CoV (Ontology-based Cross-Validation and Self-Correction), an ontology-grounded cross-validation and self- correction framework. O-CoV consists of a cross-validation (CV) stage in which candidate responses independently generated by multiple agents are systematically matched against the ontology schema to select the optimal candidate, and a self-correction (SC) stage that, when the consistency of the selected candidate falls below a threshold, explicitly identifies violation terms and requests the LLM to revise the query. Experiments on the CWD benchmark (ACME Insurance domain, 44 questions) with Qwen2.5-7B-Instruct (4-bit, Ollama) show that O-CoV achieves an ontology consistency of 0.989, a statistically significant improvement over both the single-agent (0.914; Cohen's d = 0.562, p = 4.3×10⁻⁴) and medoid-ensemble (0.915; d = 0.531, p = 6.5×10⁻⁴) baselines, confirmed by a three-condition Friedman test (χ² = 20.31, p = 3.9× 10⁻⁵) and Holm–Bonferroni correction. To address the concern that the consistency criterion may be overly strict (binary term membership), we introduce a relaxed-criterion sensitivity analysis (fuzzy / continuous scoring): although relaxation narrows the baseline gap (from +0.075 to +0.024), O-CoV remains the top condition at every threshold, demonstrating that the improvement is not an artifact of a harsh yes/no rule. To address the diversity premise, we conduct a real cross-model ensemble (Qwen2.5-7B, Llama-3.1-8B, Mistral-7B, Gemma-2-9B): the heterogeneous pool with O-CoV (0.995) outperforms both the best single model (Gemma- 2-9B, 0.967) and the homogeneous pool (0.981), and no single model dominates the per- question winner distribution, directly answering why not just use the best model. Finally, an ontology-coverage ablation shows that even a 100%-complete ontology in the prompt does not eliminate hallucination (single-agent 0.913), and that O-CoV's leverage grows as the ontology degrades (gain rising from +0.07 to +0.17 at 25% coverage), establishing that ontology authoring and runtime verification are orthogonal axes. The self-correction stage was not triggered under τ = 0.8 on this distribution (0/44) but fired 4/44 under τ = 0.95 (mean Δ +0.136), functioning as a conditional safety net for harder cases.
more목차
제 1 장 서론 10
제 1 절 연구 배경 및 동기 10
제 2 절 연구의 핵심 문제 11
제 3 절 기존 기술의 한계 13
제 4 절 제안 방법 및 기여 14
제 5 절 논문의 구성 15
제 2 장 관련 연구 16
제 1 절 온톨로지 기반 LLM 시스템 16
제 2 절 LLM 자가 교정 17
제 3 절 지식 그래프 기반 제약 추론 18
제 4 절 온톨로지 평가 및 검증 18
제 5 절 멀티 에이전트 다양성과 앙상블 19
제 6 절 온톨로지 품질 대 런타임 검증 논쟁 19
제 7 절 본 연구의 위치와 종합 비교 20
제 3 장 시스템 모델 및 제안 기법 22
제 1 절 문제 정의 및 형식 모델 22
제 2 절 설계 원리 및 근거 27
제 3 절 O-CoV 시스템 아키텍처 30
제 4 절 일관성 판정 기준의 일반화: 엄격완화 스펙트럼 35
제 5 절 크로스모델 일반화 37
제 6 절 온톨로지 품질과 검증의 직교성 39
제 7 절 계산 복잡도 및 비용 분석 41
제 4 장 구현 및 실험 42
제 1 절 구현 환경 42
제 2 절 데이터셋 42
제 3 절 실험 설계 43
제 4 절 평가 지표 44
제 5 장 실험 결과 및 분석 45
제 1 절 주요 성능 비교 (E1) 45
제 2 절 통계적 유의성 검정 (E2) 48
제 3 절 환각 판정 기준 민감도: 엄격 대 완화 (E3) 50
제 4 절 크로스모델 앙상블: 모델별 성능과 이질 풀 효과 (E4) 53
제 5 절 온톨로지 특성이 효과에 미치는 영향: 커버리지 ablation (E5) 56
제 6 절 결과 종합 해석 58
제 6 장 결론 및 향후 연구 60
제 1 절 연구 결과 요약 및 기술적 의의 60
제 2 절 한계 및 향후 연구 방향 61
참고문헌 63

