변인 기반 LLM 멀티에이전트를 이용한 수능 영어 빈칸 추론 문항 난이도 제어 연구
Difficulty Control of CSAT English Blank-Inference Items Using a Variable-Based LLM Multi-Agent Framework
- 주제(키워드) 멀티에이전트 협업 , 변인기반 제어 , 결정론적 구조 , LLM 하네스 엔지니어링 , 난이도 제어 , 수능 영어 빈칸 추론 문항 , 자동 문항 생성 , Multi-Agent Collaboration , Variable-Based Control , Deterministic Structure , LLM Harness Engineering , Difficulty Control , CSAT English Blank-Inference Items , Automated Item Generation
- 발행기관 서강대학교 가상융합전문대학원
- 지도교수 김태훈
- 발행년도 2026
- 학위수여년월 2026. 8
- 학위명 석사
- 학과 및 전공 가상융합전문대학원 메타버스테크놀로지
- 실제URI http://www.dcollection.net/handler/sogang/000000083178
- UCI I804:11029-000000083178
- 본문언어 한국어
- 저작권 논문은 저작권에 의해 보호받습니다.
초록(요약문)
생성형 AI의 발전으로 자동 문항 생성 및 활용이 확산되고 있으나, 문항 난이도를 의도한 수준으로 제어하는 일은 여전히 미해결 난제로 남아 있다. 본 연구가 제안하는MADIC(Multi-Agent Difficulty-Controlled Item Creator)은변인 제어와 결정론적 구조 기반의 LLM 멀티에이전트로 수능 영어 빈칸 추론 문항의 난이도를 정량 통제하는 시스템이다.이를 위해 본 연구는 난이도 변인 분석,시스템 설계,변인 수렴도와 전문가 난이도 분류 평가의 이원 검증을 주요 단계로 구성하였다. 먼저 201문항 앵커 데이터베이스를 바탕으로 16 후보 변인의 회귀 분석을 통해 난이도 제어를 위한 4개의 수렴 변인을 선정하였다. 다음으로 LLM 하네스 엔지니어링의 요소를 적용한 8+1 에이전트 / 15노드의 MADIC 시스템을 설계하였다. 마지막으로 이원 검증 체계로 본 실험을 수행하고, 모델 무관 효과는 별도로 검증하였다. 실험 결과, 기존 방식 대비 수렴도 평가에서 변인 표준화 점수 절댓값 합은 53.7% 감소 하였고, 난이도 분류 평가에서 평가자 10명의 의도 난이도 일치율은 56.0%(기존 27.3∼29.3%)로 +27∼29%p 높아, 변인 통제와 의도 난이도 제어 효과가 각각 강하게 지지되었다. 이와 함께 조건과 모델 간 상호 작용이 유의하지 않아 효과가 모델과 무관하게 일관됨을 확인하였다. 본 연구는 변인 기반 제어와 하네스 엔지니어링의 결정론적 구조를 적용한 LLM 멀티에이전트문항 생성 시스템을 통해,자동 문항 생성 난이도 제어의 새로운 방법론을 제시하였다. 이를 통해 MADIC은 평가 전문가의 출제 보조 도구로 활용 가능성을 확인하였으며, 향후 빈칸 추론을 넘어 다른 문항 유형과 교과로 확장 가능한 프레임워크로 발전할 수 있을것으로 기대한다.
more초록(요약문)
As generative AI advances, automated item generation and its use are spreading, yet controlling item difficulty to an intended level remains unsolved. The proposed MADIC (Multi-Agent Difficulty-Controlled Item Creator) quantitatively controls the difficulty of CSAT English blank-inference items via an LLM multi-agent system grounded in variable control and a deterministic structure. To this end, from an an-chor database of 201 items, regression of 16 candidate variables first identified four convergence variables for difficulty control. Next, the MADIC system of 8+1 agents / 15 nodes was designed using LLM harness engineering components. Finally, the main experiment applied two-layer verification of variable convergence and expert difficulty classification, with the model-agnostic effect verified separately. As a result, against the baseline, MADIC’s absolute standardized-score sum fell 53.7% in the convergence evaluation, while the 10-rater intended-difficulty agreement reached 56.0% (baseline 27.3–29.3%), strongly supporting both variable and intended-difficulty control. In addition, the condition–model interaction was not significant, confirming the effect held regardless of the model. Through this multi-agent approach, the study presented a new methodology for automated difficulty control, confirming MADIC’s potential as an expert item-development aid and a framework extensible beyond blank inference to other item types and subjects.
more목차
제 1장 서론 1
1.1 연구 배경 1
1.2 연구 필요성 2
1.3 연구 목적 3
1.4 연구 범위 및 제한점 5
1.5 논문의 구성 7
제 2장 관련 연구 8
2.1 난이도이론및측정 8
2.1.1 후행적 난이도 지표: CTT와 IRT의 정의 8
2.1.2 문항 난이도 결정 변인 9
2.1.3 선행적 난이도 예측 방법론: 텍스트 기반 자동화 접근 10
2.2 LLM 하네스 엔지니어링의 영역과 한계 12
2.2.1 하네스의 개념과 학술적 기원 12
2.2.2 대규모 언어 모델의 개념과 한계 12
2.2.3 프롬프트 엔지니어링 13
2.2.4 자기 검증과 반복 개선 루프 15
2.2.5 멀티에이전트 시스템 16
2.2.6 LangGraph 17
2.2.7 LLM 하네스 엔지니어링의 구현 요소와 본 연구의 위치 18
2.3 수능 영어 시험 및 문항 특성 20
2.3.1 수능 영어 시험 개요 및 출제 원칙 20
2.3.2 수능 영어 빈칸 추론 문항의 특성 20
2.4 자동 문항 생성 및 난이도 제어 연구 22
2.4.1 자동 문항 생성(AIG) 22
2.4.2 난이도 제어 연구 23
2.4.3 멀티에이전트 기반 접근법 23
제 3장 연구 방법 25
3.1 전체 연구 프로세스 개요 25
3.2 데이터 수집 및 실험 환경 26
3.2.1 앵커 데이터베이스 26
3.2.2 실험 환경 및 측정 통계 도구 28
3.2.3 모델 선정 근거 29
3.3 난이도 구성 변인 실증 분석 30
3.3.1 측정 변인 후보의 정의 30
3.3.2 회귀 분석 결과 33
3.3.3 분석 결과의 한계 35
3.4 MADIC 시스템 설계 36
3.4.1 LLM 하네스 엔지니어링 관점에서의 MADIC 36
3.4.2 시스템 아키텍처 39
3.4.3 에이전트 상세 설계 41
3.5 평가 실험 설계 47
3.5.1 실험 설계 개요 47
3.5.2 실험 자료 48
3.5.3 평가자 모집과 평가 절차 48
3.5.4 분석계획 49
제 4장 실험 결과 50
4.1 실험 결과 개요 50
4.2 변인 수렴도 비교 51
4.2.1 분석 단위와 핵심 지표 51
4.2.2 조건별 평균 비교 51
4.2.3 수렴 성공률과 검증 통과율 52
4.3 전문가 난이도 평가 비교 53
4.3.1 조건별 난이도 일치율 비교 54
4.3.2 결과 해석 55
4.3.3 정성 설문 문항 분석 56
4.4 모델 무관 효과 분석 57
4.4.1 실험 설계와 가설 57
4.4.2 실험 결과 57
4.4.3 실험 해석 59
제 5장 결론 61
5.1 연구 결론 61
5.2 연구의 한계 61
5.3 향후 연구 방향 63
참고문헌 64
부록 A 앵커 데이터베이스 71
A.1 앵커 데이터베이스 개요 71
A.2 입력 스키마 72
A.3 난이도 분석 73
부록 B 난이도 변인 검증 74
부록 C 사전 정보 데이터베이스 78
C.1 사전 정보 데이터베이스 개요 78
C.2 변인 정책 78
C.3 등분위별 변인 프로파일 80
부록 D 시스템 아키텍처 81
D.1 시스템 세부 명세 81
D.2 에이전트별 세부 명세 84
D.2.1 사전 분류기 84
D.2.2 지문 추출기 84
D.2.3 지문 생성기 84
D.2.4 검증기 85
D.2.5 정제기 85
D.2.6 빈칸 선정기 86
D.2.7 정답 생성기 86
D.2.8 오답 생성기 86
D.2.9 최종 검수기 87
부록 E 시스템 구현 88
E.1 개요 88
E.2 입력 화면 88
E.3 파이프라인 진행과 변인 수렴 시각화 90
E.4 결과 화면 91
부록 F 평가 양식 92
부록 G 정성 설문 응답 분석 93
G.1 코딩 분석 결과(Q1) 93
G.2 코딩 분석 결과(Q2) 95
부록 H 실험 문항 생성 사례 97
H.1 실험 문항 변인 수렴 요약 통계 97
H.2 대표 문항 생성 사례 (3문항) 98
H.2.1 원문 04 —목표 난이도 상 98
H.2.2 원문 01 —목표 난이도 중 99
H.2.3 원문 08 —목표 난이도 하 100
ABSTRACT 101

