검색 상세

SETA : 거짓 성공 인식 메모리를 통한 엔터프라이즈 LLM 에이전트의 오프라인-온라인 연산 분할

SETA: Offline–Online Compute Splitting with False-Success-Aware Memory for Enterprise Tool-Using LLM Agents

초록(요약문)

LLM 기반 도구 사용 에이전트의 상용 도입이 확산되면서, 정확도 단일 지표만으로는 운영 환경에서 가장 위험한 실패 양식 — 에이전트가 ‘완료’를 보고했으나 실제 결과가 틀린 거짓 성공(false success, FS) — 을 명시적 실패(explicit failure, EF)와 분리해 평가하기 어렵고, 운영 효율성(지연·토큰)과 SOP 준수 또한 기존 벤치마크에서 측정 차원으로 누락되어 있다. 본 연구의 핵심 기여는 SETA(Selective Explicit-failure Trajectory Amortization)이다. SETA는 다중 시도 사고형(Think) 추론의 탐색 비용을 도메인당 한 번 오프라인에서 지불하고 온라인에서는 NonThink K=1 단일 시도로 서빙하는 오프라인-온라인 연산 분할 방법으로, Think K=4 풀에서 검출된 거짓 성공(FS) 궤적을 명시적 실패(EF) 메모리로 변환·검색한다. SETA가 표적으로 삼는 FS/EF 분리 신호는, 본 연구가 SETA의 평가 신호로 사용하는 보완적 측정 도구 TCOEA(Tool-Call Oriented Enterprise Agent)로 정의한다. TCOEA는 도구 호출 궤적과 완료 신호를 교차 대조하여 FS/EF를 FSR로 분리하고 CSOP·RSOP로 SOP 위반을, Common 지표로 운영 효율성을 정량화하는 13개 지표 체계이다. 본 연구는 이 분류 신호의 다모델 타당성을 TS·latency/token·FSR 중심으로 Qwen·GPT·Gemini 5종 모델, RTO(60건)·CRR(50건)에서 실증하였으며, 공개 벤치마크 FS 재분류는 τ-bench 1,980건 중 74.3 %, τ²-bench 10,832건 중 20.9 %, AgentArch 990건 중 26.5 %가 거짓 성공임을 보인다 — 정확도 단일 지표 이면에 가려져 있던 운영자 미인지 위험이다. SETA의 헤드라인 결과는 다음과 같다. 전이적 성숙 메모리 체제 하 AgentArch RTO 60 과업에서 SETA는 14.87초/질의 지연으로 보고 전 고정한 별도 시드 {50, 60–63} 기준 85.00 ± 5.27 %(동일 시드 가족 {42–46} 재현치 88.33 ± 2.98 %)에 도달하여, 가장 강한 K=4 학술 기준선 대비 +10.33 pp(95 % CI [+4.75, +16.25], p 〈 0.001)의 우위를 약 8.4배 낮은 지연에서 달성한다. 검색 단독은 잡음 수준이고 이득은 FS→EF 변환에 기인한다. 엄격한 콜드 스타트 체제에서는 정확도 향상은 주장하지 않으며 소폭 손실 범위(시드 평균 Δ=−1.94 pp) 안에서 지연 우위가 보존되고, τ-bench 교차 벤치마크에서는 합성 메커니즘의 이전성과 함께 FS 기질 밀도가 경계 조건임이 드러난다. TCOEA의 Identity 4개 지표(FRR·UY·THR·SRR)를 SETA 파이프라인 위에서 실증하였다(FRR = 29.4 %, 외부 DPO 참조 앵커 84.7 %(선행 분류 작업) 대비 낮은 재발률; UY = 12, 회귀 0건; SRR = 88.33 ± 3.33 %; THR = 100 %). 두 폐쇄형 참조 심판의 교차 일치는 거의 완전하며(Cohen κ = 0.999), 코드·검색 파이프라인·재현 산출물은 보충 자료로 제출된다.

more

초록(요약문)

As LLM-based tool-using agents are increasingly deployed in stable enterprise domains, accuracy-only evaluation conceals the most damaging failure mode: agents that report 'completion' while producing wrong outputs, indistinguishable from explicit failures under public accuracy metrics. Existing benchmarks also omit operational efficiency (latency, token usage) and SOP compliance. The primary contribution of this thesis is SETA — Selective Explicit-failure Trajectory Amortization — an offline–online compute-splitting method that pays the exploratory cost of multi-attempt Think reasoning once per domain, offline, and serves online with a single-attempt NonThink K=1 policy. SETA detects false-success (FS) trajectories in a Think K=4 pool, converts them into explicit-failure (EF) memories via a templated re-prompt, and retrieves them at online inference time. The signal it targets — the separation of false successes from explicit failures — is provided by a complementary measurement layer used for SETA, TCOEA (Tool-Call Oriented Enterprise Agent): a 13-metric benchmark that disentangles FS from EF via FSR, quantifies SOP violations (CSOP/RSOP), and captures operational efficiency. Using TCOEA's four-way TS/EF/FS/FF taxonomy as its primary signal, we empirically validate that this classification signal is a stable measurement tool across models and domains — focusing on TS, latency/token, and FSR on five models (Qwen3.5-NT/TK, GPT-5.4-mini, Gemini-3.1-flash-lite, Gemini-3-flash) over RTO/CRR (N=60 / N=50). Public benchmark FS reclassification reveals that 74.3% of 1,980 τ-bench runs, 20.9% of 10,832 τ²-bench runs, and 26.5% of 990 AgentArch runs are reclassified as false successes (completion reported but reward = 0) — invisible to accuracy alone. In the transductive mature-memory setting on AgentArch RTO, SETA reaches 85.00 ± 5.27% task success on the held-out dispatch seeds {50, 60–63} (in-family {42–46} replication: 88.33 ± 2.98%) at 14.87 s/query — a +10.33 pp improvement over the strongest K=4 academic reference (95% CI [+4.75, +16.25], p 〈 0.001) at approximately 8.4× lower online latency. Retrieval alone is at noise; the FS→EF transformation contributes the gain. In strict cold-start the latency advantage is preserved with a small accuracy loss (seed-mean Δ=−1.94 pp; paired-bootstrap CI [−3.58, −0.17], p=0.027), and a τ-bench probe shows synthesis-mechanism portability bounded by FS-substrate density. TCOEA's four Identity metrics are reported on the SETA pipeline (FRR = 29.4%, vs an external DPO-based FRR anchor of 84.7% from prior taxonomy work; Update Yield = 12 with zero regressions; SRR = 88.33 ± 3.33%; THR = 100%), and cross-judge agreement across all runs is near-perfect (Cohen κ = 0.999). Code and reproduction artifacts are released as supplements.

more

목차

제 1 장 서 론 1
제 1 절 연구 배경 및 문제 제기 1
제 2 절 연구 질문과 연구 범위 2
제 3 절 연구 기여와 논문 구성 3
제 2 장 관련 연구 6
제 1 절 에이전틱 벤치마크와 다차원 평가 6
제 2 절 도구 사용 에이전트와 궤적 재사용 6
제 3 절 자기 반성 및 언어적 강화 학습 7
제 4 절 검색 증강 생성과 추론 시점 연산 스케일링 7
제 5 절 에이전트 평가 프로토콜과 LLM 심판 견고성 7
제 3 장 SETA: 오프라인-온라인 연산 분할 방법론 9
제 1 절 SETA의 평가 신호: TCOEA 4-방향 분류 체계 9
⑴ 동기와 정확도 단일 지표의 한계 9
⑵ 13개 지표 체계 개요 10
⑶ Safety 핵심: FSR과 SOP 위반 정의식 11
⑷ SOP 측정 방법론 13
⑸ Identity 지표 14
⑹ 기존 벤치마크·CLEAR와의 측정 차원 비교 14
제 2 절 표기와 목적 함수 15
제 3 절 오프라인 풀 구성 16
제 4 절 ef_induction 변환 16
제 5 절 온라인 검색 및 추론 16
제 6 절 검색 게이트 16
제 7 절 성숙 메모리 체제의 정당성 17
제 8 절 비용 분해와 분할 임계점 17
제 4 장 SETA 실험 설정 22
제 1 절 백본·서빙·평가 환경 22
제 2 절 벤치마크와 과업 구성 22
제 3 절 실험 조건과 통계 프로토콜 22
제 4 절 TCOEA 분류기의 다모델 타당성 검증 23
⑴ 실험 설정 23
⑵ 사전 분석: 기존 벤치마크 FS 재분류 23
⑶ 다모델 FS/EF 비교 24
⑷ FS vs EF의 질적 차이 25
⑸ 정확성-효율성 트레이드오프 25
⑹ 크로스 도메인 검증 26
⑺ 평가 방법론과 한계 26
제 5 장 SETA 실험 결과 27
제 1 절 주요 결과: 성숙 메모리 분할 27
제 2 절 콜드 스타트: 지연 우위와 정확도 소폭 손실 30
제 3 절 메커니즘 절제 분석 30
제 4 절 다중 비교 보정과 통계적 유의성 31
제 5 절 교차 심판·교차 벤치마크 견고성 32
제 6 절 Reflexion 연산 분배 비교 32
제 7 절 실패 가족 분해 33
제 8 절 자기 분류기 가능성과 방법론적 교훈 34
제 9 절 정체성 지표 (TCOEA Identity 4개의 SETA 측 실증) 34
제 10 절 교차 백본 스트레스 테스트 37
제 6 장 한계 및 토의 39
제 1 절 SETA 측 한계 39
제 2 절 평가 도구(TCOEA) 측 한계 39
제 3 절 외부 타당성 39
제 4 절 사회적·운영적 함의 40
제 7 장 결 론 41
참고문헌 43
부록 K. RTO K=1 직접 메커니즘 절제 45

more