GLEAN: Guideline-Grounded Evidence Accumulation for High-Stakes Agent Verification

저자: Yichi Zhang, Nabeel Seedat, Yinpeng Dong, Peng Cui, Jun Zhu, Mihaela van der Schaar | 날짜: 2026 | URL: https://openreview.net/forum?id=FP23eFYhAy 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

GLEAN은 LLM 에이전트의 고위험 의사결정(예: 임상 진단)을 검증하기 위해 전문가가 작성한 guideline을 단계별 정합성 평가에 활용하고, 이를 Bayesian logistic regression으로 보정된 correctness probability로 변환하며, 불확실성이 높은 경우 능동적으로 추가 근거를 수집하는 프레임워크이다.

Motivation

Achievement

Figure 4
  1. 정합성 및 calibration 성능 향상: MIMIC-IV 데이터셋 기반 3개 질환의 agentic clinical diagnosis에서 best baseline 대비 AUROC 12% 향상, Brier score 50% 감소를 달성했다.
  2. 높은 discrimination 및 calibration 지표: active verification 적용 시 AUROC 0.94 이상, Brier score 0.10 이하를 기록했다.
  3. Best-of-N 성능 향상: GLEAN을 활용한 Best-of-N 선택으로 에이전트 진단 정확도를 55.6%에서 77.5%로 끌어올렸다.
  4. 전문가 검증: 임상의를 대상으로 한 expert study를 통해 GLEAN의 실무적 유용성을 확인했다.

How

Figure 3

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 도메인 guideline을 활용해 고위험 에이전트 검증의 discrimination과 calibration을 동시에 개선하고 active verification까지 결합한 실용적이고 참신한 프레임워크로, 임상 진단이라는 대표적 고위험 시나리오에서 강력한 실증 결과를 보여준다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 Clinical Time-Series Modeling와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'How Claude Code is used in practice \ Anthropic'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Clinical Time-Series Modeling와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Autoreproduce: Automatic AI Experiment Reproduction with Paper Lineage'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구LLM 추론 정책 평가에 sequential testing을 적용한 사례이다.
기반 연구구조화된 데이터 변환 문제에 형식 검증을 적용한 유사한 응용 사례이다.
기반 연구SPECTER2 유사도 0.93로 Clinical Time-Series Modeling와 Agentic AI for Scientific Automation가 맞닿아, 'Towards a Science of AI Agent Reliability'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근AI 에이전트 신뢰성 평가의 다른 측면을 다룸
다른 접근가이드라인 기반 단계별 검증이라는 유사한 임상 LLM 평가 프레임워크를 다룬다.
다른 접근고위험 LLM 의사결정 검증을 위한 다른 신뢰도 보정 방법을 제시한다.
다른 접근LLM 에이전트의 고위험 의사결정 검증을 위한 다른 신뢰도 보정 방법을 제안한다.
후속 연구단계별 정합성 평가 프레임워크를 확률적 보정으로 확장한다.
후속 연구false alarm rate 통제를 위한 통계적 가설검정 프레임워크의 이론적 토대를 제공한다.
응용 사례가이드라인 기반 평가를 임상 진단 등 실제 고위험 도메인에 적용한다.
응용 사례임상 진단과 같은 고위험 도메인에 LLM 검증 기법을 적용한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드