Resolution Diagnostics for Paired LLM Evaluation

저자: Anany Kotawala | 날짜: 2026 | URL: https://openreview.net/forum?id=1MY39ELzdX 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 2

Figure 2. Resolution diagnostic on 40 OLL v1 pairwise comparisons, faceted by task. Each bar gives r = N ⋆/N = 1/q for o

LLM 리더보드의 pairwise 순위 비교를 paired hypothesis-testing 문제로 재정의하고, 실제 paired 평가 설계 하에서 요구되는 표본 크기 N*와 관측된 N의 비율인 resolution ratio q를 진단 지표로 제안하여, Open LLM Leaderboard v1과 MMLU-Pro의 상당수 표시된 순위가 통상적인 (α, 1−β)=(0.05, 0.8) 해상도 기준을 충족하지 못함을 보인다.

Motivation

Achievement

Figure 1

Figure 1. Efficiency gain of paired McNemar over the unpaired

  1. 불충족 리더보드 순위의 정량화: Open LLM Leaderboard v1의 40개 pairwise 비교 중 11개, MMLU-Pro top-10 인접순위 9쌍 중 4개가 (0.05, 0.8) 해상도 기준에서 unresolved임을 보였고, subject-level clustering 반영 시 MMLU-Pro의 unresolved 쌍이 6/9로 증가함을 확인했다.
  2. Lemma 1 (sharp small-effect expansion): unpaired Cohen-h-plus-(1−ρ) shortcut의 비율 nh/N이 1/2로부터 명시적 2차 상수 C(p,ρ)δ² 이내로 벗어남을 증명하고, 이 shortcut이 close-comparison 영역에서 정확한 N보다 약 2배 벗어남을 규명했다.
  3. Calculator 오용 사례 실증: Cohen(1988), G*Power, R pwr 등 5개 계산기 중 3개가 (1−ρ) 사후 보정 방식에서 이 결함을 그대로 계승함을 worked example로 보였다.
  4. Prospective 검증: paired-McNemar required-N이 Miller(2024)의 unpaired Gaussian 공식보다 중앙값 2.15배 작으며(Figure 1), 실제 OLL v1 3개 쌍에서 프레임워크의 N* 처방이 부트스트랩 실험적 검정력 0.80±0.03을 정확히 달성함을 확인했다.
  5. 다중 stress-test 하 강건성: multiplicity correction, 실제 subject-level clustering, anytime-valid sequential testing을 모두 적용해도 unresolved-pair 패턴이 유지됨을 보이고, 이를 통합한 per-pair verdict table(Table 5)과 pip-installable 패키지 llm-power를 제공했다.

How

Figure 5

Figure 5. Bootstrap power against paired sample size n on synthetic paired Bernoulli data, three δ. Dashed verticals mar

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 고전적 통계 도구들(McNemar test, Wald inversion, cluster correction, e-process)을 재조합하여 LLM 리더보드 평가의 실질적 맹점을 명확하고 실용적인 진단 프레임워크로 제시한 견고한 연구이며, 특히 널리 쓰이는 계산기들의 오용 패턴을 구체적으로 드러낸 점과 실제 리더보드 재분석 결과가 실무적 함의가 크다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92 기준으로 'Resolution Diagnostics for Paired LLM Evaluation'의 AI4S 방법론을 'Bibliometrics: Global Gender Disparities in Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Scientific AI for Physics and Environment가 맞닿아, 'A multimodal generative AI copilot for human pathology'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Scientific AI for Physics and Environment가 맞닿아, 'SciHorizon: Benchmarking AI-for-Science Readiness from Scientific Data to Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구불균등 표본 크기 문제를 다른 통계적 검정으로 확장한다.
응용 사례LLM 벤치마크 평가에 표본 크기 진단을 실제 적용한 연구.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 Applied Bibliometrics Across Domains가 맞닿아, 'Research trends and emerging themes in abdominal aortic calcification: a 2005–2025 bibliometric analysis'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근LLM 리더보드 평가를 위한 다른 통계적 검정 방법을 제안하는 연구.
다른 접근모델 순위 결정의 불확실성을 다른 방식으로 다룸
다른 접근LLM 리더보드 평가를 위한 다른 통계적 프레임워크를 제안한다.
응용 사례pairwise 평가 방법을 실제 벤치마크에 적용한 사례이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드