The Leaderboard Lottery: Why Top LLM Rankings Are Often Coin Flips, and How to Fix Them

저자: Shourya Vir Jain | 날짜: 2026 | URL: https://openreview.net/forum?id=ZhVvlyFZP9 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Empirical coverage of the true best model at M = 1,000

LLM 리더보드에서 point-estimate 기반 1위 선정은 N개 모델에 대한 post-selection inference 문제임을 지적하고, marginal confidence interval이 "top-ranked 모델이 진짜 최고인가"라는 질문을 커버하지 못함을 실증적으로 보인 뒤, paired-bootstrap Multiple Comparisons with the Best(MCB)를 적용해 FWER를 통제하는 confidence set을 제안한다.

Motivation

Achievement

Figure 3

Figure 3. (a) Coverage of the ground-truth best model for each benchmark task. Marginal CI (blue) fails to reach 95% on

  1. 인플레이션 정량화: synthetic 데이터와 Open LLM Leaderboard v2 calibrated 6개 태스크에서 marginal 방법의 실제 커버리지가 명목 95%에 크게 못 미치는 0–58%임을 실증.
  2. MCB 알고리즘 제안 및 이론적 보장: paired-bootstrap MCB가 exchangeability와 bootstrap consistency 하에서 asymptotic하게 (1)의 커버리지 보장을 만족함을 Proposition으로 제시.
  3. 광범위한 검증: synthetic (N,M) grid, Open LLM Leaderboard v2의 IFEval·BBH·MATH-Hard·GPQA·MUSR·MMLU-Pro 6개 태스크, 그리고 Bradley–Terry 기반 simulated Chatbot Arena에서 MCB가 ≥94–98% 커버리지를 회복함을 확인.
  4. 실무적 시사점 도출: MCB confidence set의 크기(8–35개 모델)가 벤치마크의 실질적 해상력(resolving power)을 드러내며, 이를 point-estimate 순위와 함께 보고할 것을 권고.

How

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 4/5

총평: LLM 리더보드 순위의 통계적 취약성을 명확히 진단하고 즉시 실무에 적용 가능한 간단하고 이론적으로 뒷받침되는 해법(MCB)을 제시한 실용적이면서도 임팩트 있는 연구이나, pairwise preference 순위(Chatbot Arena)에 대한 해법은 아직 미완성 상태로 후속 연구가 요구된다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Openai o1 system card'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구post-selection inference 문제에 대한 통계적 기초를 제공한다.
다른 접근LLM 벤치마크 순위의 신뢰성을 다루는 유사한 통계적 접근이다.
다른 접근리더보드 평가의 통계적 신뢰성 문제를 다른 방식으로 다룬다.
다른 접근모델 순위 결정의 불확실성을 다른 방식으로 다룸
다른 접근LLM 평가 신뢰성 문제를 다른 통계적 방법론(post-selection inference)으로 접근함
후속 연구post-selection inference 문제를 벤치마크 평가에 확장 적용
반론/비판point-estimate 기반 평가의 한계를 비판적으로 지적하는 관점을 공유한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드