⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
Figure 1. Empirical coverage of the true best model at M = 1,000
LLM 리더보드에서 point-estimate 기반 1위 선정은 N개 모델에 대한 post-selection inference 문제임을 지적하고, marginal confidence interval이 "top-ranked 모델이 진짜 최고인가"라는 질문을 커버하지 못함을 실증적으로 보인 뒤, paired-bootstrap Multiple Comparisons with the Best(MCB)를 적용해 FWER를 통제하는 confidence set을 제안한다.
Motivation
Known: LLM 리더보드(Open LLM Leaderboard, Chatbot Arena, HELM)는 모델별 point accuracy와 개별 bootstrap confidence interval을 보고하는 것이 표준 관행이며, Dror et al.(2018)의 paired bootstrap/Bonferroni correction과 Demšar(2006)의 Friedman–Nemenyi test 등 고전적 multiple comparison 기법이 존재한다.
Gap: 기존 marginal CI는 각 모델 개별적으로 Pr(µi ∈ CIi) ≥ 0.95만 보장할 뿐, "empirically top-ranked 모델이 population-level best인가"라는 N개 모델에 대한 post-selection event는 전혀 커버하지 못한다. Singh et al.(2025)의 "Leaderboard Illusion"은 문제를 정성적으로 진단했을 뿐 통계적 해법(treatment)을 제시하지 않았다.
Why: 리더보드 1위는 모델 배포·선택 의사결정에 직접적 영향을 미치는 사실상의 공식 지표로 취급되는데, 본 논문은 이 순위가 실제로는 0–58%의 낮은 확률로만 참인 최고 모델과 일치함을 보여, 현재 리더보드 관행이 통계적으로 근거 없는 착각(coin flip)을 진실처럼 포장하고 있음을 드러낸다.
Approach: Hsu의 Multiple Comparisons with the Best(MCB) 이론을 paired bootstrap 방식으로 구현하여, 공유 prompt 구조를 활용한 paired difference 기반 p-value 계산과 Holm step-down correction으로 FWER를 통제하는 top-k confidence set을 산출하는 알고리즘을 제안한다.
Achievement
Figure 3. (a) Coverage of the ground-truth best model for each benchmark task. Marginal CI (blue) fails to reach 95% on
인플레이션 정량화: synthetic 데이터와 Open LLM Leaderboard v2 calibrated 6개 태스크에서 marginal 방법의 실제 커버리지가 명목 95%에 크게 못 미치는 0–58%임을 실증.
MCB 알고리즘 제안 및 이론적 보장: paired-bootstrap MCB가 exchangeability와 bootstrap consistency 하에서 asymptotic하게 (1)의 커버리지 보장을 만족함을 Proposition으로 제시.
광범위한 검증: synthetic (N,M) grid, Open LLM Leaderboard v2의 IFEval·BBH·MATH-Hard·GPQA·MUSR·MMLU-Pro 6개 태스크, 그리고 Bradley–Terry 기반 simulated Chatbot Arena에서 MCB가 ≥94–98% 커버리지를 회복함을 확인.
실무적 시사점 도출: MCB confidence set의 크기(8–35개 모델)가 벤치마크의 실질적 해상력(resolving power)을 드러내며, 이를 point-estimate 순위와 함께 보고할 것을 권고.
How
Xij ∈ {0,1}로 모델 i의 prompt j에 대한 정오답을 정의하고, true accuracy µi와 true best i⋆ = argmax µi를 설정
empirical best 모델 ˆi⋆과의 paired difference D = X[ˆi⋆,:] − X를 계산
prompt를 with-replacement로 B회 resampling하여 bootstrap replicate δb 생성
각 경쟁 모델 i에 대해 p-value pi = 부트스트랩 상에서 δb[i] ≤ 0인 비율로 산출(경쟁 모델이 최고 모델과 동등하거나 우월할 확률)
Holm step-down procedure로 다중비교 보정하여 FWER 통제
Sα = {ˆi⋆} ∪ {i : padj,i > α}로 confidence set 구성
synthetic 데이터(θi ~ Uniform(0.3,0.8), Bernoulli 표본), Open LLM Leaderboard v2 calibrated 6개 태스크(80/20 ground truth/leaderboard split, 500회 반복), Bradley–Terry 모델 기반 simulated Chatbot Arena(30개 모델, ~77,000 pairwise battle, 50/50 split-half)로 검증
Originality
LLM 리더보드 순위 문제를 개별 모델 CI가 아닌 N개 모델에 대한 post-selection inference 문제로 명확히 프레이밍한 점
고전적 통계 기법인 Hsu의 MCB(1996)를 paired bootstrap 형태로 재구성해 현대 LLM 평가 파이프라인(per-prompt score만 필요)에 즉시 적용 가능한 형태로 각색
Bonferroni, Benjamini-Hochberg, Tukey HSD/Nemenyi 등 기존 다중비교 교정법과의 관계를 명시적으로 비교하여 MCB가 one-vs-best 구조와 paired correlation을 동시에 활용하는 최적 선택임을 논증
Chatbot Arena와 같은 pairwise preference 순위(Elo/Bradley-Terry)에도 동일한 post-selection instability가 존재함을 시뮬레이션으로 처음 보여줌
Limitation & Further Study
Chatbot Arena 시뮬레이션에서는 conservative bootstrap Bradley-Terry confidence set이 모든 30개 모델을 포함하여 사실상 무정보적(uninformative)이므로, dependent preference 데이터에 대한 더 정교한 simultaneous inference 기법이 추후 필요
synthetic 및 calibrated 벤치마크가 실제 리더보드의 모든 복잡성(예: 프롬프트 난이도 상관관계, 비이항 채점, 모델 간 상관된 오류 패턴)을 완전히 반영하지 못할 가능성
실제 Open LLM Leaderboard v2 원본 데이터가 아닌 calibrated 시뮬레이션 데이터를 사용했으므로, 실제 공개 리더보드 데이터에 대한 직접 검증이 후속 연구로 필요
Holm correction의 보수성으로 인해 confidence set이 벤치마크에 따라 매우 커질 수 있어(최대 35개) 실용적 해석과 커뮤니케이션 방법에 대한 추가 논의 필요
총평: LLM 리더보드 순위의 통계적 취약성을 명확히 진단하고 즉시 실무에 적용 가능한 간단하고 이론적으로 뒷받침되는 해법(MCB)을 제시한 실용적이면서도 임팩트 있는 연구이나, pairwise preference 순위(Chatbot Arena)에 대한 해법은 아직 미완성 상태로 후속 연구가 요구된다.