Quantifying Ranking Uncertainty in LLM Benchmarks

저자: Bitya Neuhof, Yuval Benjamini | 날짜: 2026 | URL: https://openreview.net/forum?id=Av9WyvtPu0 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Scores with 95% CIs and rank CIs across all subjects,

MMLU와 같은 multi-task 벤치마크에서 LLM 순위의 불확실성을 정량화하기 위해, pairwise hypothesis test를 기반으로 한 rank confidence interval(rank CI) 방법을 적용하고, subject 간 변동성이 prompt 변동성보다 훨씬 크다는 것을 실증적으로 보인다.

Motivation

Achievement

Figure 4

Figure 4. Subject-specific rank CIs with aggregation across ques-

  1. 불확실성 원천의 명시적 분리: MMLU 벤치마크 내 subject 간 변동성, subject 내 question 변동성, prompt variant 변동성을 구분하여 각각이 rank CI 폭에 미치는 영향을 정량적으로 분석하였다.
  2. subject 변동성이 지배적임을 실증: subject 간 순위 변동성이 prompt 변동성보다 훨씬 크다는 것을 rank CI 비교를 통해 보였으며, 이는 벤치마크 전체 평균 정확도만으로 모델을 비교하는 관행의 위험성을 드러낸다.
  3. hypothesis test 선택에 따른 rank CI 민감도 분석: paired t-test 외 Wilcoxon 등 다양한 pairwise test와 unit 정의에 따라 rank CI 결과가 달라짐을 보여, rank CI 구성 시 통계적 선택이 단순한 기술적 디테일이 아니라 추론 결과 해석에 직결됨을 논증하였다.
  4. subject-level 분석의 필요성 제시: subject 단위 rank CI(Figure 4)를 통해 벤치마크 전체 집계에서는 드러나지 않는 모델 간 유의한 성능 차이를 탐지할 수 있음을 보였다.

How

Figure 3

Figure 3. Scores with 95% CIs and rank CIs from accuracy scores

Originality

Limitation & Further Study

Evaluation

Novelty: 3/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: LLM 벤치마크 순위의 불확실성 정량화라는 실용적으로 중요한 문제에 통계적으로 엄밀한 rank CI 방법론을 적용하고, subject 수준 변동성의 중요성을 명확히 보여준 견실한 워크숍 논문이다. 방법론 자체의 참신성은 제한적이나 MMLU 사례를 통한 실증 분석과 통계적 선택에 대한 세심한 논의는 LLM 평가 관행 개선에 실질적으로 기여할 수 있다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 Biomedical AI Knowledge Systems와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'InterFeedback: Unveiling interactive intelligence of large multimodal models via human feedback'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구멀티모달 벤치마크로서의 실제 감각 예측 응용
기반 연구벤치마크 순위 산정 방법론의 공통 통계적 기초를 공유한다.
기반 연구fMRI 데이터를 활용한 불확실성 정량화의 실제 응용 사례임
다른 접근LLM 벤치마크 평가에 대한 다른 통계적 접근법 제시
다른 접근저비용 예측기를 활용해 분산을 줄이는 유사한 통계적 추정 방법을 제안한다.
다른 접근LLM 프롬프트 효과 검증을 위한 다른 실험 설계 방식을 제시함
다른 접근LLM의 자기평가 일관성 문제에 대한 다른 측정 지표를 제안한다.
다른 접근LLM 벤치마크 순위의 신뢰성을 다루는 유사한 통계적 접근이다.
후속 연구post-selection inference 문제에 대한 통계적 기초를 제공한다.
다른 접근genomic 모델 평가 프로토콜의 파편화 문제를 다룬다는 공통 주제를 갖는다.
후속 연구기존 벤치마크 평가 방법을 확장하여 불확실성을 다룸
후속 연구올림피아드 수준 문제 평가 방법론의 기초를 제공한다.
후속 연구LLM scheming 행동 측정의 방법론적 기초가 되는 연구임
응용 사례실제 벤치마크 데이터에 순위 신뢰구간 방법을 적용
반론/비판벤치마크 순위 평가에 대한 다른 관점을 제시할 수 있다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드