저자: Bitya Neuhof, Yuval Benjamini | 날짜: 2026 | URL: https://openreview.net/forum?id=Av9WyvtPu0 📄 PDF
라이선스: OpenReview 공개(오픈액세스)
Figure 1. Scores with 95% CIs and rank CIs across all subjects,
MMLU와 같은 multi-task 벤치마크에서 LLM 순위의 불확실성을 정량화하기 위해, pairwise hypothesis test를 기반으로 한 rank confidence interval(rank CI) 방법을 적용하고, subject 간 변동성이 prompt 변동성보다 훨씬 크다는 것을 실증적으로 보인다.
Figure 4. Subject-specific rank CIs with aggregation across ques-
Figure 3. Scores with 95% CIs and rank CIs from accuracy scores
총평: LLM 벤치마크 순위의 불확실성 정량화라는 실용적으로 중요한 문제에 통계적으로 엄밀한 rank CI 방법론을 적용하고, subject 수준 변동성의 중요성을 명확히 보여준 견실한 워크숍 논문이다. 방법론 자체의 참신성은 제한적이나 MMLU 사례를 통한 실증 분석과 통계적 선택에 대한 세심한 논의는 LLM 평가 관행 개선에 실질적으로 기여할 수 있다.