저자: Nishal Thomas, Noel Thomas | 날짜: 2026 | URL: https://openreview.net/forum?id=X8Fdpx4GX9 📄 PDF
라이선스: OpenReview 공개(오픈액세스)
Figure 1. Per-family failure rates across three representative models (3-model shared evaluation). F5 (connective variat
본 논문은 수학 추론 벤치마크에서 의미적으로 동등한 paraphrase에 대해 LLM이 얼마나 불일치하게 답하는지를 측정하는 프로토콜(FormInv)을 제안하며, cross-model unanimity를 이용해 MathCheck 등 기존 벤치마크의 paraphrase 오류를 자동 검출하고, 난이도를 통제한 새로운 지표 Conditional Inconsistency Rate(CIR)를 통해 accuracy와 거의 독립적인 axis의 취약성을 드러낸다.
Figure 1. Per-family failure rates across three representative models (3-model shared evaluation). F5 (connective variat
Figure 1. Per-family failure rates across three representative models (3-model shared evaluation). F5 (connective variat
총평: 단순 accuracy 기반 평가의 사각지대를 정량적으로 드러내고 이를 측정하는 재사용 가능한 프로토콜과 지표(CIR)를 제시한 점에서 벤치마크 평가 방법론에 실질적 기여를 하는 논문이며, 실제 공개 벤치마크에 적용해 재랭킹까지 보인 실증력이 인상적이다.