저자: Azmine Toushik Wasi, Mahir Absar Khan, Abdur Rahman, Wahid Faisal, Sukanta Saha, Saimon Bhuiyan, Mahdiya Rahman Sukanya, Rahatun Nesa Priti, Md. Iqramul Hoque, Munem Shahriar, Raima Islam, Sanatan Sushil, Shahriyar Zaman Ridoy, Kazi Rajwan Sultan, MD Shafikul Islam, Md Manjurul Ahsan, Md Rizwan Parvez | 날짜: 2026 | URL: https://openreview.net/forum?id=YWMnpol8i1 📄 PDF
라이선스: OpenReview 공개(오픈액세스)
Figure 1. Overview of INVARIANTBENCH. The benchmark evaluates invariance in reasoning by comparing model performance acr
LLM이 진짜 의미 기반 추론을 하는지 검증하기 위해, 동일한 문제를 의미보존 변환(semantics-preserving transformation)으로 재표현한 InvariantBench를 제안하고, 15개 최신 LLM이 정답률은 높아도 표현 형태가 바뀌면 예측이 일관되지 않는 "invariance gap"을 보임을 실증한다.
Figure 2. Two representative examples from INVARIANTBENCH.
Figure 3. Learning dynamics (60% test-set accuracy) under
총평: 추론 평가에서 흔히 간과되던 표현적 불변성(representational invariance)을 정식화하고 대규모 벤치마크로 구체화한 점에서 의미 있는 기여이며, 높은 accuracy가 실제 추론 능력을 과대평가할 수 있다는 경고를 실증적으로 뒷받침한다. 다만 judge 기반 평가와 변환 설계의 인위성에 대한 추가 검증이 향후 신뢰성 확보에 중요할 것이다.