InvariantBench: Can Large Language Models Exhibit Inherent Reasoning Across Equivalent Transformations?

저자: Azmine Toushik Wasi, Mahir Absar Khan, Abdur Rahman, Wahid Faisal, Sukanta Saha, Saimon Bhuiyan, Mahdiya Rahman Sukanya, Rahatun Nesa Priti, Md. Iqramul Hoque, Munem Shahriar, Raima Islam, Sanatan Sushil, Shahriyar Zaman Ridoy, Kazi Rajwan Sultan, MD Shafikul Islam, Md Manjurul Ahsan, Md Rizwan Parvez | 날짜: 2026 | URL: https://openreview.net/forum?id=YWMnpol8i1 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Overview of INVARIANTBENCH. The benchmark evaluates invariance in reasoning by comparing model performance acr

LLM이 진짜 의미 기반 추론을 하는지 검증하기 위해, 동일한 문제를 의미보존 변환(semantics-preserving transformation)으로 재표현한 InvariantBench를 제안하고, 15개 최신 LLM이 정답률은 높아도 표현 형태가 바뀌면 예측이 일관되지 않는 "invariance gap"을 보임을 실증한다.

Motivation

Achievement

Figure 2

Figure 2. Two representative examples from INVARIANTBENCH.

  1. InvariantBench 구축: 1,200개 seed 문제 × 4개 invariant form으로 구성된 4,800개 평가 항목을 만들었으며, 3개 reasoning family(Formal Logic and Discrete Structure, Quantitative Reasoning and Optimization, Relational/Planning/Algorithmic/Semantic Reasoning), 16개 세부 task, 12개 fine-grained invariance axis를 포괄한다.
  2. 표현적 불변성(representational invariance)의 형식적 정의: surface form과 semantics를 구분하는 형식적 프레임워크와, 모든 변환이 만족해야 하는 semantic-preservation contract를 제시했다.
  3. 대규모 실증 분석: 15개 frontier 및 open-weight LLM을 대상으로 실험한 결과, 강한 모델에서도 1-5%의 accuracy 하락과 대부분 모델에서 5% 미만의 full-consistency rate를 발견했으며, 이는 최상위 시스템(>48%)과 인간(>98%)에 크게 못 미친다.
  4. 실패 원인 분석 및 개입 실험: 8가지 failure mode(premise-comprehension, symbolic/logical translation, computation, multi-step reasoning, invariance brittleness, lexical/semantic selection, format compliance, generation pathology)를 정의하고, SFT는 암기(memorization)를 유발하는 반면 GRPO는 invariance gap을 완전히 해소하지 못해도 cross-form generalization을 향상시킴을 보였다.

How

Figure 3

Figure 3. Learning dynamics (60% test-set accuracy) under

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 추론 평가에서 흔히 간과되던 표현적 불변성(representational invariance)을 정식화하고 대규모 벤치마크로 구체화한 점에서 의미 있는 기여이며, 높은 accuracy가 실제 추론 능력을 과대평가할 수 있다는 경고를 실증적으로 뒷받침한다. 다만 judge 기반 평가와 변환 설계의 인위성에 대한 추가 검증이 향후 신뢰성 확보에 중요할 것이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'A survey of reasoning with foundation models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Towards reasoning era: A survey of long chain-of-thought for reasoning large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Truly assessing fluid intelligence of large language models through dynamic reasoning evaluation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구의미보존 변환 기반 평가 방법론의 이론적 기초를 제공한다.
기반 연구학습 기반 탐색을 수학적 구조 발견에 적용한 유사 연구이다.
기반 연구LLM의 수학적 추론 능력 평가에 적용된 유사 벤치마크이다.
후속 연구표현 형태 변화에 따른 LLM 예측 일관성 평가를 확장한다.
다른 접근동일한 문제를 다른 표현으로 재구성해 모델의 강건성을 측정하는 접근이 유사하다.
다른 접근LLM의 진짜 추론 능력을 검증하는 다른 벤치마크 접근을 제시한다.
다른 접근LLM의 불확실성 하 가설 공간 탐색 능력을 평가하는 유사한 벤치마크 접근을 취한다.
반론/비판표현 형태 변화에 따른 모델의 강건성 문제를 다른 도메인에서 검증한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드