FormInv: A Measurement Protocol for Semantic Invariance in Mathematical Reasoning Benchmarks

저자: Nishal Thomas, Noel Thomas | 날짜: 2026 | URL: https://openreview.net/forum?id=X8Fdpx4GX9 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Per-family failure rates across three representative models (3-model shared evaluation). F5 (connective variat

본 논문은 수학 추론 벤치마크에서 의미적으로 동등한 paraphrase에 대해 LLM이 얼마나 불일치하게 답하는지를 측정하는 프로토콜(FormInv)을 제안하며, cross-model unanimity를 이용해 MathCheck 등 기존 벤치마크의 paraphrase 오류를 자동 검출하고, 난이도를 통제한 새로운 지표 Conditional Inconsistency Rate(CIR)를 통해 accuracy와 거의 독립적인 axis의 취약성을 드러낸다.

Motivation

Achievement

Figure 1

Figure 1. Per-family failure rates across three representative models (3-model shared evaluation). F5 (connective variat

  1. Paraphrase 오류 자동 검출: cross-model unanimity(≥3/4 또는 ≥6/9 모델 일치)를 이용해 MathCheck에서 4개(3.1%)의 의미적으로 잘못된 paraphrase를 10달러 이하 비용으로 검출했고, 이를 제거하면 GPT-4o의 순위가 2위에서 4위로 하락하는 등 랭킹이 크게 변화함을 보였다.
  2. CIR(Conditional Inconsistency Rate) 제안: 모든 모델이 canonical form에서 정답을 맞춘 정리들만 대상으로 조건화하여 accuracy confound를 제거한 지표를 제시했고, Claude Haiku 4.5(41.9%)와 DeepSeek V3(4.7%) 사이 37%p 격차를 발견했으며, CIR이 accuracy와 anti-correlated(ρ=-0.57~-0.59)함을 독립적인 두 데이터셋에서 재현했다.
  3. No-Free-Benchmark corollary 증명: 어떤 모델도 모든 paraphrase family에서 우세하지 않으므로, 벤치마크가 포함하는 family 선택이 곧 모델 랭킹을 암묵적으로 결정한다는 명제를 제시했다.
  4. FormInv 벤치마크와 FormInvSelector 구축: 103개 Lean4 검증 정리, 8개 paraphrase family, 760개(및 811개 harder track) 항목으로 구성된 데모 벤치마크를 만들고, 목표 task의 family 프로파일에 따라 최적 모델을 추천하는 FormInvSelector 유틸리티를 제공했다.

How

Figure 1

Figure 1. Per-family failure rates across three representative models (3-model shared evaluation). F5 (connective variat

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 단순 accuracy 기반 평가의 사각지대를 정량적으로 드러내고 이를 측정하는 재사용 가능한 프로토콜과 지표(CIR)를 제시한 점에서 벤치마크 평가 방법론에 실질적 기여를 하는 논문이며, 실제 공개 벤치마크에 적용해 재랭킹까지 보인 실증력이 인상적이다.

같이 보면 좋은 논문

기반 연구구축된 코퍼스를 실제 오류 진단 모델에 적용한 사례이다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Scientific Information Extraction and QA가 맞닿아, 'Fact-checking complex claims with program-guided reasoning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Scientific Information Extraction and QA가 맞닿아, 'Factkg: Fact verification via reasoning on knowledge graphs'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Selfcheck: Using llms to zero-shot check their own step-by-step reasoning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구수학 추론 벤치마크 평가의 기초 연구
다른 접근의미적 불변성 측정을 위한 다른 프로토콜 제안
다른 접근수학 추론 벤치마크의 신뢰성 문제를 다른 방식으로 측정하는 접근
다른 접근수학 개념 추상화를 위한 다른 접근법을 다루는 연구이다.
다른 접근유사한 paraphrase 불일치 측정 접근법
후속 연구paraphrase 기반 평가 프로토콜을 확장한 연구이다.
응용 사례paraphrase 불일치 측정을 실제 벤치마크 평가에 적용하는 사례로 연결됨
반론/비판형식화 오류 평가와 의미적 불변성 측정이라는 다른 관점
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드