VOUCH for Mathematical Reasoning: Counterfactual Contracts Cure the Self-Verification Pathology

저자: Abhay Bhandarkar, Vedanth Nanesha | 날짜: 2026 | URL: https://openreview.net/forum?id=TkdaigO0fx 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. The dual-side VOUCH protocol. Candidate Generation: agents A, B, and optional c each predict. Contract Proposa

단일 에이전트가 자기 자신의 반사실적(counterfactual) 예측을 검증하는 self-verification 프로토콜은 self-coherent reasoner라면 정답 여부와 무관하게 항상 검증을 통과한다는 것을 이론적으로 증명하고, 이를 GSM8K, MATH-algebra, SVAMP에서 실증한 뒤, 두 에이전트 간 cross-side 커밋을 요구하는 dual-side counterfactual contract(VOUCH)로 해결한다.

Motivation

Achievement

Figure 2

Figure 2. Per-cell relative reduction in hurt | acted-on-wrong mov-

  1. 이론적 증명(Proposition 2.1): 고정 결정론적 디코딩 정책 하에서 self-form counterfactual consistency CCself(a;ι)가 정답 여부와 무관하게 항상 1이 됨을 증명하여 self-consistency 및 same-family LLM-as-judge 설정 모두에 적용되는 구조적 결함을 formalize했다.
  2. 실증적 병리 재현: GSM8K, MATH-algebra, SVAMP 세 벤치마크의 clean/adversarial 6개 cell 전반에서 정확도는 최대 28pp 하락하는 동시에 self-verification rate는 최대 11.6pp 상승하는 일관된 cross-cell signature를 확인했다.
  3. Dual-side contract 및 수렴 정리: cross-form counterfactual consistency(CCcross)에 기반한 dual-side VOUCH 프로토콜을 설계하고, hurt:caught ratio를 평균 46%(cell별 27%~68%) 감소시켰으며 모든 cell에서 95% bootstrap CI가 0보다 엄격히 크다는 것을 보였고, 세 가지 전제조건(C1~C3) 하의 장기 weight-convergence theorem(Theorem 3.5)도 제시했다.
  4. 베이스라인 대비 구조적 원인 확인: 동일 계열 LLM-as-judge(Llama-3.1-8B)와 self-consistency(k=5) 베이스라인 모두 동일한 self-coherent pathology를 그대로 물려받음을 head-to-head 비교로 확인하여, 문제가 sampling이나 arbitration 방식이 아니라 구조 자체에 기인함을 입증했다.

How

Figure 3

Figure 3. Three-rate decomposition on all math and code cells. The dual-side construction lifts the catch rate (top) on

Originality

Limitation & Further Study

Evaluation

Novelty: 5/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: Self-verification의 구조적 결함을 형식적 증명과 실증으로 명확히 드러내고 이를 해결하는 dual-side contract를 제안한 점에서 이론적 엄밀성과 실용적 기여를 모두 갖춘 우수한 연구이나, 검증 범위가 비교적 단순한 수학 벤치마크에 국한되어 있어 폭넓은 일반화 검증이 후속 과제로 남는다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'How Claude Code is used in practice \ Anthropic'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구self-coherence 기반 검증의 이론적 토대 제공
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Accelerating Scientific Research with Gemini: Case Studies and Common Techniques'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'MerLean: An Agentic Framework for Autoformalization in Quantum Computation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근reasoning 검증 프로토콜에 대한 유사한 문제의식
다른 접근LLM 기반 추론 검증에 대해 다른 접근 방식을 제시하는 대안적 연구이다.
다른 접근수학적 추론 검증을 위한 다른 self-verification 접근법
후속 연구counterfactual 검증을 형식 증명 탐색에 확장 적용
응용 사례GSM8K, MATH 벤치마크에서 검증 방법을 실제 적용한 사례를 다룬다.
반론/비판강화학습 수렴성에 대한 통속적 주장에 대한 반박적 시각을 제공한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드