Scaling Generative Verifiers For Natural Language Mathematical Proof Verification And Selection

저자: Sadegh Mahdavi, Branislav Kisacanin, Shubham Toshniwal, Wei Du, Ivan Moshkov, George Armstrong, Renjie Liao, Christos Thrampoulidis, Igor Gitman | 날짜: 2026 | URL: https://openreview.net/forum?id=NsC3NFsavi 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 3

Figure 3. Left: Overview of our proposed test-time scaling method to combine GenSelect with LLM-as-a-Judge for proof sel

본 논문은 자연어 수학 증명(proof) 검증 및 선택을 위해 두 가지 주요 생성적 검증 방법인 GenSelect와 LLM-as-a-Judge를 대규모(수백만 토큰)로 확장하고, 이들을 결합한 프레임워크가 가장 효과적임을 보이며, 강화학습이 proof-level 지표는 개선하지만 최종 답 정확도는 개선하지 못한다는 것을 밝혀낸 연구이다.

Motivation

Achievement

Figure 1

Figure 1. Left: Training curves for RL training of Qwen3-30B-A3B-Thinking-2507 on the OPC dataset. (1) Different prompts

  1. 다중 벤치마크 평가 프레임워크 구축: 단일 벤치마크 평가의 취약성을 실증적으로 보이고, VerProofArena를 비롯한 6개의 상호 보완적 데이터셋을 활용해 exploitable correlation과 소규모 데이터셋 문제를 완화하는 평가 체계를 제안했다.
  2. LLM-as-a-Judge 프롬프트 민감도 및 RL의 효과 규명: 프롬프트 설계가 LLM-as-a-Judge 성능에 큰 영향을 미친다는 것을 보이고, 강화학습(RL) fine-tuning이 이러한 민감도를 효과적으로 줄일 수 있음을 확인했다.
  3. GenSelect와 LLM-as-a-Judge 결합 프레임워크 제안: GenSelect 토너먼트와 parallel judgment 방식을 결합함으로써 개선된 compute-performance trade-off를 달성하는 최적의 test-time scaling 전략을 제시했다.
  4. RL의 한계 발견: RL이 proof-level 지표(metric)는 개선하지만 final-answer precision은 향상시키지 못함을 보여, 현재 모델이 수학적 타당성보다 stylistic 혹은 procedural correctness에 보상을 부여하는 경향이 있음을 지적했다.

How

Figure 4

Figure 4. LLM-as-a-Judge performance on selecting the best proof among 8 generated proofs from SelOPC. A higher number o

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 단일 벤치마크의 함정을 드러내고 GenSelect와 LLM-as-a-Judge를 대규모로 결합하여 proof verification/selection의 실용적 가이드라인을 제시한 견실한 연구로, RL의 한계에 대한 통찰이 특히 향후 연구에 중요한 시사점을 제공한다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Draft, sketch, and prove: Guiding formal theorem provers with informal proofs'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'A survey on deep learning for theorem proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Deepseek-prover: Advancing theorem proving in llms through large-scale synthetic data'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구생성적 검증기(generative verifier) 개념의 방법론적 토대를 제공한다.
기반 연구MCTS 기반 탐색 정책을 예산 제약 하에서 확장한다.
기반 연구reference solution 기반 태스크 진화 방법을 실제 벤치마크에 적용한다.
기반 연구verifier-coupled reasoning 개념을 확장한 연구
다른 접근자연어 수학 증명 검증을 위한 다른 생성적 검증 방법을 제시한다.
기반 연구paraphrase 기반 평가 프로토콜을 확장한 연구이다.
기반 연구neuro-symbolic 추론 신뢰성 평가를 확장한 연구
기반 연구RL 이전 SFT 활용 전략을 확장하는 연구로 추정됨.
기반 연구MassSpecGym 벤치마크의 평가 결함을 발견하고 교정한 후속 작업이다.
다른 접근다중 턴 강화학습을 통한 자기 개선이라는 유사 목표를 다른 방식으로 접근한다.
다른 접근on-policy distillation에서 token-level supervision을 분석하는 유사한 접근이다.
다른 접근정리 증명 및 검증을 위한 대규모 스케일링 접근을 공유함
후속 연구GenSelect와 LLM-as-a-Judge 결합 프레임워크를 확장한 연구이다.
후속 연구reasoning trace 통합의 이론적 기초 제공
후속 연구메타데이터 기반 연구 개념 추출의 방법론적 토대를 제공하는 연구로 판단됨
응용 사례생성적 검증 방법을 대규모 수학 증명 평가에 적용한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드