Risk-Controlled Lean-as-Judge for Natural-Language Mathematical Reasoning

저자: Pauline Bourigault, Xiaotong Ji, Matthieu Zimmer, Rasul Tutunov, Haitham Bou Ammar | 날짜: 2026 | URL: https://openreview.net/forum?id=rWSCSa5exu 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. COVCAL treats Lean as a partial-observation judge: accept a Lean-backed answer only when the formal trace has

Lean 기반 증명 신호가 자연어 수학 답 선택에서 부분적(partial)이고 coverage에 크게 의존한다는 것을 보이고, 이를 반영해 accepted 답에 대해 finite-sample selective-risk 인증서를 제공하는 selector인 COVCAL을 제안한다.

Motivation

Achievement

Figure 2

Figure 2. Accepted fraction versus held-out selective-risk upper bound on the main run (dev-then-cal; K = 20 bootstrap m

  1. Coverage cliff 규명: MATH-500에서 proof-winning answer의 정확도가 high proved coverage에서는 96%, low coverage에서는 20%로 급격히 갈리는 현상을 실증적으로 확인함.
  2. 신호의 희소성과 불충실성 정량화: 7B autoformalizer가 문제의 28%에서만 class를 증명하며, 그 증명들 중 약 43%만 faithful함을 수동 감사로 확인함(나머지는 true-but-irrelevant 혹은 trivial 항등식).
  3. COVCAL 방법론 제안: Bonferroni bound와 tighter dev-then-cal rule 두 체제 하에서 accepted 답에 대해 finite-sample selective-risk를 인증하거나 abstain하는 selector를 설계함.
  4. Formalizer에 따른 실현 가능성 분석: 7B formalizer로는 20개 bootstrap partition 전부에서 Bonferroni 인증이 불가능(abstain)했으나, prover-specialized formalizer(79% coverage)로는 17/20에서 실현 가능해지고 약 48% 문제를 0.98 accuracy로 채택함을 보임.

How

Figure 2

Figure 2. Accepted fraction versus held-out selective-risk upper bound on the main run (dev-then-cal; K = 20 bootstrap m

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 3/5 Clarity: 4/5 Overall: 4/5

총평: Lean 증명 신호의 신뢰성이 coverage에 크게 좌우된다는 현상을 실증적으로 밝히고 이를 통계적으로 인증하는 selective-risk 프레임워크를 제안한 점에서 개념적으로 참신하고 시의적절한 워크숍 논문이나, 실용적 성능 우위보다는 진단적·분석적 기여에 초점이 맞춰져 있어 추가 검증과 확장이 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Fimo: A challenge formal dataset for automated theorem proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Lean-star: Learning to interleave thinking and proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Grammars of formal uncertainty: When to trust llms in automated reasoning tasks'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구counterfactual 검증을 형식 증명 탐색에 확장 적용
기반 연구Lean 검증 가능한 반례 생성 기법을 다른 도메인으로 확장한 연구이다.
기반 연구Isabelle 환경에서의 실제 증명 성능 향상에 적용된 사례이다.
기반 연구informal reasoning과 formal proof 결합 방법을 확장한 연구이다.
기반 연구Lean 4/Mathlib 기반 평가 벤치마크를 확장하는 연구로 판단됨.
기반 연구grind 검색 알고리즘의 개입 시점을 확장하여 다룬다.
기반 연구재사용 가능한 계산 구조 발견을 확장한 관련 연구이다.
다른 접근formal proof 신호를 활용한 답 선택 문제의 다른 접근이다.
다른 접근자연어 수학 답 선택에서 형식적 증명 신호를 활용하는 대안적 검증 방법을 제시한다.
다른 접근형식 검증 가능한 반례 생성이라는 유사한 목표를 가진 접근이다.
다른 접근수학적 증명 기반 답변 선택 문제와 관련된 유사 연구이다.
후속 연구선택적 위험(selective risk) 제어 프레임워크를 수학적 답 선택 문제로 확장한다.
후속 연구axiom dependency tracking을 통한 증명 분석의 이론적 기초를 제공함
응용 사례LLM 기반 수학 추론 검증에 conformal-style risk 인증서를 적용한 사례이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드