Enhancing Neural Theorem Proving via High-Quality Proof Selection and Verifier Feedback

저자: Xiaoxue Zhu, Jilin Hu, Fuyuan Zhang, Jianyu Zhang, Yongwang Zhao | 날짜: 2026 | URL: https://openreview.net/forum?id=B61SpkriNe 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Overview of the data-centric neural theorem-proving framework. The left panel illustrates High-Quality Data Se

Isabelle 환경의 neural theorem proving을 위해 proof complexity, semantic coverage, reasoning diversity(PSR) 세 기준으로 raw proof corpus에서 고품질 소규모 학습 데이터를 선별하고, 추론 시 verifier feedback을 활용한 dynamic prompt optimization을 결합하여 miniF2F-test에서 새로운 state of the art(90.6% Pass@64)를 달성한 data-centric 프레임워크를 제안한다.

Motivation

Achievement

Figure 4

Figure 4. Pass@k performance on miniF2F-test for models fine-

  1. PSR 기반 고품질 데이터셋 구축: raw corpus에서 PSR 기준으로 선별한 4k 규모의 Isabelle 학습 데이터셋을 구축하고 공개했다.
  2. 데이터만으로 큰 성능 향상: PSR-selected 데이터만으로 파인튜닝했을 때 miniF2F-test에서 84.8% Pass@64를 달성했다.
  3. State-of-the-art 달성: Dynamic Feedback-Based Prompt Optimization을 결합한 전체 프레임워크는 90.6% Pass@64를 기록하며 기존 ProofAug 등을 능가하는 Isabelle NTP 최고 성능을 달성했다.
  4. 재현 가능 자원 공개: PSR-selected 데이터셋과 fine-tuned LoRA adapter를 공개하여 후속 연구를 지원한다.

How

Figure 2

Figure 2. Template for Dynamic Feedback-Based Prompt Optimization (round r). The prompt is composed of the problem state

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 데이터 품질과 verifier feedback을 결합한 data-centric 접근으로 Isabelle NTP에서 뚜렷한 성능 향상과 새로운 state-of-the-art를 달성했다는 점에서 실용적 가치가 크며, 공개된 데이터셋과 어댑터는 후속 연구에 유용한 자원이 될 것으로 보인다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'Fimo: A challenge formal dataset for automated theorem proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'A survey on deep learning for theorem proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'Towards large language models as copilots for theorem proving in lean'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구추론 깊이 증가에 따른 성능 저하 문제에 대한 유사한 응용
기반 연구비용-품질 트레이드오프 최적화 기법을 실제 증명 시스템에 적용한 사례로 보임
기반 연구신경망 기반 정리 증명의 기본 프레임워크를 제공한다.
다른 접근Lean 검증기 신호를 활용하는 다른 zero-shot 증명 방법이다.
다른 접근Lean theorem prover 성능 향상을 위한 다른 접근법
후속 연구고품질 증명 데이터 선별 방법을 확장한 연구이다.
다른 접근Lean 기반 정리 증명 데이터셋을 다루는 유사한 형식적 증명 연구이다.
다른 접근정리 증명을 위한 다른 데이터 선별 및 학습 전략을 제안한다.
다른 접근reasoning diversity를 활용한 다른 데이터 선별 전략을 제시한다.
다른 접근증명 후처리 최적화의 다른 전략을 탐구한다.
응용 사례Isabelle 환경에서의 실제 증명 성능 향상에 적용된 사례이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드