Scaling up Multi-Turn Off-Policy RL and Multi-Agent Tree Search for LLM Step-Provers

저자: Ran Xin, Zeyu Zheng, Yanchen Nie, Kun Yuan, Xia Xiao | 날짜: 2026 | URL: https://openreview.net/forum?id=GPrlMiGg2w 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Overview of the training-time scaling up architecture. The process begins with a current expert model. The sys

BFS-Prover-V2는 LLM 기반 Lean 4 정리 증명기에서 학습 시점과 추론 시점의 스케일링을 동시에 다루는 시스템으로, multi-turn off-policy RL(expert iteration 기반)과 planner 기반 multi-agent tree search를 결합해 miniF2F 95.08%, ProofNet 41.4%라는 SoTA 성능을 달성한다.

Motivation

Achievement

Figure 4

Figure 4. Sustained Performance Improvement through Expert Iteration and Periodic Retraining. This graph plots the prove

  1. miniF2F 95.08% 달성: 기존 LLM step-prover들을 크게 능가하고 최고 수준의 whole-proof 생성 모델과 대등한 SoTA 성능을 기록.
  2. ProofNet-test 41.4% 달성: step-level prover 중 SoTA 수준이며 분포 변화에 대한 강건한 일반화 능력을 입증.
  3. 성능 plateau 극복: adaptive tactic-level 데이터 필터링과 주기적 재학습(periodic retraining)을 통해 장기간 RL 학습에서도 지속적 성능 향상을 달성(Fig. 4).
  4. 탐색 복잡도 감소: planner 기반 계층적 분해로 전체 계산량을 subgoal 복잡도의 곱에서 합으로 전환, multi-agent 협업 효율성 증대.

How

Figure 3

Figure 3. Overview of the multi-agent tree search architecture. The Planner agent decomposes the main theorem into a seq

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 학습과 추론 양쪽의 스케일링 문제를 하나의 통합된 시스템으로 다루며 SoTA 성능을 달성한 실용적이고 견고한 연구로, formal theorem proving을 넘어 다른 reasoning 도메인에도 시사점을 줄 수 있는 우수한 기여다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'ReTool: Reinforcement Learning for Strategic Tool Use in LLMs'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구multi-agent tree search의 기반이 되는 방법론을 제공한다.
다른 접근기하 정리 예측을 위한 대안적 in-context learning 접근
기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 Formal Methods and Computational Reasoning가 맞닿아, 'Accelerating Scientific Research with Gemini: Case Studies and Common Techniques'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근LLM 기반 정리 증명에서 다른 탐색 전략을 사용하는 대안적 접근이다.
후속 연구off-policy RL 기반 정리 증명 시스템을 확장한 연구이다.
후속 연구reasoning trajectory 내 탐색 전략에 대한 이론적 기반을 제공한다.
응용 사례유사한 강화학습 기법을 정리 증명 도메인에 적용한 사례이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드