What Helps Agentic Lean Provers? A Trace-Level Attribution Study

저자: Pawan Sasanka Ammanamanchi | 날짜: 2026 | URL: https://openreview.net/forum?id=ShhLinF41r 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Lower-ladder outcomes on standalone_mix100.

Agentic Lean prover의 pass rate가 도구 사용, 검색, 검증 등 다양한 요소가 얽혀 해석이 어렵다는 문제를 지적하고, 100-task 고정 벤치마크에서 trace-level ablation을 통해 어떤 요소(compiler feedback, proof-state feedback, tool access, retrieval)가 실제로 성능에 기여하는지 단계별로 분석한다.

Motivation

Achievement

Figure 1

Figure 1. Lower-ladder outcomes on standalone_mix100.

  1. Compiler feedback의 명확한 효과: M1@8(compiler-error refinement)는 네 번의 Gemini 반복 실행에서 5–8/100을 해결하여, one-shot generation(0/100) 및 BoN@8(3/100) 대비 뚜렷한 향상을 보였다.
  2. Residual proof-state feedback의 혼재된 효과: M1.5는 일부 매칭 row(seed 89 @8, seed-42B depth @16에서 12/100)에서는 개선을 보이나 seed 42A @8에서는 M1이 더 우수해, 일관된 우위를 주장할 수 없는 pre-tool baseline으로 자리매김한다.
  3. Tool access와 tool use의 괴리 규명: M2에서 LSP/MCP 스타일 도구(diagnostics, goal, term-goal, hover, completions, whole-file run-code)를 도입해도 모델은 whole-file compilation을 주된 정보 채널로 삼을 뿐, 추가 도구는 별다른 이득을 주지 못함을 보였다.
  4. Trace 기반 실패 모드 규명: 다수의 실패 run이 최종 제출로 이어지지 않고 계속 tool을 탐색(probing)하는 commitment failure 패턴을 발견하여, 향후 retrieval/search/restart/decompose/commit 정책 설계의 구체적 목표를 제시하였다.

How

Figure 3

Figure 3. Tool-use summary in the M2 Gemini LSP configura-

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: Agentic Lean prover의 성능을 구성 요소별로 분해하여 분석한 실용적이고 시의적절한 attribution 연구로, 특히 tool access와 tool use의 구분 및 commitment failure 발견은 향후 agent 설계에 중요한 시사점을 준다. 다만 소규모 벤치마크와 mixed된 통계적 결과로 인해 일부 결론의 확증성은 제한적이며 workshop-level 초기 연구로서의 성격이 강하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Autoreproduce: Automatic AI Experiment Reproduction with Paper Lineage'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구LLM 에이전트의 end-to-end workflow 평가라는 유사한 프레임워크를 확장함
기반 연구agentic prover의 구성요소별 성능 분석의 기초가 되는 연구
기반 연구trace-level ablation 분석의 방법론적 기초 제공
기반 연구closed proof 실패 인증 개념을 확장한 연구
기반 연구proof refactoring을 위한 controllable optimization을 확장한다.
다른 접근agentic lean prover의 성능 요인을 다른 방식으로 분석하는 연구
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'M2F: Automated Formalization of Mathematical Literature at Scale'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근Lean proof의 모듈화 및 재구성을 다루는 관련 연구임.
다른 접근도구 오케스트레이션과 LLM 추론 통합을 위한 대안적 시스템 구조 제시
후속 연구trace-level attribution 분석을 확장한 관련 연구
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드