Awakening the Sleeping Agent: Lean-Specific Agentic Data Reactivates General Tool Use in Goedel Prover

저자: Jui-Hui Chung, Hongzhou Lin, Lai Jiang, Shange Tang, Chi Jin | 날짜: 2026 | URL: https://openreview.net/forum?id=kCoJgTMUD5 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 2

대규모 domain SFT(1.8M formal-math 예제)로 특화된 GOEDEL-PROVER-V2가 general-purpose tool-use 능력을 거의 완전히 상실(BFCL 89.4%→~0%)했지만, 단 100개의 Lean-specific agentic trace만으로 이 능력이 되살아나며, 이 회복 효과가 Lean 도메인을 넘어 일반 tool-calling 능력(BFCL 83.8%)으로까지 전이됨을 보인다.

Motivation

Achievement

Figure 1
  1. Agentic collapse 규명: GOEDEL-PROVER-V2가 formal-math 특화 학습 후 BFCL function-calling accuracy가 89.4%에서 거의 0%로 급락함을 정량적으로 확인했다.
  2. Model merging의 한계 입증: SLERP를 이용한 GOEDEL-PROVER-V2와 QWEN3-32B 간 보간 실험에서 tool-use 회복과 in-domain Lean 성능 향상이 동시에 이루어지지 않는 뚜렷한 tradeoff를 MiniF2F와 ProofNet에서 확인했다(Figure 1).
  3. 소량 데이터로 능력 회복: 단 100개의 Lean-specific agentic trace로 fine-tuning한 결과, BFCL 정확도가 4.6%에서 83.8%로 급격히 회복되어 base model(89.4%)에 근접했다.
  4. Cross-domain 일반화 입증: 학습 데이터가 general-purpose API나 JSON 형식의 function call을 전혀 포함하지 않았음에도, 회복된 tool-use 능력이 BFCL 같은 완전히 다른 프로토콜/분포의 벤치마크로 전이됨을 보였다.
  5. In-domain 실용성 확인: ProofNet에서 pass@32가 21.51%에서 25.81%로 향상되어, 회복된 tool-use 능력이 실제 정리 증명 성능 개선에도 기여함을 입증했다.

How

Figure 2

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 대규모 domain specialization으로 인한 agentic capability 붕괴가 영구적이지 않으며, 매우 적은 양의 domain-specific 데이터로 되살아나고 다른 도메인까지 전이될 수 있음을 명확하고 흥미로운 실증으로 보여준 워크숍 논문으로, 실용적 함의가 크지만 이론적 설명과 일반화 범위 검증은 추가 연구가 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Towards large language models as copilots for theorem proving in lean'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Deepseek-prover: Advancing theorem proving in llms through large-scale synthetic data'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Lean-star: Learning to interleave thinking and proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구Lean 기반 정리 증명 시스템의 핵심 도구로서 본 논문의 agentic 학습 기반이 되는 연구임
다른 접근Lean 특화 agentic 데이터 활용 방법론을 다루는 유사 연구이다.
다른 접근둘 다 Lean 증명 에이전트의 실패 지점을 다루지만 이 논문은 도메인 특화 학습으로 인한 일반 능력 상실 문제에 초점을 맞춘다.
다른 접근Lean 4 기반 정리증명 분석이라는 동일 문제를 다른 관점으로 접근함
다른 접근domain-specific SFT로 인한 능력 상실 문제를 다른 방식으로 완화하려는 대안적 연구임
다른 접근LLM 에이전트를 이용한 알고리즘 발견의 다른 접근 방식을 제시한다.
후속 연구self-coherence 기반 검증의 이론적 토대 제공
후속 연구Lean 특화 formal-math 학습과 관련된 유사한 agentic tool-use 접근을 다룸
후속 연구domain-specific fine-tuning 이후 tool-use 회복 문제를 확장한다.
응용 사례Lean 4 정리증명을 위한 인프라/도구를 실제 agentic training 시나리오에 적용하는 관계이다.
응용 사례formal-math 도메인에 대한 agentic training의 응용 사례이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드