Essence
대규모 domain SFT(1.8M formal-math 예제)로 특화된 GOEDEL-PROVER-V2가 general-purpose tool-use 능력을 거의 완전히 상실(BFCL 89.4%→~0%)했지만, 단 100개의 Lean-specific agentic trace만으로 이 능력이 되살아나며, 이 회복 효과가 Lean 도메인을 넘어 일반 tool-calling 능력(BFCL 83.8%)으로까지 전이됨을 보인다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: 대규모 domain specialization으로 인한 agentic capability 붕괴가 영구적이지 않으며, 매우 적은 양의 domain-specific 데이터로 되살아나고 다른 도메인까지 전이될 수 있음을 명확하고 흥미로운 실증으로 보여준 워크숍 논문으로, 실용적 함의가 크지만 이론적 설명과 일반화 범위 검증은 추가 연구가 필요하다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Towards large language models as copilots for theorem proving in lean'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Deepseek-prover: Advancing theorem proving in llms through large-scale synthetic data'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Lean-star: Learning to interleave thinking and proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구Lean 기반 정리 증명 시스템의 핵심 도구로서 본 논문의 agentic 학습 기반이 되는 연구임
다른 접근Lean 특화 agentic 데이터 활용 방법론을 다루는 유사 연구이다.
다른 접근둘 다 Lean 증명 에이전트의 실패 지점을 다루지만 이 논문은 도메인 특화 학습으로 인한 일반 능력 상실 문제에 초점을 맞춘다.
다른 접근Lean 4 기반 정리증명 분석이라는 동일 문제를 다른 관점으로 접근함
다른 접근domain-specific SFT로 인한 능력 상실 문제를 다른 방식으로 완화하려는 대안적 연구임
다른 접근LLM 에이전트를 이용한 알고리즘 발견의 다른 접근 방식을 제시한다.
후속 연구self-coherence 기반 검증의 이론적 토대 제공
후속 연구Lean 특화 formal-math 학습과 관련된 유사한 agentic tool-use 접근을 다룸
후속 연구domain-specific fine-tuning 이후 tool-use 회복 문제를 확장한다.
응용 사례Lean 4 정리증명을 위한 인프라/도구를 실제 agentic training 시나리오에 적용하는 관계이다.
응용 사례formal-math 도메인에 대한 agentic training의 응용 사례이다.