Numina-Lean-Agent: An Open and General Agentic Reasoning System for Formal Mathematics

저자: Junqi Liu, Zihao Zhou, Zekai Zhu, Marco Dos Santos, Weikun He, jiawei liu, Yunzhou Xie, Junqiao Zhao, Qiufeng Wang, Lihong Zhi, Jia LI, Wenda Li | 날짜: 2026 | URL: https://openreview.net/forum?id=0bTEd4LpQr 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Overview of Numina-Lean-Agent, an agentic formal reasoning framework built on Claude Code and Numina-Lean-MCP.

범용 코딩 에이전트(Claude Code)에 Numina-Lean-MCP라는 도구 모음을 결합하여, 별도의 학습 없이도 최신 base model 교체만으로 성능을 향상시킬 수 있는 개방적이고 범용적인 formal theorem proving 에이전트 시스템인 Numina-Lean-Agent를 제안한다.

Motivation

Achievement

Figure 2

Figure 2. Numina-Lean-Agent dynamically leverages reasoning tools to autonomously navigate and advance formal proofs

  1. Putnam 2025 전체 문제 해결: Claude Opus 4.5를 base model로 사용해 William Lowell Putnam 2025 대회의 12문제를 모두(12/12) 해결하며 최신 closed-source 시스템인 AxiomProver와 동등한 성능을 보였고, Harmonic의 Aristotle 및 Seed-Prover 1.5를 능가했다.
  2. 효율적인 증명 생성: Problem B1 등 일부 문제에서 AxiomProver, Seed-Prover 1.5보다 더 간결한 증명(proof length)을 산출함을 계산 비용과 함께 보고했다.
  3. 실제 수학 연구로의 일반화 검증: 벤치마크 평가를 넘어, 수학자들과 상호작용하는 "vibe proving" 방식으로 Brascamp–Lieb 부등식에 관한 최근 harmonic analysis 논문의 formalization을 성공적으로 수행함으로써 시스템의 범용성을 입증했다.

How

Figure 2

Figure 2. Numina-Lean-Agent dynamically leverages reasoning tools to autonomously navigate and advance formal proofs

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 범용 coding agent와 MCP 기반 도구 통합만으로 전용 학습 없이 최신 formal proving 성능을 달성했다는 점에서 실용적이고 개방적인 대안을 제시한 의미 있는 연구이나, 평가 규모와 base model 의존성 측면에서 추가 검증이 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Generative language modeling for automated theorem proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods & Code Generation가 맞닿아, 'Fimo: A challenge formal dataset for automated theorem proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Towards large language models as copilots for theorem proving in lean'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'AI Co-Mathematician: Accelerating Mathematicians with Agentic AI'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근formal theorem proving을 위한 에이전트 시스템의 대안적 구현을 제시한다.
다른 접근시간적 추론을 위한 다른 forward-chaining 접근
후속 연구agentic reasoning system을 확장하여 활용하는 관련 연구이다.
후속 연구Numina-Lean-MCP 도구 모음을 확장하는 연구
응용 사례base model 교체를 통한 성능 향상 응용 사례
응용 사례코딩 에이전트를 정리 증명에 적용한 유사한 응용 사례이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드