LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics

저자: Antoine Peyronnet, Fabian Gloeckle, Amaury Hayat | 날짜: 2026 | URL: https://openreview.net/forum?id=WnAAGGyuVv 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Pipeline at a glance: the pipeline retrieves papers from

arXiv 최신 연구 논문에서 lemma를 자동으로 추출하고 필요한 정의와 가정을 보강해 self-contained한 문제로 재구성함으로써, 오염 없이 지속적으로 갱신 가능한 research-level 수학 정리 증명 벤치마크인 LemmaBench를 제안한다.

Motivation

Achievement

Figure 2

Figure 2. Evolution of proof quality of the best performing

  1. Live 벤치마크 파이프라인 구축: arXiv에서 lemma를 자동 추출하고 self-contained 문항으로 변환하는 파이프라인을 제시해 주 단위로도 갱신 가능한 오염 방지 벤치마크를 실현했다.
  2. 정확도 검증: 수동 검수를 통해 생성된 self-contained lemma 벤치마크가 수학적으로 정확하고 정밀함을 확인했다.
  3. LLM 성능 추적: LLM-as-a-judge와 인간 전문가 검증을 결합해 신뢰도 있는 평가 체계를 마련하고, 최신 모델들이 지난 9개월간 이론 증명 정확도(pass@1)를 10-15%에서 40.8%까지 끌어올렸음을 정량적으로 보였다.
  4. 재사용 가능한 데이터 자산화: 과거 데이터에도 동일 파이프라인을 적용해 대규모 고품질 학습 데이터셋 생성이 가능함을 보였고, 도메인별 세부 벤치마크 구성이 가능함을 제시했다.

How

Figure 1

Figure 1. Pipeline at a glance: the pipeline retrieves papers from

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: arXiv 기반의 자동화된 self-contained lemma 추출과 자연어 증명 평가를 결합한 live 벤치마크라는 아이디어는 참신하고 실용적 가치가 크며, 최신 LLM들의 급격한 성능 향상과 여전한 격차를 잘 보여준다. 다만 LLM-as-a-judge에 대한 의존도와 self-containedness 판정 기준의 주관성은 향후 보완이 필요한 지점이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Fimo: A challenge formal dataset for automated theorem proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Deepseek-prover: Advancing theorem proving in llms through large-scale synthetic data'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Can language models falsify? evaluating algorithmic reasoning with counterexample creation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근코드 검증 능력에 대한 다른 벤치마크 설계를 제시한다.
기반 연구수학 문제 검색 및 평가 벤치마크를 실제 IR 시스템에 적용한 연구
기반 연구LLM 수학 증명 능력 평가를 위한 지속 갱신 가능한 벤치마크 구축의 기초 연구이다.
기반 연구표현 형태 변화에 따른 LLM 예측 일관성 평가를 확장한다.
응용 사례LLM의 수학적 추론 능력 평가에 적용된 유사 벤치마크이다.
다른 접근수학 정리 증명 벤치마크를 위한 다른 데이터 구성 방식을 제시한다.
다른 접근symbolic regression 학습 데이터 처리의 다른 최적화 접근
다른 접근text embedding의 수학적 동치성 평가를 위한 다른 벤치마크나 방법을 제시한다.
다른 접근유사한 paraphrase 불일치 측정 접근법
다른 접근과학 문헌에서 실험 데이터를 추출하는 유사한 문제를 다룬다.
후속 연구research-level 수학 문제 벤치마크를 확장한 연구이다.
후속 연구constructive proof 학습을 위한 self-supervised 방법론적 기반을 공유한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드