Essence
Figure 1. Pipeline at a glance: the pipeline retrieves papers from
arXiv 최신 연구 논문에서 lemma를 자동으로 추출하고 필요한 정의와 가정을 보강해 self-contained한 문제로 재구성함으로써, 오염 없이 지속적으로 갱신 가능한 research-level 수학 정리 증명 벤치마크인 LemmaBench를 제안한다.
Evaluation
Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: arXiv 기반의 자동화된 self-contained lemma 추출과 자연어 증명 평가를 결합한 live 벤치마크라는 아이디어는 참신하고 실용적 가치가 크며, 최신 LLM들의 급격한 성능 향상과 여전한 격차를 잘 보여준다. 다만 LLM-as-a-judge에 대한 의존도와 self-containedness 판정 기준의 주관성은 향후 보완이 필요한 지점이다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Fimo: A challenge formal dataset for automated theorem proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Deepseek-prover: Advancing theorem proving in llms through large-scale synthetic data'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Can language models falsify? evaluating algorithmic reasoning with counterexample creation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근코드 검증 능력에 대한 다른 벤치마크 설계를 제시한다.
기반 연구수학 문제 검색 및 평가 벤치마크를 실제 IR 시스템에 적용한 연구
기반 연구LLM 수학 증명 능력 평가를 위한 지속 갱신 가능한 벤치마크 구축의 기초 연구이다.
기반 연구표현 형태 변화에 따른 LLM 예측 일관성 평가를 확장한다.
응용 사례LLM의 수학적 추론 능력 평가에 적용된 유사 벤치마크이다.
다른 접근수학 정리 증명 벤치마크를 위한 다른 데이터 구성 방식을 제시한다.
다른 접근symbolic regression 학습 데이터 처리의 다른 최적화 접근
다른 접근text embedding의 수학적 동치성 평가를 위한 다른 벤치마크나 방법을 제시한다.
다른 접근유사한 paraphrase 불일치 측정 접근법
다른 접근과학 문헌에서 실험 데이터를 추출하는 유사한 문제를 다룬다.
후속 연구research-level 수학 문제 벤치마크를 확장한 연구이다.
후속 연구constructive proof 학습을 위한 self-supervised 방법론적 기반을 공유한다.