Re$^2$Math: Benchmarking Theorem Retrieval in Research-Level Mathematics

저자: Zicheng Lyu, Wenjie Yang, Shengzhong Zhang, Zengfeng Huang | 날짜: 2026 | URL: https://openreview.net/forum?id=5olUroPMyc 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Overview of Re2Math. A published-first, arXiv-backed pipeline mines candidate instrumental citations inside ma

Re2Math는 research-level 수학 논문의 partial proof에서 특정 증명 단계(gap)를 해결하는데 필요한 외부 정리(theorem)를 문헌으로부터 검색·근거화(source-grounding)하고 그 적용 가능성(sufficiency)을 검증하는 능력을 평가하는 benchmark이다. citation-invariant한 성공 기준과 release-frozen retrieval artifact를 통해 재현 가능하면서도 지속적으로 확장 가능한 진단형 평가체계를 제시한다.

Motivation

Achievement

Figure 3

Figure 3. Dataset statistics. Overview of the curated benchmark and the Eval-200 subset. The full curated dataset contai

  1. Task formulation: partial research proof에서의 tool-grounded retrieval을 hierarchical context, raw/assisted track, citation-invariant 성공 기준으로 형식화했다. 2. Living benchmark 구축: published-first, arXiv-backed 자동 파이프라인으로 instrumental proof citation 기반의 versioned benchmark를 구축하여 새 인스턴스를 지속적으로 통합하되 논문 평가는 frozen held-out release로 고정했다. 3. 진단적 평가체계 제공: ToolAcc를 주요 지표로 citation-side retrieval, source grounding, proof-gap sufficiency, oracle-source behavior, alternative-source success를 분리 측정하는 shared-backend protocol을 제시했다. 4. 실증 결과: Eval-200 test set에서 최고 성능 모델도 ToolAcc 7.0%에 그쳐, source grounding 비율은 상대적으로 높음에도 불구하고 현재 시스템들이 유효한 statement는 찾아내지만 local proof step에 대한 적용 가능성 확립에는 실패함을 보였다.

How

Figure 2

Figure 2. Overview of tool-grounded retrieval. Given hierarchical proof context (global + local) and an optional anchor,

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: research-level 수학 연구 보조에 필수적이지만 그동안 간과되었던 tool-grounded literature retrieval 능력을 정밀하게 분해하여 진단하는 benchmark로, 낮은 ToolAcc 결과가 현재 LLM의 한계를 명확히 드러내는 의미 있는 기여이다. 다만 자동 파이프라인의 신뢰성과 judge 평가의 견고성에 대한 추가 검증이 향후 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'Fimo: A challenge formal dataset for automated theorem proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구정리 검색 및 근거화(grounding)의 기초적 방법론을 제공함
기반 연구SPECTER2 유사도 0.92로 Formal Proof Verification Automation와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Autoreproduce: Automatic AI Experiment Reproduction with Paper Lineage'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근수학 정리 검색을 위한 다른 접근법을 제시하는 벤치마크 연구임
후속 연구research-level 수학 문제에 대한 LLM 검증 능력을 확장하여 다룸
후속 연구문헌 근거화(source-grounding) 개념을 확장하여 적용한 연구로 보인다.
후속 연구증명 단계 해결을 위한 문헌 검색 기능을 확장한 연구로 보인다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드