Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs

저자: Jasper Dekoninck, Nikola Jovanović, Tim Gehrunger, Kári Rögnvaldsson, Ivo Petrov, Chenhao Sun, Martin Vechev | 날짜: 2026 | URL: https://openreview.net/forum?id=DmPE4byHuN 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 2

Figure 2. Performance over time.

본 논문은 기존의 정적인 MathArena 벤치마크를 proof-based 대회, arXiv 기반 research-level 문제, Lean 기반 formal proof generation까지 포괄하는 지속적으로 유지되는 evaluation platform으로 확장한 연구이다. GPT-5.5가 2026 USA Math Olympiad에서 98%, research-level 문제에서 74%를 달성했음을 보이며 frontier model들의 수학적 추론 능력의 급속한 발전과 지속적 평가 플랫폼의 필요성을 강조한다.

Motivation

Achievement

Figure 2

Figure 2. Performance over time.

  1. Evaluation platform 패러다임 제시: 벤치마크와 구분되는 evaluation platform의 설계 요구사항(지속적 유지, 다양성, 상세 분석 인터페이스, 벤치마크의 추가/제거/갱신)을 논의했다.
  2. MathArena의 확장: 기존 final-answer olympiad 중심 벤치마크를 proof-based competitions, arXiv 기반 research-level 문제, false claim rejection, Lean 기반 정형 증명까지 포괄하도록 확장했다.
  3. 최신 모델 성능 분석: GPT-5.5가 2026 USAMO에서 98%, research-level 문제에서 74%를 달성함을 보였고, DeepSeek-v4-Pro가 최강 오픈모델임을 확인했으며, 전체 평균 성능이 1년 만에 45%에서 84%로 상승했음을 정량화했다.
  4. 다각적 강건성 분석: 비용 대비 성능(Fig 3), human-validated 점수와의 격차(Fig 4), leave-one-family-out을 이용한 순위 강건성(Fig 5), 신뢰구간 커버리지 검증(Fig 6) 등 플랫폼 신뢰성을 뒷받침하는 다양한 분석을 제공했다.

How

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 정적 벤치마크의 한계를 명확히 지적하고 이를 지속 가능한 evaluation platform으로 전환한 실용적이고 시의적절한 연구로, 수학 추론 분야에서 LLM 발전 상황을 투명하게 추적하는 데 크게 기여할 것으로 평가된다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Minif2f: a cross-system benchmark for formal olympiad-level mathematics'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Fimo: A challenge formal dataset for automated theorem proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Deepseek-prover: Advancing theorem proving in llms through large-scale synthetic data'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구compositional learning을 실제 수학 문제에 적용한 사례
기반 연구증명 단계 해결을 위한 문헌 검색 기능을 확장한 연구로 보인다.
기반 연구self-verification cliff 현상을 다른 태스크로 확장하여 검증한다.
기반 연구AI 코딩 평가 벤치마크의 한계를 지적하고 확장하는 관련 연구이다.
기반 연구대학 수준 수학 문제를 실제 벤치마크에 적용한 사례이다.
기반 연구수학 벤치마크를 확장하여 frontier LLM들의 계산수학 능력을 재평가한 연구이다.
후속 연구정적 벤치마크를 지속 유지되는 평가 플랫폼으로 확장하는 유사 시도
기반 연구formal proof 평가의 기초적 방법론을 제공
다른 접근다른 수학적 대상을 대상으로 하지만 동일한 Lean 기반 정리 벤치마크 구축 방식을 취한다.
기반 연구자동정형화 파이프라인을 확장하여 실제 논문 변환에 적용한다.
기반 연구research-level 수학 문제 벤치마크를 확장한 연구이다.
다른 접근수학 추론 평가를 위한 다른 벤치마크 설계 방식을 취한다.
다른 접근수학 추론 모델 평가를 다른 벤치마크 구조로 접근
다른 접근LLM의 아첨성 행동 측정을 위한 다른 도메인 접근
응용 사례arXiv 기반 research-level 문제 평가를 실제 적용한 사례이다.
다른 접근Lean 자동정형화 평가를 위한 다른 벤치마크 설계를 제시한다.
후속 연구생성기-검증기 구조 기반 벤치마크 설계의 이론적 기초를 제공하는 것으로 보임
후속 연구Lean 기반 정리 증명 벤치마크 구축이라는 유사한 방법론을 공유한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드