Solving Is Not Drawing: A Benchmark for Diagrammatic Reasoning in Olympiad Geometry

저자: Hsien Xin Peng, Anthony Kim, Alvin Li, Calvin Supasanya, Shivank Garg, Kevin Zhu | 날짜: 2026 | URL: https://openreview.net/forum?id=khkDinsubG 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Overview of the Data Curation and Evaluation Processes. We web-scrape high-quality mathematical olympiad probl

올림피아드 기하 문제를 '푸는 능력'과 그에 필요한 '도형을 그리는 능력(diagrammatic reasoning)'이 별개임을 보이고, 이를 측정하기 위한 954개 문제(297개 hard subset) 규모의 오픈소스 벤치마크와 다중 지표 평가 체계를 제안한다.

Motivation

Achievement

Figure 3

Figure 3. Change in each metric when the full reference solution is

  1. 벤치마크 정의 및 표준화: diagrammatic reasoning을 문제 풀이와 구별되는 독립적 능력으로 정의하고 정형화했다.
  2. 오픈소스 데이터셋 공개: 954개 올림피아드 기하 문제에 대해 전체 solution과 human-made Asymptote 코드 기반 고충실도 다이어그램(이미지+코드)을 함께 제공하고, 다양한 평가 지표 세트를 공개했다.
  3. 모델 평가를 통한 격차 입증: Claude Sonnet 4.6, GPT-5.4-mini, Gemini 3.1 Flash-lite, Kimi K2.5 등 최신 모델을 벤치마킹하여, 평균 compile success rate 36.14%에 불과함을 보이며 강한 수학적 추론이 정확한 기하 도형 구성 능력을 함의하지 않음을 실증했다.

How

Figure 1

Figure 1. Overview of the Data Curation and Evaluation Processes. We web-scrape high-quality mathematical olympiad probl

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 문제 풀이와 도형 작도 능력을 분리해 측정한다는 아이디어는 참신하고 실용적으로 중요한 문제를 겨냥하며, 954개 규모의 human-authored ground truth 도형 데이터셋과 다중 지표 평가 체계라는 구체적 기여도 뚜렷하다. 다만 curation 파이프라인이 단일 LLM 판정에 크게 의존하고 평가 모델 수가 제한적이라는 점에서 후속 검증과 확장이 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Scientific Information Extraction and QA가 맞닿아, 'MMSCI: A dataset for graduate-level multi-discipline multimodal scientific understanding'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구올림피아드 수준 기하 문제 평가의 기초를 제공한다.
기반 연구학습된 sparse operator를 실제 solver 성능 개선에 적용한 사례이다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Molecular Simulation and Generative Modeling가 맞닿아, 'GMT: A Geometric Multigrid Transformer Solver for Microstructure Homogenization'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근기하 문제 해결 능력을 측정하는 다른 벤치마크 접근이다.
다른 접근물리 정합적 벤치마크 구축을 위한 다른 접근법 제시
후속 연구diagrammatic reasoning 평가를 확장한 벤치마크이다.
후속 연구symbolic mathematics 문제 seed question 구성의 이론적 토대
후속 연구pixel-level grounding 평가를 위한 기초적 벤치마크를 제공한다.
반론/비판문제 해결과 도형 그리기 능력의 분리라는 관점에 대한 비교 관점을 제공한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드