Escaping the Cognitive Well: Efficient Competition Math with Off-the-Shelf Models

저자: Xingyu Dang, Rohit Agarwal, Rodrigo Porto, Anirudh Goyal, Liam H Fowl, Sanjeev Arora | 날짜: 2026 | URL: https://openreview.net/forum?id=ASDIjgm78Z 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 2

범용 off-the-shelf 모델만을 사용하여 IMO 수준의 수학 문제를 solver-grader 파이프라인에서 발생하는 "Cognitive Well" 실패 양상을 conjecture extraction과 context detachment로 극복함으로써, 기존 대비 훨씬 저렴한 비용(문항당 ~9 USD)으로 PB-Adv에서 87.6%의 최고 수준 성능을 달성한다.

Motivation

Achievement

Figure 1
  1. 최고 성능 달성: Gemini 3.1 Pro를 이용해 IMO-ProofBench Advanced(PB-Adv)에서 87.6% 성능을 달성하여, IMO 금메달을 획득한 DeepThink 모델의 성능을 능가함.
  2. 압도적인 비용 효율성: 문항당 평균 약 9 USD의 비용으로, 문항당 3000 USD가 드는 DeepSeekMath V2(61.9%)나 300 USD 이상이 드는 Huang & Yang(2025) 파이프라인(24%)보다 훨씬 저렴하면서도 성능은 3배 이상 우수함.
  3. 범용 모델만으로 구현: 커스텀 학습이나 비공개 모델 없이 off-the-shelf 범용 모델만으로 최고 수준 성능을 재현하여, 일반 연구자들도 접근 가능한 파이프라인을 제시함.
  4. 실패 모드 규명: Cognitive Plateau와 Cognitive Well이라는 두 가지 solver-grader 파이프라인의 실패 양상을 정의하고, 특히 Cognitive Well이 grader의 reward hacking과 유사한 현상임을 실증적으로 밝힘.

How

Figure 2

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 기존 고비용 대규모 병렬 파이프라인의 실패 원인을 명확히 규명하고 이를 개념적으로 해결하는 경량 기법을 제시하여, 비용 대비 성능 면에서 매우 인상적인 결과를 보여주는 실용적이고 통찰력 있는 연구이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Fimo: A challenge formal dataset for automated theorem proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'A survey on deep learning for theorem proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구동일한 수학 추론 trace 생성 방법을 실제 모델 학습에 적용한다.
기반 연구symbolic regression 데이터 생성 방식을 확장
기반 연구LLM 기반 증명 자동화를 실제 검증 가능한 벤치마크에 적용한 사례이다.
후속 연구solver-grader 구조를 확장한 경쟁 수학 문제 해결 연구
기반 연구미해결 수학 문제 벤치마크를 정형 증명 검증으로 확장한다.
다른 접근수학 문제 해결을 위한 다른 파이프라인 접근법
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Accelerating Scientific Research with Gemini: Case Studies and Common Techniques'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근LLM 기반 수학 증명 자동화를 다른 방식으로 접근한 연구이다.
후속 연구solver-grader 파이프라인의 한계를 극복하는 확장 연구이다.
후속 연구LLM 수학 증명 능력 평가를 위한 지속 갱신 가능한 벤치마크 구축의 기초 연구이다.
반론/비판LLM의 수학적 능력에 대해 대조적인 관점을 제시할 가능성
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드