Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling

저자: Yafu Li, Runzhe Zhan, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Zhilin Wang, Jiacheng Chen, Futing Wang, Xuyang Hu, Yuchen Fan, Bangjie Xu, Yucheng Su, Xinmiao Han, Chenxi Li, Haodi Lei, Yufeng Zhao, Zejin Lin, Qianjia Cheng, Tong Zhu, Xiaoye Qu, Ganqu Cui, Peng Ye, Yun Luo, Zhouchen Lin, Yu Qiao, Bowen Zhou, Ning Ding, Yu Cheng | 날짜: 2026 | URL: https://openreview.net/forum?id=2EgI4uSciP 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

post-trained reasoning backbone(P1-30B-A3B)를 SFT의 reverse-perplexity curriculum, 2단계 RL(Coarse RL→Refined RL), 그리고 test-time scaling(TTS)으로 이어지는 단일 파이프라인으로 학습시켜, IMO/IPhO/USAMO 등 올림피아드 문제에서 gold-medal급 성능을 달성하는 SU-01 모델을 제시한다.

Motivation

Achievement

Figure 3
  1. SU-01 모델 제안: 30B-A3B 규모의 backbone에 약 340K개의 sub-8K-token trajectory로 SFT를 수행하고 200 RL step을 거쳐, 100K 토큰을 넘는 trajectory에서도 안정적인 추론이 가능한 SU-01을 학습했다.
  2. 올림피아드 대회 gold-medal급 성능 달성: direct SU-01은 IPhO 2024/2025 gold line을 넘고 IMO 2025/USAMO 2026 bronze line을 통과했으며, TTS 적용 시 두 수학 올림피아드에서 35점을 획득해 IMO 2025 gold line을 충족하고 USAMO 2026 gold line을 10점 초과, 340명 참가자 중 최고 인간 점수와 동등한 수준을 달성했다.
  3. proof-oriented 평가에서 경쟁력 입증: IMO-ProofBench에서 direct generation 57.6%, TTS 적용 시 70.2%를 기록하며 유사 규모 모델을 큰 폭으로 앞서고 Gemini 3.1 Pro Thinking과 같은 상용 시스템에 근접했다.
  4. 과학적 추론의 일반화 확인: FrontierScience-Research에서 유사 규모 모델 중 최고 종합 점수를 기록하여, 제안한 레시피가 올림피아드 벤치마크를 넘어 연구 스타일 문제로도 일반화됨을 보였다.

How

Figure 1

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 단일하고 비교적 단순한 SFT-RL-TTS 파이프라인만으로 compact한 30B-A3B 모델이 IMO/IPhO/USAMO 등 최상위 올림피아드에서 gold-medal급 성과를 달성했다는 점에서 실용적 가치가 크며, training-inference co-design 관점의 통합 레시피는 향후 reasoning 모델 개발에 참고할 만한 기여다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 Formal Methods and Computational Reasoning가 맞닿아, 'Towards large language models as copilots for theorem proving in lean'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.95로 LLM Agent Reasoning Training와 Formal Methods and Computational Reasoning가 맞닿아, 'Deepseek-prover: Advancing theorem proving in llms through large-scale synthetic data'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구수학 문제 채점에 LLM judge를 적용한 실제 사례 연구이다.
기반 연구frozen backbone에 logit 추가 방식을 확장한 추론 능력 강화 기법이다.
기반 연구coarse-to-refined RL 단계 설계의 이론적 토대를 제공하는 선행 연구이다.
다른 접근동일한 LLM reasoning 강화를 위한 SFT+RL 파이프라인을 다른 방식으로 구성한 접근이다.
다른 접근reward model 없이 step-level 오류 국소화를 수행하는 유사한 문제의식
다른 접근의료 도메인에서의 멀티모달 추론 및 grounding 기법을 다루는 연관 연구
다른 접근강화학습 기반 조합 탐색 문제를 다룬다는 점에서 유사하다.
다른 접근SFT curriculum과 RL 단계 결합 전략이 유사한 확장 연구이다.
후속 연구test-time scaling을 활용한 reasoning 향상 기법을 확장하여 적용한 연구이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드