저자: Yafu Li, Runzhe Zhan, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Zhilin Wang, Jiacheng Chen, Futing Wang, Xuyang Hu, Yuchen Fan, Bangjie Xu, Yucheng Su, Xinmiao Han, Chenxi Li, Haodi Lei, Yufeng Zhao, Zejin Lin, Qianjia Cheng, Tong Zhu, Xiaoye Qu, Ganqu Cui, Peng Ye, Yun Luo, Zhouchen Lin, Yu Qiao, Bowen Zhou, Ning Ding, Yu Cheng | 날짜: 2026 | URL: https://openreview.net/forum?id=2EgI4uSciP 📄 PDF
Essence
post-trained reasoning backbone(P1-30B-A3B)를 SFT의 reverse-perplexity curriculum, 2단계 RL(Coarse RL→Refined RL), 그리고 test-time scaling(TTS)으로 이어지는 단일 파이프라인으로 학습시켜, IMO/IPhO/USAMO 등 올림피아드 문제에서 gold-medal급 성능을 달성하는 SU-01 모델을 제시한다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: 단일하고 비교적 단순한 SFT-RL-TTS 파이프라인만으로 compact한 30B-A3B 모델이 IMO/IPhO/USAMO 등 최상위 올림피아드에서 gold-medal급 성과를 달성했다는 점에서 실용적 가치가 크며, training-inference co-design 관점의 통합 레시피는 향후 reasoning 모델 개발에 참고할 만한 기여다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 Formal Methods and Computational Reasoning가 맞닿아, 'Towards large language models as copilots for theorem proving in lean'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.95로 LLM Agent Reasoning Training와 Formal Methods and Computational Reasoning가 맞닿아, 'Deepseek-prover: Advancing theorem proving in llms through large-scale synthetic data'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구수학 문제 채점에 LLM judge를 적용한 실제 사례 연구이다.
기반 연구frozen backbone에 logit 추가 방식을 확장한 추론 능력 강화 기법이다.
기반 연구coarse-to-refined RL 단계 설계의 이론적 토대를 제공하는 선행 연구이다.
다른 접근동일한 LLM reasoning 강화를 위한 SFT+RL 파이프라인을 다른 방식으로 구성한 접근이다.
다른 접근reward model 없이 step-level 오류 국소화를 수행하는 유사한 문제의식
다른 접근의료 도메인에서의 멀티모달 추론 및 grounding 기법을 다루는 연관 연구
다른 접근강화학습 기반 조합 탐색 문제를 다룬다는 점에서 유사하다.
다른 접근SFT curriculum과 RL 단계 결합 전략이 유사한 확장 연구이다.
후속 연구test-time scaling을 활용한 reasoning 향상 기법을 확장하여 적용한 연구이다.