Learn Hard Problems During RL with Reference Guided Fine-tuning

저자: Yangzhen Wu, Shanda Li, Zixin Wen, , Ameet Talwalkar, Yiming Yang, Wenhao Huang, Tianle Cai | 날짜: 2026 | URL: https://openreview.net/forum?id=G5kXgjF7Yj 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Comparison of ReFT and ReGFT. Top: ReFT fine-tunes the model using verified correct trajectories obtained from

ReGFT는 어려운 수학 문제에 대해 참조 해답(reference solution)의 부분적 힌트를 모델에 제공하여 모델 스스로 정합적인 추론 경로(trajectory)를 생성하게 한 뒤, 이를 RL 이전에 SFT로 학습시켜 RL 단계에서의 보상 희소성(reward sparsity) 문제를 완화하는 방법이다.

Motivation

Achievement

Figure 2

Figure 2. Reinforcement learning performance over training steps on three challenging benchmarks. Models initialized wit

  1. RL 수렴 가속 및 성능 상한 상승: AIME 2024, AIME 2025, Beyond-AIME 세 가지 벤치마크에서 ReGFT로 초기화된 모델이 raw checkpoint 및 ReFT 대비 RL 학습 전반에 걸쳐 더 빠른 초기 성능 향상과 더 높은 최종 정확도를 일관되게 달성했다.
  2. 단순 SFT의 한계 입증: 참조 해답에 대한 직접 SFT만으로는 성능 향상이 불충분하며, 참조에 의해 guide되지만 모델 자신의 생성 과정과 정합적인 trajectory로 학습하는 것이 견고한 학습과 일반화에 필수적임을 실험적으로 보였다.
  3. 추론 시점 확장성(inference-time scaling) 개선: pass@k 분석에서 RL이 모델의 pass@k 성능을 향상시키며, ReGFT는 모든 연산 예산(compute budget)에서 안정적이고 지속적인 개선을 보이는 반면 ReFT의 성능 향상은 낮은 k 영역에 국한됨을 확인했다.

How

Figure 1

Figure 1. Comparison of ReFT and ReGFT. Top: ReFT fine-tunes the model using verified correct trajectories obtained from

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: RL 이전의 초기화 단계에서 참조 해답을 부분적으로 활용해 모델의 자체 추론 분포와 정합적인 trajectory를 합성함으로써 보상 희소성 문제를 효과적으로 완화하는 실용적이고 간단하면서도 효과가 명확한 방법을 제시한 논문이다. 다만 방법의 세부 설계 선택(부분 참조 비율 등)에 대한 심층 분석과 다양한 도메인으로의 일반화 검증이 추가된다면 더욱 완성도 높은 연구가 될 것이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 Formal Methods and Computational Reasoning가 맞닿아, 'Deepseek-prover: Advancing theorem proving in llms through large-scale synthetic data'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 Formal Methods and Computational Reasoning가 맞닿아, 'Lean-star: Learning to interleave thinking and proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구RL 기반 추론 학습의 기초적 프레임워크를 공유한다.
기반 연구finite-sample 오류 제어 기법을 확장한 연구이다.
기반 연구SFT 이후 RL 적용이라는 학습 파이프라인의 방법론적 기반을 제공하는 것으로 추정됨
기반 연구강화학습 기반 회로 최적화를 실제 산술 회로 설계에 적용한 연구이다.
기반 연구planning-execution 단계 분리 문제를 확장하여 다룸
기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 Formal Methods and Computational Reasoning가 맞닿아, 'Accelerating Scientific Research with Gemini: Case Studies and Common Techniques'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근어려운 문제 학습을 위한 다른 RL 강화 전략을 제시한다.
다른 접근어려운 수학 문제 해결을 위한 RL 훈련의 다른 접근법으로 보임.
다른 접근RL 학습 파이프라인 개선이라는 유사한 목표를 다루는 Lean 관련 연구로 추정됨
다른 접근수학 문제 해결을 위한 학습 방법론이라는 공통 배경을 가진 관련 연구
다른 접근RL 학습에서의 탐색/보상 문제를 다른 각도에서 다룬다.
후속 연구RL 이전 SFT 활용 전략을 확장하는 연구로 추정됨.
후속 연구reward sparsity 문제 해결을 위한 방법을 확장한다.
후속 연구symbolic verification 기반 보상 게이팅의 기초를 제공
응용 사례SFT-RL 결합 학습 전략의 실제 적용 사례이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드