저자: Yangzhen Wu, Shanda Li, Zixin Wen, , Ameet Talwalkar, Yiming Yang, Wenhao Huang, Tianle Cai | 날짜: 2026 | URL: https://openreview.net/forum?id=G5kXgjF7Yj 📄 PDF
라이선스: OpenReview 공개(오픈액세스)
Figure 1. Comparison of ReFT and ReGFT. Top: ReFT fine-tunes the model using verified correct trajectories obtained from
ReGFT는 어려운 수학 문제에 대해 참조 해답(reference solution)의 부분적 힌트를 모델에 제공하여 모델 스스로 정합적인 추론 경로(trajectory)를 생성하게 한 뒤, 이를 RL 이전에 SFT로 학습시켜 RL 단계에서의 보상 희소성(reward sparsity) 문제를 완화하는 방법이다.
Figure 2. Reinforcement learning performance over training steps on three challenging benchmarks. Models initialized wit
Figure 1. Comparison of ReFT and ReGFT. Top: ReFT fine-tunes the model using verified correct trajectories obtained from
총평: RL 이전의 초기화 단계에서 참조 해답을 부분적으로 활용해 모델의 자체 추론 분포와 정합적인 trajectory를 합성함으로써 보상 희소성 문제를 효과적으로 완화하는 실용적이고 간단하면서도 효과가 명확한 방법을 제시한 논문이다. 다만 방법의 세부 설계 선택(부분 참조 비율 등)에 대한 심층 분석과 다양한 도메인으로의 일반화 검증이 추가된다면 더욱 완성도 높은 연구가 될 것이다.