Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance

저자: Kai Yan, Alex Schwing, Yu-Xiong Wang | 날짜: 2026 | URL: https://openreview.net/forum?id=dv6Q569DQe 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Overview of our work. We introduce a few-shot demonstration-guided RLVR paradigm to address three primary chal

RLVR에서 SFT 데이터가 매우 적을 때(단 128개)도 성능을 크게 끌어올리는 few-shot demonstration-guided RLVR 알고리즘 FEST를 제안하며, supervised signal·on-policy signal·decaying weight라는 세 요소가 이를 가능케 함을 밝힌다.

Motivation

Achievement

Figure 3

Figure 3. Performance scalability across varying shot counts.

  1. FEST 알고리즘 제안: 단 128개의 무작위 선택 demonstration만으로 여러 수학 벤치마크에서 기존 baseline 대비 수십~수백 배 적은 SFT 데이터로 동등하거나 더 우수한 성능을 달성.
  2. 세 가지 핵심 요소 규명: supervised signal, on-policy signal, decaying weight가 few-shot 환경에서 필수적임을 실험적으로 검증.
  3. 이론적 확장: HPT의 unified post-training 프레임워크를 DPO를 포함하도록 이론적으로 확장(Appendix B.3).
  4. FEST-GRPO 변형 개발: DPO와 GRPO 간 gradient 단위 불일치를 해결하는 대안적 손실 함수 설계.
  5. 다양한 벤치마크 실증 검증: 여러 강력한 baseline과 비교하여 FEST의 일관된 성능 우위를 확인.

How

Figure 2

Figure 2. Gradient norm comparison between DPO and GRPO

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: SFT 데이터 확보 비용이라는 실질적 병목을 겨냥해 단 128개의 무작위 demonstration만으로 demonstration-guided RLVR의 효과를 재현한 실용적이고 참신한 연구로, 세 가지 핵심 요소에 대한 명확한 분석과 이론적 확장이 돋보인다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구모션 임밋에이션 오류 분석을 확장하는 후속 연구로 추정된다.
기반 연구on-policy signal과 decaying weight 개념의 이론적 토대 제공
다른 접근SFT 데이터가 제한된 상황에서의 RL 알고리즘 개선이라는 유사한 접근
다른 접근RLVR에서 few-shot demonstration 활용이라는 동일한 문제를 다루는 관련 연구
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드