Reinforcement Learning from Rich Feedback with Distributional DAgger

저자: Rishabh Agrawal, Jacob Fein-Ashley, Paria Rashidinejad | 날짜: 2026 | URL: https://openreview.net/forum?id=Cj42HfWCyx 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Validation Best@16 (top) and Maj@16 (bottom) over training for RL with self-distillation algorithm SDPO (Hübot

본 논문은 RLVR의 단일 비트 보상 대신 rich feedback(실행 흔적, 도구 출력, 전문가 교정 등)을 활용하기 위해 고전적 imitation learning 알고리즘 DAgger의 distributional 변형인 DistIL을 제안하고, forward cross-entropy 목적함수가 기존 self-distillation 방식과 달리 monotonic policy improvement와 regret 보장을 갖는다는 것을 이론적·실증적으로 보인다.

Motivation

Achievement

Figure 1

Figure 1. Validation Best@16 (top) and Maj@16 (bottom) over training for RL with self-distillation algorithm SDPO (Hübot

  1. 이론적 한계 규명: f-divergence 기반 self-distillation(reverse-KL, JS)이 teacher가 더 우수해도 monotonic policy improvement를 보장하지 못하며 local credit assignment로 인해 suboptimal policy로 수렴할 수 있음을 증명(Propositions 3.1-3.3).
  2. DistIL 알고리즘 제안: forward cross-entropy 기반의 distributional DAgger 변형으로 blackbox teacher를 허용하고 future-aware credit assignment를 수행하는 새로운 목적함수 설계.
  3. 이론적 보장 확립: DistIL이 monotonic policy improvement(Proposition 5.2), sublinear regret(Theorem 5.3), teacher-weighted maximum-likelihood RL lower bound 최적화(Proposition 5.4)를 만족함을 증명하여 Pass@N 향상의 원리적 근거 제공.
  4. 광범위한 실증 검증: 과학적 추론, 수학적 추론, 코딩 도메인에서 RLVR 및 SDPO, OPSD, GRPO 등 self-distillation 베이스라인 대비 일관된 성능 향상을 입증.

How

Figure 4

Figure 4. Comparison between DistIL (Ours) and CE. The difference between these methods lies in the credit assignment. C

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: RLVR의 credit assignment 한계와 기존 self-distillation의 이론적 결함을 명확히 규명하고, 이를 해결하는 이론적으로 탄탄하고 실용적인 DistIL 알고리즘을 제시한 우수한 연구로, imitation learning과 RLVR을 잇는 통찰력 있는 기여를 보인다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Reinforcement Learning Policy Optimization와 Molecular Simulation and Generative Modeling가 맞닿아, 'Iterative Distillation for Reward-Guided Fine-Tuning of Diffusion Models in Biomolecular Design'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구policy optimization 프레임워크를 확장한 관련 연구이다.
기반 연구강화학습 기반 다목적 최적화를 결정 구조 생성과 유사한 도메인에 적용한 연구이다.
기반 연구terminal reward 문제를 확장하여 다룬다.
기반 연구imitation learning 기반 RL 방법론의 이론적 기반이 되는 연구
다른 접근LLM 강화학습을 위한 policy gradient 개선의 유사한 접근법이다.
다른 접근로봇 정책 학습의 일반화 성능 개선을 위한 다른 접근법을 제시한다.
다른 접근RLVR의 대안으로 discrete diffusion policy를 사용하는 다른 접근법을 제시하는 밀접한 관련 연구
다른 접근RLVR의 단일 비트 보상 문제에 대한 다른 해결 방식을 제시하는 연구로 보인다.
후속 연구self-supervision을 통한 reward shaping의 이론적 토대를 제공한다
다른 접근전문가 교정 신호를 활용한 강화학습 알고리즘이라는 공통 주제를 다룬다.
다른 접근reasoning 모델 정제를 위한 다른 학습 전략을 제시한다.
다른 접근약한 지도 학습 신호로부터 신뢰성 있는 보상 모델을 학습시키는 유사한 프레임워크를 다룬다.
다른 접근control variate 기반 분산 감소의 다른 구현 방식
후속 연구rich feedback 활용 방법을 확장하는 후속 연구
다른 접근rollout policy diversity 문제에 대한 유사한 문제의식을 공유하는 확장 연구로 볼 수 있음.
후속 연구rigid-body dynamics 기반 policy-agnostic 평가 방법론의 기초를 제공한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드