The Role of Feedback Alignment in Self-Distillation

저자: Semih Kara, Oguzhan Ersoy | 날짜: 2026 | URL: https://openreview.net/forum?id=KNwvVyPs2N 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 3

Figure 3. Fully-correct rollout. Per-token advantage ASD

reward model 학습 없이 self-distillation의 context로 step-aligned critique를 사용하면, PRM처럼 오류가 발생한 step에 정확히 국소화된 per-token advantage를 만들어낼 수 있음을 보인 연구이다.

Motivation

Achievement

Figure 2

Figure 2. STEPALIGNFB matches or exceeds GRPO and REFSOL on OpenMathReasoning. REFSOL conditions the teacher on the

  1. STEPALIGNFB의 우월한 성능: OpenMathReasoning 필터링 부분집합의 평가셋에서 STEPALIGNFB가 GRPO 대비 Avg@12 기준 16.11점, REFSOL 대비 5.27점 높은 성능을 달성하며 모든 aggregation-style accuracy metric에서 두 baseline을 능가함.
  2. 암묵적 process supervision 효과 규명: per-token advantage 분석을 통해 STEPALIGNFB가 오류가 발생한 위치 근처 token에 distributional shift를 집중시켜 PRM과 유사한 국소화 효과를 reward model 학습 없이 제공함을 보임.
  3. feedback alignment의 중요성 제시: 완전하고 정확한 reference solution조차 solver의 실제 trace와 surface form에서 divergence가 있으면 신호가 diffuse해짐을 보여, feedback의 내용 품질뿐 아니라 solver trace와의 정렬(alignment) 자체가 credit assignment 품질에 핵심적임을 실증함.

How

Figure 4

Figure 4. Incorrect step. Per-token advantages for a rollout containing an arithmetic/reasoning error at the step marked

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: reward model 학습 없이도 feedback을 solver trace에 정렬시키는 것만으로 process supervision과 유사한 국소화된 credit assignment를 얻을 수 있음을 명확한 실험 설계와 advantage 분석으로 설득력 있게 보여준 워크숍급 논문으로, 실용적 파급력이 크지만 검증 범위가 제한적이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'ReTool: Reinforcement Learning for Strategic Tool Use in LLMs'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'RM-R1: Reward Modeling as Reasoning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구수학 문제 채점에 LLM judge 전략을 실제 적용한 연구이다.
후속 연구self-distillation을 통한 PRM 대체 방법을 확장하여 제시
기반 연구SFT-RL 결합 학습 전략의 실제 적용 사례이다.
기반 연구token-level entropy 신호 활용을 확장한 연구이다.
후속 연구step-aligned critique를 활용한 세밀한 advantage 추정을 확장한 연구이다.
다른 접근reward model 없이 step-level 오류 국소화를 수행하는 유사한 문제의식
다른 접근label-free RLVR을 위한 다른 검증 기반 보상 설계
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드