Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision

저자: Yinghui He, Simran Kaur, Adithya Bhaskar, Yongjin Yang, Jiarui Liu, Narutatsu Ri, Liam H Fowl, Abhishek Panigrahi, Danqi Chen, Sanjeev Arora | 날짜: 2026 | URL: https://openreview.net/forum?id=Tdq9dzhVdy 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. We introduce SD-ZERO, an on-policy self-distillation paradigm where the teacher (reviser) can condition on inc

SD-ZERO는 단일 모델이 Generator와 Reviser 두 역할을 수행하도록 학습시켜, binary reward를 dense token-level self-supervision으로 변환하는 self-distillation 기법이다. 외부 teacher나 고품질 demonstration 없이 RLVR보다 훨씬 sample-efficient하게 math/code reasoning 성능을 향상시킨다.

Motivation

Achievement

Figure 5

Figure 5. Self-evolved reasoning through teacher synchroniza-

  1. 10% 이상 성능 향상: Qwen3-4B-Instruct와 Olmo-3-7B-Instruct에서 base model 대비 각각 10.5%, 10.4%의 성능 향상을 달성했다.
  2. 강력한 baseline 대비 우위: 동일한 question set과 training sample budget 조건에서 RFT, GRPO, SDFT 등 강력한 baseline들을 능가했다.
  3. Phase 1만으로도 우수: SRT(Self-Revision Training) 단독으로도 동일 데이터 budget에서 모든 baseline을 능가하며, 6K self-generated revision trace만으로 Qwen3-4B-Instruct는 7.8%, Olmo-3-7B-Instruct는 9.2% accuracy 향상을 보였다.
  4. 효율성 개선: Phase 2(Self-Distillation)가 응답 길이를 약 2배 줄이면서 SRT 대비 추가 2.7%(Qwen), 1.2%(Olmo) 성능 향상을 가져왔고, 학습 시 질문당 하나의 응답만 필요해 sample efficiency를 크게 높였다.
  5. 반복적 self-evolution 발견: teacher를 주기적으로 갱신(synchronization)하면 revision 능력 향상이 다시 generation 성능으로 증류되어, 1 epoch 이후 teacher synchronization만으로 최소 3%의 추가 성능 향상을 얻을 수 있음을 보였다.

How

Figure 2

Figure 2. Overview of SD-ZERO. In Phase 1 (SRT), we collect 6K outcome-conditioned self-revision traces by sampling an i

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: binary reward를 dense token-level self-supervision으로 변환하는 self-generator-reviser paradigm은 외부 teacher 의존성을 제거하면서도 RLVR 대비 sample efficiency를 크게 높인 독창적이고 실용적인 기여로, post-training 연구에 의미 있는 방향을 제시한다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'BiasFilter: An inference-time debiasing framework for large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구self-supervision을 통한 reward shaping의 이론적 토대를 제공한다
다른 접근RLVR의 단일 비트 보상 문제에 대한 다른 해결 방식을 제시하는 연구로 보인다.
기반 연구self-distillation 기법을 활용한 지식 전달이라는 공통 기반을 가진다.
후속 연구self-distillation을 이용한 지식 전달이라는 방법론적 기반을 공유한다.
기반 연구policy gradient 기반 reasoning module 학습 방식을 확장한다.
다른 접근on-policy distillation에서 teacher 신호의 질을 개선하는 유사한 목표를 가진다.
다른 접근동일한 LLM RL 안정화 문제를 다른 방식으로 해결한다.
후속 연구generator-reviser 구조를 확장하거나 응용하는 후속 연구로 볼 수 있다
다른 접근On-Policy Distillation의 분산 문제를 다른 estimator 설계로 해결한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드