SEAD: Competence-Aware On-Policy Distillation via Entropy-Guided Supervision

저자: Chia-Hsuan Lee, Zelei Cheng, Yu Wang, Renkun Ni, Sambit Sahu, Shi-Xiong Zhang, William M. Campbell | 날짜: 2026 | URL: https://openreview.net/forum?id=ujbngu2N8p 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

SEAD는 on-policy distillation(OPD)에서 teacher 지도 품질이 student의 competence에 의존한다는 구조적 문제를, teacher-student 결합 entropy를 단일 관찰량으로 활용해 token/temporal/prompt 세 가지 스케일에서 동시에 해결하는 프레임워크이다. Zone 기반 sparse divergence 선택, cosine annealing schedule, competence-gated curriculum을 결합해 OLMo-3 (7B→32B)에서 vanilla OPD 대비 평균 +4.8 정확도 향상을 달성한다.

Motivation

Achievement

Figure 2
  1. SEAD 프레임워크 제안: joint teacher-student entropy를 이용해 token을 Zone A(skip), Zone B(RKL), Zone C(FKL)로 분할하는 sparse entropy-adaptive divergence 메커니즘을 도입해 약 50%의 token에서 gradient 계산을 생략한다.
  2. Competence-driven annealing: 학습 진행에 따라 forward KL에서 reverse KL로 전환되는 연속적 cosine schedule을 도입해 기존의 수동 two-stage 전환 방식을 대체한다.
  3. Competence-gated curriculum: OPD를 위해 특별히 설계된 최초의 prompt-level curriculum을 제안하여 student의 competence frontier 내의 prompt만 선택적으로 학습에 사용한다.
  4. 성능 향상: OLMo-3(7B→32B) 및 Nemotron(8B→49B) 모델군에서 MATH-500, AIME 2024/2025, AMC 2023, OlympiadBench 등 6개 수학 벤치마크에 대해 vanilla OPD 대비 평균 +4.8 정확도 향상, 특히 AIME24(+7.7), AIME25(+7.9)에서 큰 개선을 달성했다.
  5. Super-additive interaction 확인: ablation 실험을 통해 세 컴포넌트(Token Zones, Annealing, Curriculum)가 결합될 때 개별 적용 대비 20배의 상승효과(super-additive interaction)를 보임을 검증했다.

How

Figure 1

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: OPD의 competence-dependent supervision 문제를 entropy라는 단일 관찰량으로 통합 진단하고 세 스케일(token, temporal, prompt)에서 상호 보완적으로 해결한 점이 이론적·실용적으로 설득력 있으며, super-additive 상호작용을 실험적으로 입증한 ablation이 강점이다. 다만 일반화 가능성과 hyperparameter 민감도에 대한 추가 검증이 필요해 보인다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 Scientific Information Extraction and QA가 맞닿아, 'Deepseek-v3 technical report'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Agent Reasoning Training와 Scientific Information Extraction and QA가 맞닿아, 'Phi-4 technical report'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 Scientific Information Extraction and QA가 맞닿아, 'Qwen2.5 technical report'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구teacher-student distillation의 기본 프레임워크를 제공한다.
다른 접근teacher-student distillation에서 student의 상태(competence/forgetting)를 고려한 적응적 distillation 기법이라는 공통점이 있다.
다른 접근둘 다 self-distillation을 활용해 reward/teacher 신호를 dense signal로 변환하는 대안적 접근을 제시한다.
다른 접근federated learning을 의료 영상 도메인에 적용하는 유사한 문제를 다른 방식으로 해결한다.
다른 접근on-policy distillation 문제를 다른 competence-aware 방식으로 접근한다.
후속 연구entropy 기반 guidance를 활용한 distillation 방법을 확장한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드