EMA Policy Gradient: Taming Reinforcement Learning for LLMs with EMA Anchor and Top-k KL

저자: Lunjun Zhang, Jimmy Ba | 날짜: 2026 | URL: https://openreview.net/forum?id=LqEUj1BJ4y 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Using EMA anchor policy and Top-k KL estimator sig-

고정된 anchor policy 대신 EMA(Exponential Moving Average) target network를 사용하고, KL 추정에 있어 exact KL과 sampled KL을 유연하게 보간하는 Top-k KL estimator를 도입해 LLM용 policy gradient 알고리즘(GRPO 등)의 성능과 샘플 효율성을 크게 개선한 연구이다.

Motivation

Achievement

Figure 5

Figure 5. EMA-PG not only learns faster and but reaches higher asymptotic performance on agentic tasks of Q&A with searc

  1. EMA anchor의 안정성 조건 도출: 고정 anchor 대신 EMA 기반 anchor policy를 사용할 때의 stability condition을 이론적으로 도출했다.
  2. Unbiased Top-k KL estimator 설계: TopkReverseKL, TopkForwardKL 등 임의의 k에서 KL 값과 gradient 모두 unbiased인 estimator(K3++, K4, K5 포함)를 구성하고 기존 K1/K2/K3의 한계를 규명했다.
  3. 수학 reasoning 성능 향상: R1-distilled Qwen-1.5B 기준 OlympiadBench에서 GRPO의 50.8% 대비 EMA-PG는 53.9%를 달성했다.
  4. Agentic search RL 성능 향상: Qwen-3B base로 검색엔진 기반 7개 Q&A 데이터셋에서 평균 33.3% 성능 향상을 보였으며, HotpotQA는 29.7%→44.1%, 2WikiMultiHopQA는 27.4%→40.1%, Bamboogle은 12.8%→33.1%로 향상되었다.
  5. 학습 속도 및 최종 성능 동시 개선: EMA-PG가 더 빠르게 학습할 뿐 아니라 더 높은 asymptotic performance에 도달함을 보였다.

How

Figure 2

Figure 2. Top-k KL computes exact KL on the top-k indices, and adds a masked sampled KL to keep the estimator unbiased.

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: EMA anchor와 Top-k KL이라는 간단하면서도 이론적으로 뒷받침된 두 가지 수정만으로 GRPO 대비 수학 reasoning과 agentic search RL 모두에서 눈에 띄는 성능 향상을 보인 실용적이고 완성도 높은 연구이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근커리큘럼 학습을 통한 단계적 난이도 조정 방법론을 공유함
기반 연구SPECTER2 유사도 0.94로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구generator-reviser 구조를 확장하거나 응용하는 후속 연구로 볼 수 있다
다른 접근동일한 LLM RL 안정화 문제를 다른 방식으로 해결한다.
기반 연구instance-specific 특성 시간 개념을 확장한 후속 연구이다.
기반 연구KL 추정 및 policy gradient의 이론적 토대를 제공한다.
후속 연구on-policy distillation의 gradient estimator 이론적 기초 제공
다른 접근LLM 강화학습 스케일링이라는 동일 문제를 다른 방식으로 접근함
다른 접근LLM 강화학습을 위한 policy gradient 개선의 유사한 접근법이다.
후속 연구imitation learning 기반 RL 방법론의 이론적 기반이 되는 연구
다른 접근distributional matching을 통한 안정적 정책 학습이라는 핵심 방법론을 공유한다.
다른 접근생물학적 학습 규칙과 인공 신경망 학습 동역학 간의 관계를 다루는 대안적 접근이다.
다른 접근LLM에 경량 모듈을 추가해 추론 능력을 부여하는 유사한 plug-and-play 접근을 제시한다.
다른 접근KL 추정 방식 개선을 통한 LLM RL 최적화라는 동일한 문제를 다룬다.
다른 접근결정 구조 생성을 위한 다목적 강화학습의 다른 접근법을 제시함
다른 접근강화학습 이론의 기계 검증을 다른 정리에 적용한 유사 사례이다.
후속 연구latent reasoning state 모델링의 이론적 기반을 제공한다.
후속 연구EMA 기반 target network 활용을 확장한 정책 최적화 방법이다.
후속 연구goal-conditioned MDP와 HER 기법의 이론적 배경을 제공한다.
후속 연구MDLM 정책 최적화의 이론적 기반을 제공한다.
반론/비판RLVR의 exploration ceiling 문제에 대해 다른 관점에서 분석한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드