Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning

저자: Shubham Parashar, Shurui Gui, Xiner Li, Hongyi Ling, Sushil Vemuri | 날짜: 2025 | DOI: 10.48550/arXiv.2506.06632 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

Figure 2

E2H Reasoner의 작업 분해: 학습이 진행됨에 따라 자명(Trivial) → 쉬움(Easy) → 중간(Medium) → 어려움(Hard) 작업으로 점진적 전환

본 논문은 대규모 언어모델(LLM)의 추론 능력을 강화학습(RL)과 커리큘럼 학습을 결합하여 개선하는 E2H Reasoner 방법을 제시한다. 작업을 난이도별로 분해하고 확률적 스케줄러를 통해 쉬운 작업에서 어려운 작업으로 점진적 학습을 수행함으로써, 단순 RL만으로는 해결 불가능한 추론 문제를 학습 가능하게 한다.

Motivation

Achievement

Figure 1

Pass@k 평가에서 E2H가 기저 모델을 상회: (a) Countdown, (b) Blocksworld, (c) LLaMA 3.2 3B의 추론 예시

  1. 실증적 성과: 5개 추론 작업(Blocksworld, Countdown, MATH, AQuA, GSM8K)에서 최고 성능(SOTA) 달성. 특히 기저 모델이 0-shot으로 해결 불가능한 문제까지 학습하여 높은 pass@k 값 달성
  2. 이론적 보장: Approximate Policy Iteration 프레임워크 내에서 E2H Reasoner의 수렴성을 증명하고, 적절하게 분해된 작업을 통한 커리큘럼 학습이 직접 학습보다 적은 표본으로도 수렴 가능함을 보였다 (finite-sample complexity bound 도출)
  3. 일반화 능력: 커리큘럼 학습을 통해 모델이 분포 내 난제뿐만 아니라 분포 외(OOD) 작업으로의 일반화 능력을 강화

How

Figure 3

코사인 기반 스케줄링 메커니즘 (Gaussian Sampler를 통한 동적 작업 비중 조정)

방법론의 핵심 요소:

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 3/5 Clarity: 4/5 Overall: 4/5

총평: 본 논문은 커리큘럼 강화학습을 통한 LLM 추론 능력 개선에 대한 실용적 방법과 이론적 기반을 모두 제시한 우수한 작업이다. 특히 Gaussian Sampler 기반 동적 스케줄링과 수렴성 증명은 기여도가 높으나, 평가 범위의 제한(소규모 모델 중심)과 작업 분해 휴리스틱의 명확한 지침 부재가 일반화 가능성을 감소시킨다.

같이 보면 좋은 논문

기반 연구과학적 추론을 위한 vision-language 모델을 확장한 후속 연구로 보임
다른 접근강화학습 기반 LLM 학습 방법의 대안적 접근을 제시함
다른 접근LLM 추론 능력 향상을 위한 강화학습 기반 접근법을 다룬다.
다른 접근LLM의 추론 성능 개선을 위한 RL 기법 확장 연구임
다른 접근커리큘럼 학습을 통한 단계적 난이도 조정 방법론을 공유함
후속 연구SPECTER2 유사도 0.94로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.91로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드