Learning to Explore with Parameter-Space Noise: A Deep Dive into Parameter-Space Noise for Reinforcement Learning with Verifiable Rewards

저자: Bizhe Bai, Xinyue Wang, Peng Ye, Tao Chen | 날짜: 2026 | URL: https://openreview.net/forum?id=k9AEQlEqLD 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Comparison of reasoning capability boundaries across different RLVR paradigms. (1) Standard GRPO-trained model

RLVR(Reinforcement Learning with Verifiable Rewards) 학습이 rollout 다양성을 저하시켜 exploration ceiling을 만든다는 문제를 지적하고, rollout policy의 파라미터에 직접 노이즈를 주입하는 Parameter-Space Noise(PSN)를 GRPO에 결합한 PSN-GRPO를 제안한다.

Motivation

Achievement

Figure 1

Figure 1. Comparison of reasoning capability boundaries across different RLVR paradigms. (1) Standard GRPO-trained model

  1. Exploration 회복 및 확장: PSN-GRPO는 GRPO 대비 semantic diversity와 operation diversity를 회복·증대시키고, high-budget pass@k(예: k=256)를 크게 개선하며 Pass@k, RLVR-Decomposed 같은 exploration 지향 기법들을 능가한다.
  2. 모델 범용성 검증: Qwen2.5, Qwen3, Llama-3.1 등 여러 모델 계열에서 효과를 확인했다.
  3. OOD 강건성: 학습 분포 밖의 과학 및 코딩 벤치마크에서도 견고한 성능을 보인다.
  4. 정성적 새로움 발견: 원래 모델이 풀지 못했던 문제에 대해 새로운 해법 관점을 발견함을 정성 분석으로 보였다.

How

Figure 2

Figure 2. Overview of the PSN-RLVR framework compared to

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: RLVR의 exploration ceiling 문제를 파라미터 공간 노이즈라는 새로운 각도에서 접근해 실용적이고 경량화된 해법(TIS, adaptive noise scheduler)을 제시했으며, 다양한 모델과 OOD 벤치마크에서 일관된 개선을 보여 학술적·실용적 가치가 높은 연구로 판단된다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Kimi k1.5: Scaling reinforcement learning with llms'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근복잡한 트리 탐색 없이 성능을 향상시키는 대안적 방법을 제안한다.
기반 연구SPECTER2 유사도 0.92로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구RLVR에서의 exploration 문제와 policy 다양성에 대한 이론적 기반을 제공한다.
기반 연구RL 기반 rollout 미분가능성을 확장하는 후속 연구이다.
기반 연구latent world model을 활용한 실제 물리 시스템 응용 사례로 보임
다른 접근rollout policy diversity 문제에 대한 유사한 문제의식을 공유하는 확장 연구로 볼 수 있음.
다른 접근RLVR rollout 다양성 저하 문제를 다루는 유사한 exploration 강화 기법을 제시하여 대안적 접근을 제공함.
다른 접근rollout 다양성 확보를 위한 다른 exploration 전략을 제안한다.
후속 연구multi-fidelity 최적화의 이론적 기초 제공
후속 연구on-policy signal과 decaying weight 개념의 이론적 토대 제공
반론/비판RLVR의 exploration ceiling 문제에 대해 다른 관점에서 분석한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드