Essence
Figure 1. Comparison of reasoning capability boundaries across different RLVR paradigms. (1) Standard GRPO-trained model
RLVR(Reinforcement Learning with Verifiable Rewards) 학습이 rollout 다양성을 저하시켜 exploration ceiling을 만든다는 문제를 지적하고, rollout policy의 파라미터에 직접 노이즈를 주입하는 Parameter-Space Noise(PSN)를 GRPO에 결합한 PSN-GRPO를 제안한다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: RLVR의 exploration ceiling 문제를 파라미터 공간 노이즈라는 새로운 각도에서 접근해 실용적이고 경량화된 해법(TIS, adaptive noise scheduler)을 제시했으며, 다양한 모델과 OOD 벤치마크에서 일관된 개선을 보여 학술적·실용적 가치가 높은 연구로 판단된다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.92로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Kimi k1.5: Scaling reinforcement learning with llms'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근복잡한 트리 탐색 없이 성능을 향상시키는 대안적 방법을 제안한다.
기반 연구SPECTER2 유사도 0.92로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구RLVR에서의 exploration 문제와 policy 다양성에 대한 이론적 기반을 제공한다.
기반 연구RL 기반 rollout 미분가능성을 확장하는 후속 연구이다.
기반 연구latent world model을 활용한 실제 물리 시스템 응용 사례로 보임
다른 접근rollout policy diversity 문제에 대한 유사한 문제의식을 공유하는 확장 연구로 볼 수 있음.
다른 접근RLVR rollout 다양성 저하 문제를 다루는 유사한 exploration 강화 기법을 제시하여 대안적 접근을 제공함.
다른 접근rollout 다양성 확보를 위한 다른 exploration 전략을 제안한다.
후속 연구multi-fidelity 최적화의 이론적 기초 제공
후속 연구on-policy signal과 decaying weight 개념의 이론적 토대 제공
반론/비판RLVR의 exploration ceiling 문제에 대해 다른 관점에서 분석한다.