저자: Rulin Shao, Akari Asai, Shannon Zejiang Shen, Hamish Ivison, Varsha Kishore, Jingming Zhuo, Xinran Zhao, Molly Park, Samuel G. Finlayson, David Sontag, Tyler Murray, Sewon Min, Pradeep Dasigi, Luca Soldaini, Faeze Brahman, Wen-tau Yih, Tongshuang Wu, Luke Zettlemoyer, Yoon Kim, Hannaneh Hajishirzi, Pang Wei Koh | 날짜: 2026 | URL: https://openreview.net/forum?id=97NEP1pyS3 📄 PDF
Essence
Figure 2. Training with RLER. Given an instance, the policy LM πθt samples rollouts by interacting with the environment.
Deep research agent 학습을 위해 rubric이 policy model과 함께 co-evolve하는 RLER(Reinforcement Learning with Evolving Rubrics)을 제안하고, 이를 통해 fully open 8B 모델인 DR Tulu-8B를 학습시켜 long-form deep research 벤치마크에서 open 모델을 능가하고 proprietary 모델과 대등한 성능을 훨씬 낮은 비용으로 달성했다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 5/5
총평: Rubric을 policy와 함께 co-evolve시키는 RLER은 long-form deep research를 위한 RL 보상 설계에 실질적이고 참신한 해법을 제시하며, 완전 공개된 모델·데이터·인프라와 함께 성능-비용 면에서 인상적인 결과를 보여준 매우 의미 있는 연구이다.
같이 보면 좋은 논문
기반 연구정책 전이 방법을 특정 로봇 도메인으로 확장한 연구로 보임.
기반 연구SPECTER2 유사도 0.95로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Webdancer: Towards autonomous information seeking agency'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구데이터 중심 웹 에이전트 학습의 기반이 되는 연구이다.
기반 연구meta-learning 기반 알고리즘 발견을 확장한 후속 연구로 추정됨
기반 연구rubric 기반 보상 체계를 특정 도메인 태스크에 실제 적용한 연구
응용 사례RLER 프레임워크를 실제 deep research 태스크에 적용한 사례이다.
기반 연구GRPO 기반 RL 정렬 기법을 의료 도메인에 확장 적용한다.
다른 접근policy와 평가 기준이 함께 진화하는 학습 프레임워크의 다른 구현을 제시한다.
다른 접근deep research agent 학습을 위한 다른 보상/평가 전략을 제안한다.
다른 접근의료 VLM에서 시각 토큰 효율화를 위한 다른 pruning 전략을 제시한다.
다른 접근에이전트의 경험 축적을 통한 효율적 학습이라는 유사 목표를 다른 도메인(약물 발견)에서 다룬다.
후속 연구LLM 강화학습 기반 추론 성능 향상의 이론적 토대를 제공한다.
후속 연구강화학습 기반 에이전트 훈련의 기초 프레임워크를 제공한다.
후속 연구강화학습 기반 멀티모달 에이전트 훈련의 기초를 제공한다.
응용 사례유사한 RL 기법을 다른 도메인 에이전트에 적용한 사례이다.