DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research

저자: Rulin Shao, Akari Asai, Shannon Zejiang Shen, Hamish Ivison, Varsha Kishore, Jingming Zhuo, Xinran Zhao, Molly Park, Samuel G. Finlayson, David Sontag, Tyler Murray, Sewon Min, Pradeep Dasigi, Luca Soldaini, Faeze Brahman, Wen-tau Yih, Tongshuang Wu, Luke Zettlemoyer, Yoon Kim, Hannaneh Hajishirzi, Pang Wei Koh | 날짜: 2026 | URL: https://openreview.net/forum?id=97NEP1pyS3 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 2

Figure 2. Training with RLER. Given an instance, the policy LM πθt samples rollouts by interacting with the environment.

Deep research agent 학습을 위해 rubric이 policy model과 함께 co-evolve하는 RLER(Reinforcement Learning with Evolving Rubrics)을 제안하고, 이를 통해 fully open 8B 모델인 DR Tulu-8B를 학습시켜 long-form deep research 벤치마크에서 open 모델을 능가하고 proprietary 모델과 대등한 성능을 훨씬 낮은 비용으로 달성했다.

Motivation

Achievement

Figure 1

Figure 1. Performance vs. cost of deep research models. We

  1. DR Tulu-8B 개발: 고품질 natural user data로 SFT 후 RLER로 학습된 최초의 fully open, end-to-end long-form deep research 모델을 제시했다.
  2. 성능 우위: AstaBench-ScholarQA-CS2, DeepResearchBench, ResearchQA, HealthBench 등 4개 long-form DR 벤치마크에서 Tongyi DR 30B 등 기존 최강 open 8-32B 모델 대비 4.8-41.8%p 앞섰고, 평균적으로 Tongyi DR 대비 15.6% 우수했다.
  3. Proprietary 모델과 대등: OpenAI DR, Perplexity DR, Gemini3 Pro + Search 등 proprietary 시스템과 맞먹거나 능가했으며(OpenAI DR 대비 평균 0.7% 우위), 쿼리당 비용은 OpenAI DR 대비 약 1000배 저렴했다.
  4. 새 벤치마크 구축: 유전 변이의 치료 적합성을 평가하는 clinical deep research 데이터셋 GeneticDiseasesQA를 구축했고, 이 과제에서 DR Tulu-8B가 신뢰 가능한 인용을 생성하지 못하는 다른 open agent와 달리 proprietary DR agent와 경쟁력을 보였다.
  5. 도구 선택 능력 학습: 단일 hard-coded search tool에 의존하지 않고 과제별로 적절한 검색 도구를 선택하는 능력을 학습했다(SQAv2에서는 paper search 90%, DeepResearchBench에서는 web search/browsing 55%).
  6. 오픈 인프라 공개: 데이터, 코드, 모델과 함께 확장 가능한 deep research 라이브러리(dr-agent-lib) 및 plug-and-play multi-tool search 평가 스위트를 공개하여 비동기 tool call과 장기 horizon tool-use trajectory에 대한 scalable RL 학습 스택을 제공했다.

How

Figure 2

Figure 2. Training with RLER. Given an instance, the policy LM πθt samples rollouts by interacting with the environment.

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 5/5

총평: Rubric을 policy와 함께 co-evolve시키는 RLER은 long-form deep research를 위한 RL 보상 설계에 실질적이고 참신한 해법을 제시하며, 완전 공개된 모델·데이터·인프라와 함께 성능-비용 면에서 인상적인 결과를 보여준 매우 의미 있는 연구이다.

같이 보면 좋은 논문

기반 연구정책 전이 방법을 특정 로봇 도메인으로 확장한 연구로 보임.
기반 연구SPECTER2 유사도 0.95로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Webdancer: Towards autonomous information seeking agency'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구데이터 중심 웹 에이전트 학습의 기반이 되는 연구이다.
기반 연구meta-learning 기반 알고리즘 발견을 확장한 후속 연구로 추정됨
기반 연구rubric 기반 보상 체계를 특정 도메인 태스크에 실제 적용한 연구
응용 사례RLER 프레임워크를 실제 deep research 태스크에 적용한 사례이다.
기반 연구GRPO 기반 RL 정렬 기법을 의료 도메인에 확장 적용한다.
다른 접근policy와 평가 기준이 함께 진화하는 학습 프레임워크의 다른 구현을 제시한다.
다른 접근deep research agent 학습을 위한 다른 보상/평가 전략을 제안한다.
다른 접근의료 VLM에서 시각 토큰 효율화를 위한 다른 pruning 전략을 제시한다.
다른 접근에이전트의 경험 축적을 통한 효율적 학습이라는 유사 목표를 다른 도메인(약물 발견)에서 다룬다.
후속 연구LLM 강화학습 기반 추론 성능 향상의 이론적 토대를 제공한다.
후속 연구강화학습 기반 에이전트 훈련의 기초 프레임워크를 제공한다.
후속 연구강화학습 기반 멀티모달 에이전트 훈련의 기초를 제공한다.
응용 사례유사한 RL 기법을 다른 도메인 에이전트에 적용한 사례이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드