WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning

저자: Zhepei Wei, Wenlin Yao, Yao Liu, Weizhi Zhang, Qin Lu | 날짜: 2025 | DOI: 10.48550/arXiv.2505.16421 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

웹 에이전트(Web Agent) 학습을 위한 종단 간(End-to-End) 다중턴 강화학습 프레임워크를 제안하며, 동적 컨텍스트 압축과 병렬 궤적 생성을 통해 실제 웹 환경에서의 장기 의사결정을 효과적으로 수행하도록 훈련한다.

Motivation

Achievement

Figure 1: Comparison between existing methods and our WEBAGENT-R1 on the WebArena-Lite benchmark.

WebArena-Lite 벤치마크에서 기존 방법 대비 WebAgent-R1의 성능 비교

  1. 성능 향상: Qwen-2.5-3B를 6.1%에서 33.9%로, Llama-3.1-8B를 8.5%에서 44.8%로 성공률 향상. GPT-4o, OpenAI o3 등 강력한 프롬프팅 기반 모델을 능가한다.
  2. 확장성: 다양한 모델 크기(3B~32B)에서 일관되게 우수한 성과를 입증하며, 온폴리 방식으로 외부 감독(예: GPT-4 기반 보상 모델) 없이 자체적으로 완성된 학습이 가능하다.

How

Figure 2: Overview of the end-to-end multi-turn RL training framework used in WEBAGENT-R1.

WebAgent-R1의 종단 간 다중턴 RL 훈련 프레임워크 개요

핵심 메커니즘

상호작용 형식

```

Web: [Task] + [HTML content]

Agent: <think> reasoning </think> <answer> do('Action') </answer>

Web: [Updated HTML]

...반복...

Agent: exit(message='Task Completed')

```

Originality

Limitation & Further Study

Evaluation

Novelty: 4.5/5 Technical Soundness: 4/5 Significance: 4.5/5 Clarity: 4/5 Overall: 4.25/5

총평: 본 논문은 웹 에이전트 학습의 실무적 과제(메모리, 외부 감독)를 창의적으로 해결하여 상당한 성능 향상을 달성했으며, 온폴리 강화학습의 다중턴 상호작용 환경으로의 확장을 성공적으로 입증한 의미 있는 기여이다.

같이 보면 좋은 논문

기반 연구비전-언어 통합 에이전트로 웹 에이전트 학습을 확장한 연구이다.
다른 접근웹 에이전트 훈련을 위한 다른 멀티모달 접근법을 제시한다.
기반 연구강화학습 기반 에이전트 훈련의 기초 프레임워크를 제공한다.
다른 접근유사한 자기 학습 프레임워크를 다른 방식으로 구현한다.
다른 접근웹 에이전트 훈련을 위한 다른 강화학습 프레임워크를 제시한다.
후속 연구웹 에이전트 학습을 위한 강화학습 방법을 확장한 연구이다.
다른 접근WebAgent-R1 논문은 다언어적 웹 상호작용 평가 벤치마크로 유사 구조를 가지면서, 다른 평가 환경/방식에 중점을 둡니다.
다른 접근다른 방식으로 LLM의 추론 능력을 향상시키는 대안적 접근을 다룬다.
후속 연구에이전트 기반 작업 해결의 기초적 프레임워크를 제공한다.
후속 연구SPECTER2 유사도 0.93로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.90로 Scientific Machine Learning for Dynamics와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.94로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.91로 Scientific Machine Learning for Dynamics와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구다중턴 강화학습 프레임워크를 확장한 연구이다.
후속 연구SPECTER2 유사도 0.93로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드