VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning

저자: Guanxing Lu, Wenkai Guo, Chubin Zhang, Yuheng Zhou, Haonan Jiang, Zifeng Gao, Yansong Tang, Ziwei Wang | 날짜: 2025-05-24 | URL: https://arxiv.org/abs/2505.18719 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1: Previous VLAs focus on imitation learning that exploits the offline demonstrations, while VLA-RL ex-

본 논문은 사전학습된 Vision-Language-Action(VLA) 모델을 강화학습(RL)으로 개선하여 로봇 조작 작업의 분포 외(OOD) 시나리오 대응력을 향상시키는 VLA-RL 프레임워크를 제시한다. 궤적 수준의 RL 공식화와 robotic process reward model을 통해 LIBERO 벤치마크에서 OpenVLA-7B의 성능을 4.5% 향상시킨다.

Motivation

Achievement

Figure 4

Figure 4: Test-time Scaling Curve. We evaluate the fine-tuned OpenVLA-7B every 2500 training steps on the

How

Figure 2

Figure 2: The overall pipeline of VLA-RL, which is composed of a transformer-based policy, a homogeneous

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 본 논문은 LLM RL의 성공 사례를 로봇 도메인으로 창의적으로 확장하여 대규모 VLA 모델의 온라인 학습을 가능하게 하는 체계적인 프레임워크를 제시한다. LIBERO에서의 의미 있는 성능 향상과 테스트 타임 스케일링 증거는 로봇 학습의 새로운 방향을 제시하지만, 실물 로봇 검증이 필요하다.

같이 보면 좋은 논문

기반 연구Robotic Control via Embodied Chain-of-Thought Reasoning 논문은 trajectory 수준 강화학습과 일반화 능력 측면에서 VLA-RL의 이론적 동인 및 배경을 제공한다.
기반 연구VLA-RL은 범용적 VLN (Vision-Language Navigation) 프레임워크에서 zero-shot 정책을 다루므로, SmartWay의 실질적 내비게이션 성능 개선이 실제 파이프라인에 활용되는 예시가 된다.
기반 연구VLA-RL은 diffusion 혹은 flow-based policy를 실세계를 위한 general manipulation policy로 실질적으로 적용한 사례입니다.
기반 연구VLA-RL은 VLA-RFT의 미세조정(fine-tuning) 전략을 RL 환경에서 확장하고 실제 분포 외(OOD) 상황에 적용함.
기반 연구1620의 VLA-RL은 소형 VLA 구조의 RL 기반 조작 능력을 확장하여 DynamicVLA의 실시간 적용을 더욱 다양한 도메인으로 넓힌다.
기반 연구1474는 robot process reward learning과 사전학습 VLA 강화학습을 접목한 대표 논문으로, 1620이 LIBERO 벤치마크에서 경쟁하는 베이스라인 역할을 한다.
다른 접근Behavior Transformers(1316)는 행동 분포 모드를 통한 imitation 복수 정책 학습에 초점을 맞춰, 강화학습 중심의 1620과는 상이한 접근법을 제공한다.
다른 접근VLA-RL은 masterful/general manipulation을 위한 RL 기반 프레임워크로 L3MVN의 탐색 중심 정책 접근과 대조를 이룹니다.
다른 접근RoboAgent는 generalist 로봇 정책을 위한 효율성 측면에서, VLA-RL과 성능/일반화 측면에서 상호 비교가 가능하다.
다른 접근VLA-RL은 강화학습 기반 VLA 정책을 다루어, FLaRe의 대규모 behavior cloning 후 RL 미세조정 전략과 근접성을 갖지만 학습 방식이 다릅니다.
후속 연구ConRFT는 VLA-RL의 RL fine-tuning을 action constraint 기반으로 일반화하여 VLA-RL의 접근법을 보완, 확장할 수 있음.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드