저자: Haozhan Li, Yuxin Zuo, Jiale Yu, Yuhao Zhang, Zhaohui Yang, Kaiyan Zhang, Xuekai Zhu, Yuchen Zhang, Tianxing Chen, Ganqu Cui, Dehui Wang, Dingxiang Luo, Yuchen Fan, Youbang Sun, Jia Zeng, Jiangmiao Pang, Shanghang Zhang, Yu Wang, Yao Mu, Bowen Zhou, Ning Ding | 날짜: 2025-09-11 | URL: https://arxiv.org/abs/2509.09674 📄 PDF
Essence
Figure 1 | Overview of SimpleVLA-RL. SimpleVLA-RL is an efficient RL framework for VLA that im-
SimpleVLA-RL은 Vision-Language-Action 모델의 학습을 강화학습(RL)을 통해 확장하는 효율적인 프레임워크로, 데이터 부족 문제를 해결하고 실제 로봇 작업에서 SFT를 능가하는 성능을 달성한다.
Evaluation
Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: SimpleVLA-RL은 RL을 VLA 학습에 효과적으로 적용하여 데이터 부족 문제를 해결하고 실제 로봇 성능을 향상시킨 중요한 기여이며, "pushcut" 현상의 발견은 새로운 연구 방향을 제시한다. 다만 계산 비용과 실제 환경 검증의 확대가 향후 과제이다.
같이 보면 좋은 논문
기반 연구SimpleVLA-RL은 RLBench 등 기존 시뮬레이션 환경에서 VLA 기반 정책 학습의 대규모 실험을 수행한다.
기반 연구LM-Nav: Robotic Navigation with Large Pre-Trained Models of Language, Vision, and Action은 대규모 프리트레이닝된 멀티모달 정책을 RL 기반 네비게이션에 적용한 프레임워크를 기술한다.
기반 연구Diffusion Policy(1362)는 vision-language-action 모델에 diffusion 기반 행동 정책 학습을 적용한 주요 이론적 기반을 제공한다.
기반 연구SimpleVLA-RL은 강화학습 기반 VLA 모델의 대규모 학습 프레임워크로 다양한 오프라인 데이터셋(BrideData V2 등)과의 호환성을 강조한다.
기반 연구Evaluating Real-World Robot Manipulation Policies in Simulation은 RL 정책의 실제 및 시뮬레이션 평가 프레임워크를 제공하여, SimpleVLA-RL의 RL 기반 확장 및 평가 방법론에 이론적 기반을 제공한다.
다른 접근Bridging Language and Action(1324)는 VLM-RL간의 연결을 다양한 시나리오와 평가 방법을 통해 접근하여, SimpleVLA-RL의 RL기반 학습의 대안 프레임워크이다.
다른 접근ManiSkill3는 GPU 병렬 처리 기반 로봇 시뮬레이션 플랫폼으로, SimpleVLA-RL의 병렬 GPU 시뮬레이션 기반 RL 확장과 유사 문제를 상이한 벤치마크 및 환경에서 다룬다.
다른 접근SimpleVLA-RL은 강화학습 기반 VLA 훈련에 집중하는 반면, V-JEPA 2는 자체 지도 비디오 프리트레이닝을 통한 이해·예측에 중점을 두어 학습 방식과 범위 면에서 대조적이다.
다른 접근RLinf-VLA: A Unified and Efficient Framework for Reinforcement Fine-Tuning of Vision-Language-Action Models는 RL 기반 VLA 정책 학습/적용을 다루며 SimpleVLA-RL과 직접적으로 비교된다.