VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators

저자: Hengtao Li, Pengxiang Ding, Runze Suo, Yihao Wang, Zirui Ge, Dongyuan Zang, Kexian Yu, Mingyang Sun, Hongyin Zhang, Donglin Wang, Weihua Su | 날짜: 2025-10-01 | URL: https://arxiv.org/abs/2510.00406 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1: The Framework of VLA-RFT. A world model functions as a simulator that processes

VLA-RFT는 데이터 기반 world model을 시뮬레이터로 활용하여 vision-language-action 모델을 reinforcement learning으로 효율적으로 fine-tuning하는 프레임워크이다. 검증된 reward를 기반으로 GRPO 최적화를 수행하여 400 단계 이하의 fine-tuning으로 strong supervised baseline을 초과하는 성능을 달성한다.

Motivation

Achievement

Figure 1

Figure 1: The Framework of VLA-RFT. A world model functions as a simulator that processes

How

Figure 2

Figure 2: Training Paradigm of VLA-RFT. In the pre-training stage, both the world model and

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: VLA-RFT는 world model 기반 reinforcement fine-tuning을 통해 효율성, 성능, robustness를 동시에 달성하는 실용적이고 창의적인 접근법을 제시한다. 극도로 제한된 fine-tuning 단계로 strong baseline을 초과하고 perturbed 환경에서 일관된 성능을 유지하는 점에서 높은 가치가 있으나, 실제 로봇 환경에서의 검증과 장기 horizon task에 대한 분석이 필요하다.

같이 보면 좋은 논문

기반 연구World Models(1631)은 환경의 생성 신경망을 RL policy에 활용한 기존 방법으로, 1619의 world-model-guided RL fine-tuning 아이디어의 근간이 된다.
기반 연구Guiding Pretraining in Reinforcement Learning with Large Language Models 논문은 VLA reinforcement fine-tuning에서 LLM 기반 guidance의 이론적 근거로 볼 수 있다.
기반 연구VLA-RFT는 Text2Reward와 같이 보상 함수를 개선하려는 강화학습 기반 미세조정 기법과 연결됨.
기반 연구Diffusion for World Modeling 논문은 world model 기반 강화학습 policy 튜닝의 데이터 모델링 측면에서 VLA-RFT의 이론적 기초 제공.
기반 연구VLA-RFT는 강화학습-파인튜닝 프레임워크를 제안해 RLinf-VLA의 RL 기반 통합 구조를 실세계에 더욱 효율적으로 적용시키는 고도화 사례를 보여줍니다.
다른 접근ConRFT(1338)는 contrastive reward를 통한 fine-tuning 기법을 사용해, 데이터 기반 world model 사용이라는 1619의 접근과 서로 다른 RL 정책 최적화 방식을 보여준다.
다른 접근VLA-RFT는 강화학습 기반의 VLA 파인튜닝을 다루며, Embodied-R1의 reinforced fine-tuning 방식과 유사 지점을 다른 관점으로 접근합니다.
다른 접근VLA-RFT는 Vision-Language-Action 모델의 reinforcement fine-tuning을 적용하여, monolithic/hierarchical 아키텍처에서 post-training의 대체적 방식을 보여준다.
다른 접근SimpleVLA-RL은 RL 기반 VLA 파인튜닝의 단순화와 스케일 확장에 초점을 맞추어, VLA-RFT와 다른 강화학습 접근을 보여준다.
후속 연구VLA-RL은 VLA-RFT의 미세조정(fine-tuning) 전략을 RL 환경에서 확장하고 실제 분포 외(OOD) 상황에 적용함.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드