RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models
저자: Jacky Kwok, Christopher Agia, Rohan Sinha, Matt Foutter, Shulu Li, Ion Stoica, Azalia Mirhoseini, Marco Pavone | 날짜: 2025-06-21 | URL: https://arxiv.org/abs/2506.17811📄 PDF
⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: arXiv 비독점 라이선스
Essence
Figure 1: Inference-Time Scaling Law: We observe that action error consistently decreases as we
Vision-Language-Action (VLA) 모델의 테스트 시간 성능을 향상시키기 위해 샘플링과 검증을 통한 스케일링 방법을 제시하며, action error가 생성 샘플 수에 따라 지수 거듭제곱 법칙을 따른다는 inference-time scaling law를 발견했다.
Motivation
Known: VLA 모델은 visuomotor control에서 뛰어난 능력을 보이지만 실제 환경에서의 robustness 문제가 있으며, LLM에서 test-time compute scaling이 성능 향상에 효과적임이 증명되었다.
Gap: VLA 모델에서 deployment 단계의 test-time compute scaling 효과가 체계적으로 연구되지 않았으며, action 샘플링과 검증을 통한 정확한 scaling law가 규명되지 않았다.
Why: 로봇 배포 시 견고성과 정밀성이 매우 중요하며, test-time scaling을 통해 기존 VLA 모델을 개선함으로써 실제 로봇 제어 성능을 크게 향상시킬 수 있다.
Approach: VLA에서 여러 action을 샘플링한 후 Gaussian perturbation과 majority voting으로 action proposal distribution을 구성하고, VLM 기반 verifier로 최적 action을 선택하는 RoboMonkey 프레임워크를 제안했다. 합성 데이터 생성 파이프라인으로 verifier를 학습시켰다.
Achievement
Figure 3: Scaling test-time compute significantly improves the precision and robustness of generalist robot
Inference-time scaling law 발견: action error와 샘플 수 간의 지수 거듭제곱 법칙을 CogACT, Octo, OpenVLA, SpatialVLA 등 다양한 VLA에서 실증했다.
RoboMonkey 프레임워크: 기존 VLA에 test-time scaling을 적용하여 out-of-distribution 작업에서 25% 절대 성능 향상, in-distribution 작업에서 9% 성능 향상을 달성했다.
합성 데이터 생성 파이프라인: 자동으로 synthetic action preferences를 생성하여 VLM 기반 verifier를 학습하고, 데이터셋 확대에 따른 일관된 성능 개선을 입증했다.
적응 학습 효과: 새로운 로봇 셋업 적응 시 VLA와 action verifier를 함께 fine-tuning하면 VLA만 fine-tuning할 때보다 7% 추가 성능 향상을 얻을 수 있음을 보였다.
How
Figure 2: Stage 1: Training the Action Verifier. Given an imitation learning dataset, we sample N
총평: VLA 모델의 test-time scaling 가능성을 체계적으로 규명하고 실용적인 RoboMonkey 프레임워크를 제안한 우수한 연구로, inference-time scaling law의 발견과 실제 로봇에서의 유의미한 성능 향상이 로봇 제어 분야에 큰 기여를 한다.