RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models

저자: Jacky Kwok, Christopher Agia, Rohan Sinha, Matt Foutter, Shulu Li, Ion Stoica, Azalia Mirhoseini, Marco Pavone | 날짜: 2025-06-21 | URL: https://arxiv.org/abs/2506.17811 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1: Inference-Time Scaling Law: We observe that action error consistently decreases as we

Vision-Language-Action (VLA) 모델의 테스트 시간 성능을 향상시키기 위해 샘플링과 검증을 통한 스케일링 방법을 제시하며, action error가 생성 샘플 수에 따라 지수 거듭제곱 법칙을 따른다는 inference-time scaling law를 발견했다.

Motivation

Achievement

Figure 3

Figure 3: Scaling test-time compute significantly improves the precision and robustness of generalist robot

How

Figure 2

Figure 2: Stage 1: Training the Action Verifier. Given an imitation learning dataset, we sample N

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: VLA 모델의 test-time scaling 가능성을 체계적으로 규명하고 실용적인 RoboMonkey 프레임워크를 제안한 우수한 연구로, inference-time scaling law의 발견과 실제 로봇에서의 유의미한 성능 향상이 로봇 제어 분야에 큰 기여를 한다.

같이 보면 좋은 논문

기반 연구Inner Monologue 연구는 플래닝과 검증 기반의 생성적 reasoning 방법을 제시하여, 샘플링-검증 구조의 원리를 RoboMonkey보다 근본적으로 논의합니다.
기반 연구A Survey on Vision-Language-Action Models: An Action Tokenization... 논문은 VLA 동작 토큰화와 샘플링 구조의 이론적/구조적 토대를 제공합니다.
다른 접근RoboMonkey와 같이 테스트 타임 샘플링 및 VLA 검증에 집중하지만, π₀는 정량적 error scaling에 다른 신경망 프레임워크와 로직을 적용합니다.
다른 접근Diffusion Transformer Policy 논문도 샘플링 기반 정책 생성 효율화에 집중하며, RoboMonkey의 검증/스케일링 접근과 방법론적 대조점을 갖는다.
다른 접근VITA는 행동 추출 및 정책 결정에서 flow matching 기반의 효율적 샘플링 방식을 사용하여, RoboMonkey의 테스트 시간 스케일링과 대조되는 접근법을 제시합니다.
후속 연구Neural Scaling Laws in Robotics는 RoboMonkey의 테스트타임 샘플 수와 에러 간 scaling law 발견이라는 핵심 결과를 심층적으로 탐구한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드