VLA-0: Building State-of-the-Art VLAs with Zero Modification

저자: Ankit Goyal, Hugo Hadfield, Xuning Yang, Valts Blukis, Fabio Ramos | 날짜: 2025-10-15 | URL: https://arxiv.org/abs/2510.13054 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Fig. 1: Schematic representation of VLA-0. VLA-0 con-

VLA-0는 Vision-Language Model의 구조 변경 없이 액션을 직접 텍스트로 표현하여 로봇 조작을 위한 최첨단 Vision-Language-Action 모델을 구축한다. 이 단순한 설계가 기존의 복잡한 방법들보다 우수한 성능을 달성한다.

Motivation

Achievement

Figure 2

Fig. 2: Families of methods for building VLAs. We categorize existing VLAs into three categories: Discrete Token VLAs,

How

Figure 3

Fig. 3: Our proposed VLA-0. It creates a VLA without making any changes to the underlying VLM. It takes a system

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: VLA-0는 예상을 뒤엎고 가장 단순한 설계가 최첨단 성능을 달성 가능함을 입증하여 VLA 분야에 중요한 통찰을 제공한다. 코드와 모델 공개를 통한 재현성과 실용성이 높으며, VLM 기반 로봇 제어 연구에 새로운 방향을 제시한다.

같이 보면 좋은 논문

기반 연구VIMA는 transformer에 멀티모달 입력을 직접 처리해 VLA-0 논문의 text-action 직접 매핑 아이디어에 영향을 줌.
기반 연구VLA-0(1615)는 state-of-the-art VLA 모델을 zero modification으로 실제 3D 조작 및 다양한 조작 파이프라인에 적용하여 RVT의 확장적 접근을 보여준다.
기반 연구VLA-0은 추가적인 구조 변경 없이 효율화와 acceleration을 달성하여 Consistency Policy의 목적을 실질적으로 이어갑니다.
기반 연구OpenVLA에서는 구조 변경 없이 순수 VLM 출력 토큰만으로 action mapping을 하는 및 파생된 설계의 실제 효과를 살펴볼 수 있다.
기반 연구9093은 액션 토크나이제이션 관점의 VLA 설계 트렌드를 총정리해, 1615의 간결한 토큰 직접 표현 기법의 동기를 뒷받침한다.
다른 접근TinyVLA는 구조를 최소화하고 효율성을 극대화한 다른 설계 방식의 소형 VLA 모델로, VLA-0와의 효율성 및 성능 trade-off를 비교하기 좋다.
다른 접근Magma는 다양한 멀티모달 입력과 액션 시퀀스 매핑을 새로운 구조로 구현하여 VLA-0과 서로 대조 가능한 방식임.
다른 접근1519는 구조 단순화된 Pure VLA 정책과 그 학습법을 다루어, 1615의 구조 변경 없는 접근법과 설계상 대응관계를 비교할 가치가 있다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드