VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers

저자: Yating Wang, Haoyi Zhu, Mingyu Liu, Jiange Yang, Hao-Shu Fang, Tong He | 날짜: 2025-07-01 | URL: https://arxiv.org/abs/2507.01016 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1. The VQ-VLA pipeline, consisting of two main stages: (1) training a general convolutional residual VQ-VAE and (

100배 이상의 대규모 action trajectory 데이터셋을 활용하여 vector quantization 기반 action tokenizer를 학습하고, 이를 Vision-Language-Action 모델에 통합하여 추론 속도, 동작 부드러움, 장기 계획 능력을 향상시킨다.

Motivation

Achievement

Figure 3

Figure 3. Real-world experimental results: We compare the performance of Baseline, VQO, VQO+L, and VQO+L+M on both short

How

Figure 1

Figure 1. The VQ-VLA pipeline, consisting of two main stages: (1) training a general convolutional residual VQ-VAE and (

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 본 논문은 action tokenization을 대규모 데이터셋으로 확장하는 실용적이고 효과적인 방법론을 제시하며, synthetic-real 데이터 간 minimal domain gap이라는 중요한 발견을 통해 scalable embodied intelligence 시스템 구현의 길을 열었다. 실험 결과와 이론적 근거가 충분하고 VLA 모델의 성능과 효율성을 동시에 향상시키는 점에서 높은 실용성과 학술적 가치를 지닌다.

같이 보면 좋은 논문

기반 연구VQ-VLA는 대규모 이미지-텍스트-행동 사전학습을 통해 1454의 joint-embedding 방법론을 scale-up 및 VLA에 적용한 연장선 연구이다.
기반 연구VQ-VLA는 Vision-Language-Action 모델에서 scaling과 quantization 전략을 결합하여, 잠재 행동 양자화와 비지도 사전학습의 연계 측면에서 실질적 확장안을 제시한다.
기반 연구FAST(1392)는 action trajectory의 토크나이제이션 효율에 집중하여, 1624의 대규모 벡터 양자화 기반 action tokenizer의 설계에 기술적 기초를 제공한다.
기반 연구VQ-VLA는 scaling law 측면에서 강화 학습과 consistency 기반 fine-tuning을 결합하여 ConRFT의 미세조정 전략을 확장합니다.
기반 연구VQ-VLA는 스케일링 데이터와 모델 크기를 활용해 VLA의 reasoning, action, perception 통합을 구현하여 Embodied-Reasoner의 체계적인 확장 사례입니다.
기반 연구Unified Vision-Language-Action Model은 VQ-VLA의 대규모 action trajectory 데이터 훈련과 양자화 토크나이징 기법의 강력한 구조적 기반을 제공함.
다른 접근Chain-of-Action 논문은 trajectory autoregressive modeling 구조에서 VQ-VLA와 달리 시퀀스 생성 방식에 초점을 두고 있음.
다른 접근RDT-1B(1522)는 대규모 확산 기반 bimanual 행동 생성을 다루면서, 1624의 vector-quantized action tokenizer와 비교되는 또 다른 동작 생성 프레임워크를 제시한다.
다른 접근DemoDiffusion은 human demonstration 기반 action generation에서 diffusion/token 기반 접근의 상이한 특징을 제시하여 VQ-VLA와 비교가 가능하다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드