A Survey on Vision-Language-Action Models: An Action Tokenization Perspective

저자: Yifan Zhong, Fengshuo Bai, Shaofei Cai, Xuchuan Huang, Zhang Chen, Xiaowei Zhang, Yuanfei Wang, Shaoyang Guo, Tianrui Guan, Ka Nam Lui, Zhiquan Qi, Yitao Liang, Yuanpei Chen, Yaodong Yang | 날짜: 2025-07-02 | URL: https://arxiv.org/abs/2507.01925 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1 | We present a unified framework of VLA from an action tokenization perspective. Action token refers

본 논문은 vision-language-action (VLA) 모델들을 action tokenization 관점에서 통합적으로 분석하는 포괄적인 서베이이다. 현재의 다양한 VLA 모델들을 단일 프레임워크로 통합하고, action token을 language description, code, affordance, trajectory, goal state, latent representation, raw action, reasoning 등 8가지로 분류하여 체계적으로 정리한다.

Motivation

Achievement

Figure 3

Figure 3 | Evolution timeline of foundation models, VLA models, and data sources. The U-shape reflects how

통합 프레임워크 제시: 다양한 VLA 모델들을 action tokenization 관점에서 통합적으로 분석하는 프레임워크 제안

Action Token 분류체계: 8가지 action token type (language description, code, affordance, trajectory, goal state, latent representation, raw action, reasoning)의 포괄적 분류 및 정의

각 token type별 상세 분석: 각 token type의 발전 과정, 주요 방법론, 장단점, 적용 분야에 대한 심층 분석

향후 기술 트렌드 식별: Hierarchical architecture, action-based reasoning, reinforcement learning 통합, VLA agent로의 진화 등 미래 방향 제시

실용적 가이드라인 제공: Model, data, hardware의 협진 필요성, safety와 alignment의 중요성 강조

How

Figure 2

Figure 2 | Visualization of action tokens in a single embodied task. Given the same vision and language

• 8가지 action token type에 대해 별도의 섹션을 할당하여 각각의 evolution timeline, key papers, advantages, limitations 등을 상세히 분석

• 실제 VLA 모델들 (CodeAsPolicies, DriveVLM, VoxPoser, HiRobot, CoT-VLA, GO-1, VILA-U 등)을 action token 분류에 따라 체계적으로 분류 및 시각화

• Executive summary에서 action token trends, architecture trends, emerging research directions 등을 명확하게 정리

• Table of contents 및 정렬된 섹션 구조로 각 주제에 대한 논리적 전개

Originality

Action tokenization 관점의 새로운 분석 틀: 기존에 부족했던 action token에 대한 통합적 관점을 처음으로 제시

LLM의 language token과 VLA의 action token 대응 관계 설정: 두 분야의 병렬 발전을 통해 새로운 인사이트 제공

Action token taxonomy의 정립: 8가지 세부 분류로 체계적인 분류체계 확립

Hierarchical architecture 및 multi-token synergy 개념 도입: 단일 token 중심이 아닌 전략적 조합의 필요성 강조

Limitation & Further Study

실험적 검증의 부재: 본 서베이는 정성적 분석에 중점을 두고 있으며, 각 action token type들의 성능을 정량적으로 비교하는 벤치마크 결과가 부족함

데이터 및 하드웨어 제약의 논의 부족: action tokenization 선택이 data와 hardware 가용성에 미치는 영향에 대한 심화된 분석 필요

실시간 성능 평가 부재: 복잡한 실제 환경에서 각 token type의 실행 효율성, 지연 시간, 실패율 등을 비교한 실증적 평가 필요

후속 연구: 각 action token type들 간의 성능 벤치마킹, 하이브리드 접근 방식의 실험적 검증, 안전성과 정렬 문제에 대한 더 깊이 있는 논의 필요

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 4/5

총평: 본 서베이는 VLA 분야의 현황을 action tokenization이라는 통합적 렌즈로 분석하여 체계적이고 포괄적인 이해를 제공한다. 8가지 action token type의 분류, 각각의 장단점 분석, 그리고 미래 기술 트렌드에 대한 인사이트는 VLA 연구의 방향을 제시하는 데 매우 가치 있다. 다만 정량적인 성능 비교와 실제 환경에서의 검증이 부재하다는 한계가 있으며, 이를 보완하는 후속 연구가 필요하다.

같이 보면 좋은 논문

기반 연구A Survey on Vision-Language-Action Models: An Action Tokenization Perspective는 VLA 모델의 성능 스케일링과 토크나이즈 규칙 등 데이터/모델 규모의 분석을 구체적으로 확장합니다.
기반 연구FAST(1392)는 action tokenization의 설계 및 scaling 기법을 분석하여, 9093의 액션 토크나이제이션 관점 서베이의 기술적 배경이 된다.
기반 연구Vision-Language-Action (VLA) Models: Concepts, Progress, Applications 논문은 VLA 모델 전반의 개념 및 발전을 종합적으로 정리하며, 본 서베이의 이론적 기반이 된다.
다른 접근Learning Universal Policies via Text-Guided Video Generation 논문은 action token을 비디오 기반 학습으로 달리 formalize하는 대안적 방향성을 제공합니다.
다른 접근서로 보완적으로 VLA 모델을 다루지만, 관점(구성요소 vs action tokenization)이 다르므로 다양한 입체적 시각을 제공합니다.
다른 접근9093은 VLA 모델의 액션 토크나이징부터 전체 발전사를 다뤄, 1305의 사이버-피지컬 연계 관점과 비교된다.
다른 접근A Survey on Vision-Language-Action Models: An Action Tokenization Perspective는 VLA 기반 산업용 로봇의 최근 action token 처리 방식과 한계를 고찰하므로, EIIR 산업 프레임워크와 비교해 학문적 및 실용적 방향성을 제공한다.
다른 접근Scaling Up and Distilling Down 논문은 라지스케일 VLA 모델의 학습/디스틸 관점을 중심으로 다루며, 액션 토크나이제이션 중심의 본 서베이와 상호보완적이다.
다른 접근9093 또한 Vision-Language-Action 모델을 액션 토크나이제이션 관점에서 서베이하며, 1519와 상이한 분류 및 포커스를 보여준다.
후속 연구A Survey on Vision-Language-Action Models: An Action Tokenization Perspective는 RoboFlamingo 같은 정책 구조의 동향과 action 토크나이제이션 설계 논의를 폭넓게 제공한다.
후속 연구A Survey on Vision-Language-Action Models: An Action Tokenization Perspective는 VLA model의 전반적 개념·동향 정리로서, EMLM 리뷰 논문의 이론적 토대가 됩니다.
후속 연구A Survey on Vision-Language-Action Models: An Action Tokenization Perspective는 다양한 VLM 구조와 벤치마크 방법론을 1466의 관점에서 체계적으로 분석한다.
후속 연구A Survey on Vision-Language-Action Models: An Action Tokenization... 논문은 멀티모달 테스트타임 적응의 이론적/분류적 토대를 제공합니다.
후속 연구A Survey on Vision-Language-Action Models: An Action Tokenization... 논문은 VLA 동작 토큰화와 샘플링 구조의 이론적/구조적 토대를 제공합니다.
후속 연구A Survey on Vision-Language-Action Models: An Action Tokenization Perspective 논문은 heterogenous 데이터셋에서 contrastive action representation의 이론적 기반을 설명한다.
후속 연구9093은 액션 토크나이제이션 관점의 VLA 설계 트렌드를 총정리해, 1615의 간결한 토큰 직접 표현 기법의 동기를 뒷받침한다.
응용 사례1615의 VLA-0 모델은 9093에서 다루는 action token을 문장 직접 기술 방식으로 구현하는 대표적 사례이다.
응용 사례LOTUS 논문은 action token을 통해 지속적 imitation 학습을 가능케 하여, action tokenization 서베이가 설명하는 실제 기법 사례가 됩니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드