A Survey on Vision-Language-Action Models: An Action Tokenization Perspective
저자: Yifan Zhong, Fengshuo Bai, Shaofei Cai, Xuchuan Huang, Zhang Chen, Xiaowei Zhang, Yuanfei Wang, Shaoyang Guo, Tianrui Guan, Ka Nam Lui, Zhiquan Qi, Yitao Liang, Yuanpei Chen, Yaodong Yang | 날짜: 2025-07-02 | URL: https://arxiv.org/abs/2507.01925📄 PDF
⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: arXiv 비독점 라이선스
Essence
Figure 1 | We present a unified framework of VLA from an action tokenization perspective. Action token refers
본 논문은 vision-language-action (VLA) 모델들을 action tokenization 관점에서 통합적으로 분석하는 포괄적인 서베이이다. 현재의 다양한 VLA 모델들을 단일 프레임워크로 통합하고, action token을 language description, code, affordance, trajectory, goal state, latent representation, raw action, reasoning 등 8가지로 분류하여 체계적으로 정리한다.
Motivation
Known: Vision foundation model과 language foundation model의 놀라운 발전이 multimodal understanding, reasoning, generation 분야에서 이루어졌으며, 이를 물리 세계로 확장하려는 노력이 VLA 모델의 번성으로 이어졌다. 기존 VLA 연구는 매우 다양한 접근 방식을 제시해왔다.
Gap: 기존 연구에서는 action token에 대한 포괄적인 이해가 부족하며, 각 token type의 강점과 한계에 대한 체계적인 분석이 이루어지지 않았다. 또한 VLA 발전의 미래 방향이 명확하지 않고, action tokenization 관점에서 통합된 프레임워크가 존재하지 않았다.
Why: Action token이 VLA 모델의 설계를 구분하는 핵심적인 선택이 되기 때문에, action tokenization 관점의 분석은 VLA 분야의 발전을 가속화하는 데 매우 중요하다. 또한 embodied AI가 일반목적 지능으로 나아가기 위해서는 action token 설계에 대한 깊이 있는 이해가 필수적이다.
Approach: Vision과 language input이 일련의 VLA 모듈을 통해 처리되어 action token의 체인을 생성하고, 이를 통해 최종적으로 실행 가능한 action을 생성하는 프레임워크를 제시한다. 8가지 action token type에 대해 각각의 진화, 장단점, 미래 방향을 세부적으로 분석한다.
Achievement
Figure 3 | Evolution timeline of foundation models, VLA models, and data sources. The U-shape reflects how
• 통합 프레임워크 제시: 다양한 VLA 모델들을 action tokenization 관점에서 통합적으로 분석하는 프레임워크 제안
• Action Token 분류체계: 8가지 action token type (language description, code, affordance, trajectory, goal state, latent representation, raw action, reasoning)의 포괄적 분류 및 정의
• 각 token type별 상세 분석: 각 token type의 발전 과정, 주요 방법론, 장단점, 적용 분야에 대한 심층 분석
• 향후 기술 트렌드 식별: Hierarchical architecture, action-based reasoning, reinforcement learning 통합, VLA agent로의 진화 등 미래 방향 제시
총평: 본 서베이는 VLA 분야의 현황을 action tokenization이라는 통합적 렌즈로 분석하여 체계적이고 포괄적인 이해를 제공한다. 8가지 action token type의 분류, 각각의 장단점 분석, 그리고 미래 기술 트렌드에 대한 인사이트는 VLA 연구의 방향을 제시하는 데 매우 가치 있다. 다만 정량적인 성능 비교와 실제 환경에서의 검증이 부재하다는 한계가 있으며, 이를 보완하는 후속 연구가 필요하다.
다른 접근A Survey on Vision-Language-Action Models: An Action Tokenization Perspective는 VLA 기반 산업용 로봇의 최근 action token 처리 방식과 한계를 고찰하므로, EIIR 산업 프레임워크와 비교해 학문적 및 실용적 방향성을 제공한다.
후속 연구A Survey on Vision-Language-Action Models: An Action Tokenization Perspective 논문은 heterogenous 데이터셋에서 contrastive action representation의 이론적 기반을 설명한다.