저자: Dapeng Zhang, Jing Sun, Chenghui Hu, Xiaoyan Wu, Zhenlong Yuan, Rui Zhou, Fei Shen, Qingguo Zhou | 날짜: 2025-09-23 | URL: https://arxiv.org/abs/2509.19012 📄 PDF
Essence
Fig. 3: Vision-Language-Action Taxonomy: From Autoregression-based, Diffusion-based, to Reinforcement-based and
본 논문은 Vision Language Action (VLA) 모델을 체계적으로 분류하고 분석하는 포괄적 서베이로, autoregression-based, diffusion-based, reinforcement-based, hybrid, specialized methods로 VLA 접근법을 분류하여 300개 이상의 최근 연구를 종합한다.
Evaluation
Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: 본 서베이는 VLA 분야의 급속한 발전 속에서 처음으로 체계적인 분류체계를 제시하고 300개 이상의 연구를 종합하여 현황 맵핑을 제공함으로써, VLA 연구자와 로봇공학자들에게 높은 학술적 가치를 제공한다. 다만 시뮬레이션-현실 갭, 평가 메트릭 표준화, 최신 방법론 수용 측면의 개선이 향후 필요하다.
같이 보면 좋은 논문
기반 연구Robot Learning in the Era of Foundation Models는 VLA 모델의 다양한 기술 동향을 비교하고 있어,
1519의 종합 서베이와 이론적 근간을 이룬다.
기반 연구Pure VLA Models: A Comprehensive Survey는 멀티모달 VLA 모델 전체에 대한 알고리즘, 장단점, 분류를 폭넓게 다루어, 멀티모달 네비게이션 기법 서베이의 모델 관점 확장 연구입니다.
다른 접근A Survey on Vision-Language-Action Models for Embodied AI는 VLA 모델을 다양한 embodied AI 문맥에서 기술적 응용 관점으로 서베이해, 접근과 초점에서 상호 보완됩니다.
다른 접근9093 또한 Vision-Language-Action 모델을 액션 토크나이제이션 관점에서 서베이하며,
1519와 상이한 분류 및 포커스를 보여준다.
다른 접근1519는 구조 단순화된 Pure VLA 정책과 그 학습법을 다루어,
1615의 구조 변경 없는 접근법과 설계상 대응관계를 비교할 가치가 있다.
다른 접근Pure VLA 모델의 방향을 별도로 다루며, 구조적 분석의 다른 시각을 제공한다.
후속 연구Diffusion Models for Robotic Manipulation: A Survey는 VLA 내에서도 diffusion 기반의 특화된 구현 방향을 명확히 정리하여, 폭넓은 VLA 분류의 세부적 심화 사례가 됩니다.
후속 연구Pure Vision-Language-Action 모델들이 로봇공학에 어떻게 적용되고 발전되는지 포괄적으로 다루며, foundation model review의 근간이 된다.
후속 연구Pure Vision Language Action Models: A Comprehensive Survey는 VLA 시스템화 및 통합 모델 개관의 이론적·모델적 기반을 제공합니다.