A Survey on Vision-Language-Action Models for Autonomous Driving

저자: Sicong Jiang, Zilin Huang, Kangan Qian, Ziang Luo, Tianze Zhu, Yang Zhong, Yihong Tang, Menglin Kong, Yunlong Wang, Siwen Jiao, Hao Ye, Zihao Sheng, Xin Zhao, Tuopu Wen, Zheng Fu, Sikai Chen, Kun Jiang, Diange Yang, Seongjin Choi, Lijun Sun | 날짜: 2025-06-30 | URL: https://arxiv.org/abs/2506.24044 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1. Comparisons of autonomous driving paradigms. (a) End-to-end driving offers direct perception-to-control mappin

본 논문은 Vision-Language-Action (VLA) 모델을 자율주행에 적용하는 최초의 종합 서베이로, 20개 이상의 대표 모델을 분석하고 시각 인식, 자연어 이해, 제어를 통합하는 패러다임의 발전 과정을 추적한다.

Motivation

Achievement

Figure 2

Figure 2. Overview of the VLA4AD Architecture.

How

Figure 1

Figure 1. Comparisons of autonomous driving paradigms. (a) End-to-end driving offers direct perception-to-control mappin

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 본 논문은 VLA4AD 분야의 최초의 종합 서베이로서 아키텍처, 진화 과정, 모델 비교를 체계적으로 정리하고 개방 과제를 명확히 정의함으로써, 설명가능하고 견고한 자율주행 시스템 개발을 위한 중요한 참고 자료를 제공한다.

같이 보면 좋은 논문

기반 연구GAIA-1은 autonomous driving을 위한 generative world model 구조 및 vision-language-action 연계 방식을 실질적으로 구현한다.
후속 연구GAIA-1이 제안하는 자율주행 시뮬레이션 데이터 생성 방식은 자율주행용 VLA 관련 서베이(1300)에서 다루는 주요 기술적 기반을 활용한다.
기반 연구1300은 AI 기반 자율주행 시스템 리뷰이지만, 복잡계 물리 시뮬레이션 관점에서 1313의 연구를 실제 응용에 연결하는 고찰이 가능하다.
기반 연구A Survey on Vision-Language-Action Models for Autonomous Dri 논문은 로봇 내비게이션 및 자율주행 분야에서의 VLA의 구체적 활용을 중점적으로 분석합니다.
기반 연구$π_0$는 범용 로봇 정책에 Flow 기반 VLA 모델을 적용한 사례로 자율주행 내 VLA 모델의 설계 관점을 비교할 수 있다.
다른 접근Instruction tuning과 VLA 설계에 대한 Prismatic VLMs의 접근과 달리, 1300은 VLA 기반 자율주행 로봇의 실질적 안전성과 평가 문제를 중점적으로 다룬다.
다른 접근VLA 모델의 자율주행 적용뿐만 아니라 다양한 embodied AI 영역을 포괄적으로 비교하는 서베이 논문이다.
다른 접근A Survey on Vision-Language-Action Models for Autonomous Driving은 DivScene의 embodied navigation과 차별적으로 운전-기반 시나리오에서 VLA 모델을 다룹니다.
다른 접근1300은 자율주행 관점에서 VLA 기반 embodied AI의 의사결정 체계를 서베이하여, 1445에서 다루는 general embodied AI 시스템 서베이와 비교하며 다양한 적용 영역의 프레임워크를 보여준다.
후속 연구Vision-Language-Action 모델의 로봇 적용방식을 다각적으로 분석한 Survey로서, 최신 Foundation Model 논의에 선행 연구적 기반을 제공한다.
후속 연구Vision-Language-Action (VLA) Models의 전반적인 발전, 개념 및 응용사례를 더 폭넓게 다루는 리뷰로 자율주행 적용의 맥락을 보완해준다.
후속 연구1300의 서베이는 1307의 구조적 해부로 구체화되며, VLA 모델 연구의 흐름을 연계해 볼 수 있다.
응용 사례π_{0.5} 논문은 오픈월드 VLA 모델을 실제 자율주행 등 다양한 환경에 적용해 모델의 범용성을 시연한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드