An Anatomy of Vision-Language-Action Models: From Modules to Milestones and Challenges

저자: Chao Xu, Suyu Zhang, Yang Liu, Baigui Sun, Weihong Chen, Bo Xu, Qi Liu, Juncheng Wang, Shujun Wang, Shan Luo, Jan Peters, Athanasios V. Vasilakos, Stefanos Zafeiriou, Jiankang Deng | 날짜: 2025-12-12 | URL: https://arxiv.org/abs/2512.11362 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Fig. 1: The structure of this survey in a pyramid format. Section 2 lays

Vision-Language-Action (VLA) 모델의 구조와 발전을 체계적으로 분석하는 종합 서베이로, 기본 모듈부터 역사적 마일스톤을 거쳐 5가지 핵심 과제까지 단계적으로 설명한다.

Motivation

Achievement

Figure 1

Fig. 1: The structure of this survey in a pyramid format. Section 2 lays

How

Figure 1

Fig. 1: The structure of this survey in a pyramid format. Section 2 lays

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 이 서베이는 빠르게 성장하는 VLA 분야에서 기존 단편적 가이드의 한계를 극복하고, 초보자부터 전문가까지 포용할 수 있는 체계적 학습 경로와 심층적 문제 분석을 제공하여 필드의 리더맵 역할을 할 수 있는 가치 있는 자료이다.

같이 보면 좋은 논문

기반 연구1307은 VLA 구조의 세부 모듈별 해부 및 현황 분석을 제공해, 9092의 범용분류·서베이 내용을 실무 개발 관점에서 구체화한다.
다른 접근A Survey on Vision-Language-Action Models for Embodied AI는 VLA 모델의 시스템적 구조분석을 종합적으로 다루며, anatomy 서베이와 상호 보완적 시각을 제공한다.
기반 연구1307이 정리한 VLA 모델 흐름의 대전제는 1300의 자율주행 중심 서베이가 바탕이 된다.
기반 연구1307은 VLA 모델의 모듈 구조 변화와 발전 양상을 조사하여, 1446의 설문에서 제시한 아키텍처 비교를 더 세부적으로 분석한다.
기반 연구World model 기반 embodied AI 전반을 체계적으로 정리하여, VLA 모델 구조 분석에 이론적 근거를 제공한다.
다른 접근An Anatomy of Vision-Language-Action Models: From Modules to Safety는 실제 환경에서의 안전성과 Sim2Real 이슈를 다루므로 마찰 및 도메인 랜덤화와 관련된 다른 관점의 논문이다.
다른 접근1307은 VLA 모델 전반의 모듈 구조·효율성·안전성 원리를 다루며, 1299의 시뮬레이터 접근과 비교된다.
다른 접근Pure VLA 모델의 방향을 별도로 다루며, 구조적 분석의 다른 시각을 제공한다.
후속 연구VLA 아키텍처의 구성 요소와 설계 원리를 분석한 논문으로, OpenVLA의 설계 의의와 한계를 이해하는 데 도움을 줍니다.
후속 연구1307은 embodied AI에서 VLA 모델의 모듈화와 효율성 이슈를 분석하여, 1305의 multi-modal 연계를 이론적으로 뒷받침한다.
후속 연구1307의 An Anatomy of Vision-Language-Action Models는 Embodied intelligence 시스템의 모듈 및 설계 개념을 정리하여 산업용 로봇에 적용하기 위한 기술 프레임워크의 근간을 제공한다.
후속 연구Vision-Language-Action (VLA) Models: Concepts, Progress, Applications는 VLA 모델의 개념, 발전 및 실제 활용 관점에서 Anatomy 논문의 내용을 체계적으로 심화한다.
후속 연구An Anatomy of Vision-Language-Action Models는 VLA 구조의 모듈별 조합 및 하드웨어 상 연산 효율성을 분석해 platform 간 scaling 이슈와 이론적 연결이 큽니다.
응용 사례Learning Universal Policies via Text-Guided Video Generation는 텍스트·비디오 기반 정책 생성 프레임워크를 실제 embodied agent에 적용하여 VLA 모델 구조의 실제 응용 사례를 제공한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드