저자: Kento Kawaharazuka, Jihoon Oh, Jun Yamada, Ingmar Posner, Yuke Zhu | 날짜: 2025.10 | DOI: N/A 📄 PDF
라이선스: arXiv 비독점 라이선스
FIGURE 1. Structure of this survey. Section II outlines the key challenges in developing Vision-Language-Action (VLA) mo
Vision-Language-Action (VLA) 모델은 시각, 언어, 행동 데이터를 통합하여 로봇이 다양한 작업, 객체, 구현, 환경에 걸쳐 일반화할 수 있는 정책을 학습하는 기술이다. 이 서베이는 VLA의 아키텍처, 학습 패러다임, 데이터 수집, 실제 배포까지 포괄적인 풀스택 리뷰를 제공한다.
FIGURE 1. Structure of this survey. Section II outlines the key challenges in developing Vision-Language-Action (VLA) mo
FIGURE 3. Structure of Section IV and Section V. The figure summarizes key components of VLA models. The center illustra
총평: 이 서베이는 VLA 분야의 첫 종합적 풀스택 리뷰로서, 실제 로봇 배포에 필요한 모든 측면을 다루는 포괄적 가이드를 제공한다. 빠르게 발전하는 분야의 현황을 정리하고 실무자를 위한 실질적 권장사항을 제시하여 로봇공학 커뮤니티에 상당한 가치를 제공할 것으로 예상된다.