Unified Vision-Language-Action Model

저자: Yuqi Wang, Xinghang Li, Wenxuan Wang, Junbo Zhang, Yingyan Li, Yuntao Chen, Xinlong Wang, Zhaoxiang Zhang | 날짜: 2025-06-24 | URL: https://arxiv.org/abs/2506.19850 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1: We present UniVLA, a unified vision-language-action model. Unlike prior VLA

UniVLA는 vision, language, action을 discrete token으로 통일하여 autoregressive sequence modeling으로 joint하게 학습하는 unified vision-language-action model이다. World model을 post-training에 통합하여 비디오에서 temporal dynamics를 학습하고 downstream policy learning을 강화한다.

Motivation

Achievement

Figure 1

Figure 1: We present UniVLA, a unified vision-language-action model. Unlike prior VLA

How

Figure 2

Figure 2: Overview of the UniVLA framework. Our model unifies information from different

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: UniVLA는 heterogeneous modalities를 unified discrete token 프레임워크로 통합하고 world model post-training으로 temporal dynamics를 학습하는 혁신적인 VLA 모델이다. 다중 벤치마크에서 SOTA 성능을 달성했으며, multimodal capability와 large-scale video training 가능성으로 generalist embodied AI의 새로운 방향을 제시한다.

같이 보면 좋은 논문

기반 연구CANVAS는 commonsense-aware navigation을 위한 비전-언어-액션 표현 융합을 다루며, UniVLA의 modality tokenization 및 sequence modeling에 설계적 영감을 준다.
기반 연구Unified Vision-Language-Action Model은 대규모 데이터와 다양한 조작 task를 통해 GR-2의 방식과 유사하게 통합형 VLA 프레임워크로 확장합니다.
기반 연구Unified Vision-Language-Action Model은 action-token 기반 joint modeling을 확장하여, 1598의 joint video-action 예측 프레임워크를 시퀀스 단위로 포괄적으로 발전시킴.
기반 연구Unified Vision-Language-Action Model 논문은 navigation, reasoning, multitask 협업이 결합된 통합 기반 사례를 심화탐구한다.
다른 접근Video Language Planning은 비디오와 언어를 결합한 계획 생성에 집중함으로써, UniVLA와는 달리 planning 중심 패러다임을 보여줌.
다른 접근NaVILA는 legged robot을 위한 vision-language-action 모델을 discrete token 기반 joint modeling으로 구현하여, UniVLA의 토크나이즈드 시퀀스 방식과 비교할 만하다.
다른 접근Unified Vision-Language-Action Model(1599)은 다양한 로봇 작업을 하나로 아우르는 통합적 VLA 프레임워크로, 1536의 RoboBrain와 유사한 범용성 지향 모델이다.
다른 접근1599는 unified VLA 모델을 소개하고 그 구조적 패러다임을 논의하여, 1446의 Monolithic/Hierarchical 모델 분류와 대비해 융합 구조의 최신 연구를 보여준다.
다른 접근DualVLA는 partial modality와 전문가 네트워크 융합을 통한 unified VLA 정책을 제시하여, UniVLA와 같이 통합적인 시퀀스 모델링에 대안이 되는 멀티모달 구조를 제공한다.
후속 연구Unleashing Large-Scale Video Generative Pre-training... 논문은 비디오 생성 기반 사전학습이 UniVLA 같은 joint vision-language-action 정책의 post-training world model 통합에 실질적 성능 향상을 도모한다.
후속 연구VQ-VLA는 UniVLA가 제시한 디스크리트 시퀀스 모델링을 벡터 양자화 토크나이저 기반으로 더욱 대규모 데이터에서 확장함.
후속 연구Unified Vision-Language-Action Model 논문은 다양한 로봇 플랫폼을 대상으로 통합 VLA 모델을 제안하여 Gemini Robotics 1.5의 generalist 로봇 목표에 기반을 제공합니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드