HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model

저자: Jiaming Liu, Hao Chen, Pengju An, Zhuoyang Liu, Renrui Zhang, Chenyang Gu, Xiaoqi Li, Ziyu Guo, Sixiang Chen, Mengzhen Liu, Chengkai Hou, Mengdi Zhao, KC alex Zhou, Pheng-Ann Heng, Shanghang Zhang | 날짜: 2025-03-13 | URL: https://arxiv.org/abs/2503.10631 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1: (a) Unlike recent diffusion-based VLA methods [12, 13, 14] that attach a separate diffusion

HybridVLA는 diffusion 기반 action 예측의 연속성과 autoregressive VLM의 추론 능력을 단일 LLM 내에서 통합하는 unified vision-language-action 모델이다. Collaborative training recipe와 adaptive action ensemble mechanism을 통해 두 생성 패러다임의 상호 강화를 실현한다.

Motivation

Achievement

Figure 1

Figure 1: (a) Unlike recent diffusion-based VLA methods [12, 13, 14] that attach a separate diffusion

How

Figure 2

Figure 2: HybridVLA Framework. All multimodal inputs are encoded into tokens and subsequently

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: HybridVLA는 diffusion과 autoregressive 기반 action 생성의 근본적 한계를 unified architecture와 collaborative training을 통해 우아하게 해결하며, 광범위한 실험과 state-of-the-art 성과를 통해 로봇 조작 분야에 실질적인 진전을 제시하는 견고한 논문이다.

같이 보면 좋은 논문

기반 연구CogACT의 diffusion action transformer 접근법은 HybridVLA의 diffusion/autoregressive 통합 정책의 기술적 기반이 된다.
기반 연구Diffusion-VLA(1364)는 HybridVLA(1429)가 diffusion과 autoregressive LLM을 통합하는 unified VLA 모델 구조의 설계 지침이 된다.
다른 접근HybridVLA는 autoregressive와 diffusion을 결합한 unified VLA approach를 제시하며, Diffusion-VLA의 hybrid 구조와 비교할 수 있다.
기반 연구DexVLA는 diffusion 전문가와 VLM 결합의 기본 원리를 제공해 HybridVLA의 동시적 생성 패러다임 통합에 기초가 됩니다.
다른 접근Diffusion Transformer Policy도 transformation 기반 autoregressive와 diffusion의 조합이라는 측면에서 HybridVLA와 유사한 문제를 다룹니다.
다른 접근Reactive Diffusion Policy(1524)는 diffusion 기반 액션 생성에서 fast/slow 메커니즘에 집중하는 방식으로, HybridVLA와 다른 장점이 있다.
다른 접근HybridVLA는 diffusion과 autoregression을 결합하여 정책을 생성하므로, 복수 정책 조합의 또 다른 방식을 제안한다.
다른 접근InternVLA-A1은 Mixture-of-Transformers 구조를 통한 의미/행동 융합 방식으로 HybridVLA와 상이한 unified VLA 접근을 보여준다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드