VITA: Vision-to-Action Flow Matching Policy

저자: Dechen Gao, Boqi Zhao, Andrew Lee, Ian Chuang, Hanchu Zhou, Hang Wang, Zhe Zhao, Junshan Zhang, Iman Soltani | 날짜: 2025-07-17 | URL: https://arxiv.org/abs/2507.13231 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

VITA는 시각 표현에서 잠재 행동으로 직접 흐르는 noise-free flow matching 정책으로, 기존의 반복적인 시각 조건화 모듈을 제거하여 추론 속도와 메모리 효율성을 획기적으로 향상시킨다.

Motivation

Achievement

Figure 4

Figure 4: Autonomous rollouts of VITA on five challenging real-world tasks, including two bimanual

How

Figure 2

Figure 2: An overview of the VITA architecture: The vision encoder maps observations into a source

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: VITA는 flow matching의 이론적 자유도를 영리하게 활용하여 visuomotor 정책의 효율성과 성능을 동시에 달성한 의미 있는 기여이며, noise-free framework와 flow latent decoding은 독창적인 기술적 혁신으로서 로봇 제어 분야의 실용성을 크게 향상시킨다.

같이 보면 좋은 논문

기반 연구Diffusion Policy 논문은 Vision-to-Action Flow Matching Policy(1613)의 디퓨전 기반 행동 예측의 구조적 기초를 제공함.
기반 연구1613의 flow matching policy는 trajectory 기반 행동예측을 효율적으로 수행하므로, 1310의 사전학습된 future trajectory 예측을 구체화할 수 있다.
기반 연구Diffusion for World Modeling 논문은 diffusion 및 flow-matching 기반 로봇 정책 생성의 아이디어가 VITA에 적용되는 중요한 이론 기반을 제공한다.
다른 접근VITA는 flow 기반 trajectory modeling을 통한 정책 학습 메커니즘을 제안하여, Chain-of-Action의 trajectory autoregressive 접근과 비교 가능하게 합니다.
다른 접근VITA는 flow-matching-기반 고품질 policy를 제안해 diffusion 기반 RDT-1B와 성능 및 효율 측면에서 비교할 수 있다.
다른 접근VITA 역시 비디오 기반 latent action 표현을 키워드로 해서 Moto의 motion token 접근과 대표적인 대안을 제공한다.
다른 접근Streaming Flow Policy는 VITA와 같이 비동기/fast flow 기반 행동 예측을 단순화하는 다른 구조적 접근방식을 제안하므로 비교에 적합하다.
다른 접근VITA는 행동 추출 및 정책 결정에서 flow matching 기반의 효율적 샘플링 방식을 사용하여, RoboMonkey의 테스트 시간 스케일링과 대조되는 접근법을 제시합니다.
다른 접근Embodied-R1(1380)는 강화/계획 기반 정책 학습에 집중하며, 1613의 diffusion-free flow 정책과 달리 reasoning 기반 접근 방식을 제공한다.
다른 접근SpecPrune-VLA는 VLA 모델 경량화와 추론 효율화 문제를 별도의 pruning 방식(스펙트럼 프루닝)으로 접근하며, VITA와 상호 보완적임.
후속 연구VITA는 flow matching 기반 연속 행동 생성의 이론적 기반을 제공하므로 π₀의 행동 생성 원리를 이해하는 데 도움이 된다.
후속 연구VITA 논문은 flow matching에 기반한 정책 학습 구조를 다루어 3DFA와 유사한 접근의 이론 기반을 제공한다.
후속 연구VITA는 flow matching 기반 정책 학습을 제안하여 1465의 ManiFlow와 근본적으로 유사한 이론적 틀을 제공한다.
후속 연구FlowPolicy(1337)는 1613의 flow-matching 기반 행동 생성 아이디어를 다양한 환경에 확장한 사례로, 정책 효율성과 일반화 성능을 비교할 수 있다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드