InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
저자: Shuai Yang, Hao Li, Bin Wang, Yilun Chen, Yang Tian, Tai Wang, Hanqing Wang, Feng Zhao, Yiyi Liao, Jiangmiao Pang | 날짜: 2025-07-23 | URL: https://arxiv.org/abs/2507.17520📄 PDF
⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: arXiv 비독점 라이선스
Essence
Figure 1: Method overview. InstructVLA integrates vision-language understanding with precise
InstructVLA는 Vision-Language Model의 추론 능력을 보존하면서 로봇 조작 성능을 달성하는 end-to-end VLA 모델이며, Vision-Language-Action Instruction Tuning (VLA-IT) 패러다임을 통해 multimodal reasoning과 action generation을 동시에 최적화한다.
Motivation
Known: RT-2, OpenVLA 등의 기존 VLA 모델들은 vision-language 능력과 조작 성능 중 하나를 희생하거나 task-specific 데이터에만 제한되며, pre-trained VLM의 catastrophic forgetting 문제를 겪는다.
Gap: VLM의 유연한 multimodal reasoning을 보존하면서 동시에 정확한 action generation을 달성하고, embodied reasoning을 효과적으로 조작 성능에 연결하는 메커니즘이 부재하다.
Why: 로봇이 실제 환경에서 효과적으로 작동하려면 복잡한 instruction을 이해하고 reasoning하면서도 정확한 조작을 수행해야 하므로, 이 두 능력의 통합은 실용적인 human-robot interaction을 위해 필수적이다.
Approach: VLA-IT 패러다임에서 mixture-of-experts adaptation을 활용하여 latent action queries를 통해 VLM backbone을 보존하면서 action generation을 학습하고, standard VLM corpora와 650K 크기의 VLA-IT 데이터셋을 jointly 학습한다.
Achievement
Figure 4: Simpler-Instruct. Six representative test cases with instructions and InstructVLA responses.
SimplerEnv 성능: SpatialVLA 대비 33% 향상 달성
일반화 능력: SimplerEnv-Instruct 벤치마크에서 fine-tuned OpenVLA 대비 96% 향상, GPT-4o 보조 action expert 대비 29% 향상
Multimodal 성능: baseline VLM들을 초과하는 multimodal task 성능 달성
Inference-time scaling: textual reasoning을 활용한 조작 성능 향상 (시뮬레이션 및 실제 환경)
총평: InstructVLA는 VLA 분야에서 multimodal reasoning과 precise action generation의 균형을 이루는 중요한 진전을 보여주며, VLA-IT 패러다임과 mixture-of-experts 통합 방식은 신선한 기술적 기여를 제시한다. 다만 real-world 검증 범위와 open-world generalization에 대한 추가 평가가 필요하다.