InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation

저자: Junhao Cai, Zetao Cai, Jiafei Cao, Yilun Chen, Zeyu He, Lei Jiang, Hang Li, Hengjie Li, Yang Li, Yufei Liu, Yanan Lu, Qi Lv, Haoxiang Ma, Jiangmiao Pang, Yu Qiao, Zherui Qiu, Yanqing Shen, Xu Shi, Yang Tian, Bolun Wang, Hanqing Wang, Jiaheng Wang, Tai Wang, Xueyuan Wei, Chao Wu, Yiman Xie, Boyang Xing, Yuqiang Yang, Yuyin Yang, Qiaojun Yu, Feng Yuan, Jia Zeng, Jingjing Zhang, Shenghan Zhang, Shi Zhang, Zhuoma Zhaxi, Bowen Zhou, Yuanzhen Zhou, Yunsong Zhou, Hongrui Zhu, Yangkun Zhu, Yuchen Zhu | 날짜: 2026-01-05 | URL: https://arxiv.org/abs/2601.02456 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 1

Figure 1. InternVLA-A1 unifies scene understanding, visual foresight generation, and action execution

InternVLA-A1은 Mixture-of-Transformers 아키텍처를 통해 의미 이해, 시각적 예측, 행동 실행을 통합하여 로봇 조작 성능을 향상시키는 Vision-Language-Action 모델이다. 실세계 로봇 데이터, 합성 시뮬레이션 데이터, 인간 비디오를 포함한 692M 프레임의 이질적 데이터로 사전학습되어 동적 조작 작업에서 26.7% 성능 향상을 달성한다.

Motivation

Achievement

Figure 1

Figure 1. InternVLA-A1 unifies scene understanding, visual foresight generation, and action execution

How

Figure 2

Figure 2. Framework of InternVLA-A1. The architecture comprises three experts: (1) an under-

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: InternVLA-A1은 의미 이해와 동적 예측을 통합하는 혁신적 아키텍처와 이질적 데이터 source의 효과적 활용으로 로봇 조작의 일반화 문제를 크게 향상시켰다. 특히 동적 환경에서의 26.7% 성능 향상은 실세계 응용의 중요한 진전을 보여주며, VLA 분야의 주요 기여이다.

같이 보면 좋은 논문

기반 연구CogACT의 cognition-action 분리 및 diffusion 기반 토큰 생성 아이디어가 InternVLA-A1의 Mixture-of-Transformers에 반영된다.
기반 연구DexGraspVLA도 로봇 조작에 Mixture-of-Experts 구조를 적용해 InternVLA-A1의 아키텍처 설계와 유사한 연구 기반을 이룹니다.
기반 연구InternVLA-A1 논문은 대규모 heterogeneous 데이터와 Mixture-of-Transformers 기반 구조로 플랫폼 확장성에 실증적 근거를 확보한다.
기반 연구InternVLA-A1은 InternVLA-M1 프레임워크의 공간적 튜닝을 넘어, 이해, 생성, 행동 생성까지 통합한 후속 연구이다.
기반 연구1424는 Hierarchical Mixture-of-Experts 프레임워크로, 1437이 채택한 mixture-of-transformers 아키텍처의 기저가 된다.
다른 접근Unleashing Large-Scale Video Generative Pre-training 논문은 대규모 비디오 기반 사전학습을 통한 VLA 모델링에서 InternVLA-A1과 방향이 같습니다.
다른 접근VR-Robo 논문에서 실제-합성 데이터 통합 및 크로스 플랫폼 일반화 접근을 제안하여 대규모 heterogeneous 사전학습의 대안을 제공한다.
다른 접근InternVLA-A1은 Mixture-of-Transformers 구조를 통한 의미/행동 융합 방식으로 HybridVLA와 상이한 unified VLA 접근을 보여준다.
다른 접근InternVLA-A1은 diffusion 외 다양한 VLA action expert를 통합하여, Diffusion Models for Robotic Manipulation의 survey 범위와 차별점을 보입니다.
반론/비판1357은 imitation learning에 기반한 세밀한 조작의 생애주기적 generalization 방식으로, 1437의 대규모 사전학습 및 unified VLA 접근법과 관점 차이를 논의한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드