InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy

저자: Xinyi Chen, Yilun Chen, Yanwei Fu, Ning Gao, Jiaya Jia, Weiyang Jin, Hao Li, Yao Mu, Jiangmiao Pang, Yu Qiao, Yang Tian, Bin Wang, Bolun Wang, Fangjing Wang, Hanqing Wang, Tai Wang, Ziqin Wang, Xueyuan Wei, Chao Wu, Shuai Yang, Jinhui Ye, Junqiu Yu, Jia Zeng, Jingjing Zhang, Jinyu Zhang, Shi Zhang, Feng Zheng, Bowen Zhou, Yangkun Zhu | 날짜: 2025-10-15 | URL: https://arxiv.org/abs/2510.13778 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1. InternVLA-M1 integrates spatial grounding into the vision–language–action training pipeline.

InternVLA-M1은 공간 그라운딩을 시각-언어-행동 학습의 중심 연결고리로 활용하여, 지시 따르기 로봇의 확장 가능한 일반 지능을 구현한 통합 프레임워크이다.

Motivation

Achievement

Figure 2

Figure 2. Overview of InternVLA-M1. InternVLA-M1 adopts a spatially guided two-stage training

How

Figure 2

Figure 2. Overview of InternVLA-M1. InternVLA-M1 adopts a spatially guided two-stage training

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: InternVLA-M1은 공간 그라운딩을 중추로 하는 이중 시스템 설계로 instruction-following과 embodied control 간 명확한 인터페이스를 제시하며, 광범위한 벤치마크에서 일관된 성능 향상과 확장성을 입증한 매우 견고한 연구이다.

같이 보면 좋은 논문

기반 연구RoboCerebra는 장기적 언어-조건부 조작 작업을 위한 추가적인 대규모 벤치마크를 제공하여, CALVIN 벤치마크와 더불어 장기 정책 학습 평가를 풍부하게 할 수 있습니다.
기반 연구SpatialVLA는 공간 그라운딩 기반의 VLA 통합 방법론을 설계해 InternVLA-M1의 핵심 아이디어와 이론적 연결이 있습니다.
후속 연구InternVLA-M1(1438)는 공간적 지시가 강화된 VLA 구조를 제안하여, SpatialVLA(1576)의 ego-centric 공간 표현 기반에 이론적 발판을 제공한다.
다른 접근InternVLA-M1은 비전-언어-행동에서 공간/관계 정보 활용 방법을 다르게 구현하며, ReKep와 상호 비교가 가능하다.
다른 접근1356은 grasp와 같은 구체적 매니퓰레이션에 diffused expert와 multimodal policy를 융합한 접근으로, 공간 grounding 대신 조작 affordance에 주력하여 1438과 대비된다.
다른 접근InternVLA-M1 역시 공간적 지식과 통합적 reasoning을 통해 일반적 로봇 제어 능력을 추구하므로 Hume의 대안적 접근법으로 참고할 수 있다.
다른 접근Neural Brain은 공간적 뇌 지식의 통합과 embodied agent 설계에서 InternVLA-M1과 유사한 연구 목표를 지닙니다.
후속 연구InternVLA-A1은 InternVLA-M1 프레임워크의 공간적 튜닝을 넘어, 이해, 생성, 행동 생성까지 통합한 후속 연구이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드