MoLe-VLA: Dynamic Layer-skipping Vision Language Action Model via Mixture-of-Layers for Efficient Robot Manipulation

저자: Rongyu Zhang, Menghang Dong, Yuan Zhang, Liang Heng, Xiaowei Chi, Gaole Dai, Li Du, Yuan Du, Shanghang Zhang | 날짜: 2025-03-26 | URL: https://arxiv.org/abs/2503.20384 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 1

Figure 1. Overview of our proposed MoLe-VLA: Our proposed framework integrates dynamic layer activation, a novel Spatial

MoLe-VLA는 Mixture-of-Layers 아키텍처와 Spatial-Temporal Aware Router(STAR)를 통해 LLM의 불필요한 레이어를 동적으로 스킵하여 로봇 조작 작업의 계산 효율을 5.6배 향상시키면서 8% 성능 개선을 달성한다.

Motivation

Achievement

Figure 4

Figure 4. Efficiency analysis compared with state-of-the-art baselines with FLOPs and inference time. (Left) Success rat

How

Figure 2

Figure 2. The overall framework of MoLe-VLA. Our proposed Mixture of Layers (MoLe) architecture consists of a Spatial-Te

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: MoLe-VLA는 신경과학 이론과 효율적인 AI 기술을 혁신적으로 결합하여 로봇 제어의 계산-성능 트레이드오프 문제를 크게 개선한 우수한 연구이다. 공간-시간 인식 라우팅과 인지 기반 지식 증류의 설계가 독창적이며, 시뮬레이션과 실제 환경에서의 실증 결과가 설득력 있다.

같이 보면 좋은 논문

기반 연구Compose Your Policies! 논문은 다양한 정책 모듈을 결합/선택하는 아키텍처로, MoLe-VLA의 Mixture-of-Layers 접근에 사상적으로 연결됩니다.
기반 연구HiMoE-VLA는 hierarchcal mixture-of-experts 구조를 제시하며, MoLe-VLA가 layer skipping 메커니즘을 추가 적용하는 근간이 됩니다.
다른 접근MoLe-VLA 역시 Mixture-of-Experts 구조를 활용하지만 layer skipping과 경량화에 초점을 두어 차별화된 접근을 보여줍니다.
다른 접근Plan-Seq-Learn은 layer skipping보다는 시퀀스 기반의 LLM guiding RL 정책 학습을 통해 계산 효율성과 성능을 높이는 대체적 접근을 제시합니다.
다른 접근SpecPrune-VLA는 액션-인식 프루닝을 통해 VLA 모델의 추론 효율성과 속도를 개선하여, MoLe-VLA와 마찬가지로 경량화 방법에 다른 관점을 제공합니다.
다른 접근MoLe-VLA 논문은 동적 레이어 스케이핑을 통해 DualVLN과 다른 방식의 추론-제어 분리 구조를 실현한다.
후속 연구MoLe-VLA는 dynamic layer-skipping을 포함한 시스템 구조를 제안하여, FiS의 dual-system 통합과 효율적 실행에 기반적 기여를 합니다.
후속 연구VLA-Adapter는 TinyVLA 기반의 소형 Vision-Language-Action 모델을 위한 새로운 경량화·적응 전략을 제안하여, 불필요한 계산을 줄이는 구조와 상호 보완적입니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드