VLA-Cache: Efficient Vision-Language-Action Manipulation via Adaptive Token Caching

저자: Siyu Xu, Yunke Wang, Chenghao Xia, Dihao Zhu, Tao Huang, Chang Xu | 날짜: 2025-02-04 | URL: https://arxiv.org/abs/2502.02175 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 1

Figure 1: During the inference of the VLA model, static

VLA-Cache는 로봇 조작 작업에서 인접한 프레임 간의 시간적 중복성을 활용하여 정적 시각 토큰의 KV 표현을 캐싱하고 재사용함으로써 Vision-Language-Action 모델의 추론을 가속화하는 학습 불필요 방법이다.

Motivation

Achievement

Figure 4

Figure 4: Visualization of VLA-Cache token reuse across settings. (a) LIBERO simulation with

How

Figure 2

Figure 2: VLA-Cache accelerates the VLA’s language decoding process across timesteps via the

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: VLA-Cache는 로봇 조작의 시간적 특성을 창의적으로 활용하여 학습 불필요한 상태에서 실질적 추론 가속을 달성한 실용적이고 우수한 연구이다. 작업 관련성 필터링과 layer-adaptive 전략의 정교함과 광범위한 실증이 높은 가치를 제공한다.

같이 보면 좋은 논문

기반 연구TraceVLA는 efficient VLA token 운용으로 시간적 중복성을 활용하므로, VLA-Cache의 캐싱 전략에 직접적 이론적 배경을 제공함.
기반 연구FAST 논문은 효과적인 액션 토크나이제이션을 다루며, VLA-Cache의 적응적 토큰 캐싱 전략의 이론적 및 방법론적 배경을 제공한다.
다른 접근1617은 cache를 활용한 효율적 VLA 정책 구현을 다루어, 1289의 token/flow 압축 방식과 비교될 수 있다.
다른 접근SpecPrune-VLA는 불필요 토큰 프루닝을 통한 VLA 모델 추론 가속화에 중점을 두어, VLA-Cache의 캐싱 기반 가속과는 상반된 구조적 접근을 제공한다.
응용 사례FlowPolicy는 실시간/효율적 추론에 특화된 flow-based policy 구조로, 정적 캐싱 접근과 비교해봄으로써 실제 성능 적용의 시사점을 얻을 수 있다.
응용 사례SmartWay에서 프레임 간 중복 및 워페인트 프레임 추적을 활용하는 내비게이션 개선 전략은 VLA-Cache의 효율화 개념과 연관된다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드