BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation

저자: Hongyu Wang, Chuyan Xiong, Ruiping Wang, Xilin Chen | 날짜: 2025-06-09 | URL: https://arxiv.org/abs/2506.07530 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 1

Fig. 1: We introduce BitVLA, the first fully native 1-bit vision-language-action (VLA) model for robotic manipulation, i

로봇 조작을 위한 완전한 1-bit Vision-Language-Action 모델인 BitVLA를 제안하여 11.0배의 메모리 감소와 4.4배의 지연 시간 단축을 달성하면서도 full-precision 기준 모델과 비슷한 성능을 유지한다.

Motivation

Achievement

Figure 1

Fig. 1: We introduce BitVLA, the first fully native 1-bit vision-language-action (VLA) model for robotic manipulation, i

How

Figure 2

Fig. 2: Overview of the three-stage training pipeline in BitVLA. We first perform multimodal training with a 1-bit LLM

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: BitVLA는 로봇 조작용 VLA 모델의 극단적 양자화의 첫 성공적 사례로, Quantize-then-Distill이라는 혁신적 훈련 전략을 통해 11배 메모리 감소와 4.4배 속도 향상을 달성하면서도 성능을 유지하여 엣지 로봇 배포의 실질적 경로를 제시한다.

같이 보면 좋은 논문

기반 연구BitVLA는 BeT와 달리 1-bit quantization을 통해 효율성을 극단적으로 높이는 방식으로 action token compression을 한 단계 더 발전시킵니다.
기반 연구FAST는 action tokenization과 VLA 모델의 효율화 연구로, BitVLA의 1-bit 토큰 압축 및 경량화 설계의 실질적 기반이다.
다른 접근BitVLA는 VLA 모델을 위한 저비트 압축 기반 fine-tuning을 제안해, FLaRe가 RL fine-tuning 효율화에 집중하는 것과 다른 접근을 취합니다.
다른 접근TinyVLA는 VLA 모델을 소형화하여 데이터 효율성과 연산 효율을 높이는 방식을 중점적으로 다루어, BitVLA와 함께 경량 로봇 정책 비교 분석이 가능하다.
다른 접근BitVLA는 모델 경량화로 실행 속도 향상을 추구하며, Running VLAs at Real-time Speed에서의 실시간 로봇 제어 최적화 방법과 비교해볼 수 있다.
후속 연구Consistency Policy는 diffusion 기반 정책의 추론 효율 개선 측면에서, BitVLA의 token quantization 방법과 상보적으로 읽을 수 있습니다.
응용 사례RLRC는 압축된 VLA 정책의 오류 복구 및 안정성 문제에 집중하므로 초저정밀 BitVLA의 실제 적용 가능성과 한계를 논의할 때 참고할 수 있습니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드