GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data

저자: Shengliang Deng, Mi Yan, Songlin Wei, Haixin Ma, Yuxin Yang, Jiayi Chen, Zhiqi Zhang, Taoyu Yang, Xuheng Zhang, Wenhao Zhang, Heming Cui, Zhizheng Zhang, He Wang | 날짜: 2025-05-06 | URL: https://arxiv.org/abs/2505.03233 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY-NC-SA

Essence

Figure 1

Figure 1: GraspVLA is a grasping foundation model pre-trained exclusively on billion-scale syn-

SynGrasp-1B라는 10억 프레임 규모의 합성 데이터셋을 기반으로 GraspVLA라는 Vision-Language-Action 기반 집기 모델을 제시하며, 합성 데이터만으로 사전학습하여 실세계에서 강력한 제로샷 일반화와 소수샷 적응성을 달성한다.

Motivation

Achievement

Figure 1

Figure 1: GraspVLA is a grasping foundation model pre-trained exclusively on billion-scale syn-

How

Figure 3

Figure 3: GraspVLA consists of an autoregressive vision-language backbone and a flow-matching

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 이 논문은 로봇 조작 학습을 위한 합성 데이터의 대규모 활용 가능성을 최초로 체계적으로 입증하며, 10억 프레임 규모의 고품질 데이터셋과 혁신적인 Progressive Action Generation 메커니즘을 통해 실세계 배포 가능한 강력한 기반 모델을 제시한다.

같이 보면 좋은 논문

다른 접근GraspVLA는 비전-언어-행동 모델 기반의 그리핑 특화 조작 문제를 다루며, VLP와 달리 특정 행동 파이프라인 예측에 집중한다.
다른 접근DexGraspVLA는 GraspVLA와 같이 VLA 기반 집기 모델을 제안하지만, 합성 데이터가 아닌 실제 데이터 mixture와 transfer learning 기반 접근을 취해 방법론 차이를 보입니다.
다른 접근Phantom은 웹 기반 인간 동작 비디오로부터 로봇 집기 기술을 distill하는 접근으로, GraspVLA의 합성 데이터와 실세계 전이를 보완하는 사례입니다.
후속 연구RoboPoint는 Vision-Language 모델을 활용한 공간성 어포던스 예측 연구로, GraspVLA의 pretraining 가치를 실제 로봇 조작 task에 확장 적용합니다.
응용 사례Structured World Models from Human Videos(1581)는 합성 또는 실제 데이터 기반 대규모 사전학습 기법이 실제 로봇 조작성/집기에 어떻게 기여하는지를 보여준다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드