저자: Chi-Lam Cheang, Guangzeng Chen, Ya Jing, Tao Kong, Hang Li, Yifeng Li, Yuxiao Liu, Hongtao Wu, Jiafeng Xu, Yichu Yang, Hanbo Zhang, Minzhao Zhu | 날짜: 2024-10-08 | URL: https://arxiv.org/abs/2410.06158 📄 PDF
Essence
Figure 1: Overview. GR-2 undegoes two stages of training: video generation pre-training and robot data
GR-2는 38백만 개의 비디오 클립으로 대규모 사전학습한 후 로봇 궤적으로 미세조정하는 generative video-language-action 모델로, 100개 이상의 조작 작업에서 97.7% 평균 성공률을 달성하고 미보기 시나리오에 뛰어난 일반화를 보인다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: GR-2는 대규모 비디오 사전학습과 로봇 데이터 미세조정을 효과적으로 결합하여 로봇 조작의 일반화 능력을 획기적으로 향상시킨 논문이다. 100개 이상의 작업을 소수의 궤적으로 학습하고 미보기 시나리오에 강력한 성능을 보여 실제 로봇 응용에 높은 잠재력을 입증한다.
같이 보면 좋은 논문
기반 연구GR-2는 대규모 비디오-언어-액션 모델로, GR-1의 멀티모달 사전학습 및 조작 정책의 향상 연구로 볼 수 있다.
다른 접근Unleashing Large-Scale Video Generative Pre-training for Vision-Language-Action Models에서는 비디오와 작업 데이터를 통한 사전학습 기법을 GR-2와 다른 방식으로 적용합니다.
기반 연구Reactive Diffusion Policy(1524)는 비주얼-액션 결합 정책에 diffusion 프로세스를 적용하며 GR-2의 비디오-액션 공동 예측 기능과 기술적 유사성을 보인다.
기반 연구GR-2는 대규모 web-scale VLA 사전학습과 로봇 궤적 미세조정을 통해 Embodied-R이 다루는 지각-추론-행동 통합을 실제로 확장·적용했습니다.
다른 접근둘 다 대규모 데이터로 훈련된 generative VLA 모델이지만 GR00T N1은 dual system 구조에, GR-2는 단일 video-language-action 모델에 집중한다
다른 접근Parallels Between VLA Model Post-Training and Human Motor Learning 논문은 VLA 정책 사후학습과 인간 모터러닝의 유사성 관점에서 GR-2의 transfer learning 효과를 다른 시각에서 해석합니다.
다른 접근Genie Envisioner(1406)는 비디오 diffusion 기반 프레임워크인 반면, GR-2는 대규모 비디오와 로봇 궤적 데이터를 통합적으로 학습하여 실로 전이한다.
후속 연구Unified Vision-Language-Action Model은 대규모 데이터와 다양한 조작 task를 통해 GR-2의 방식과 유사하게 통합형 VLA 프레임워크로 확장합니다.
후속 연구GR-2(1409)는 GR-3(1410)의 전거로, 웹 규모 데이터와 로봇 궤적의 통합 학습 방식을 이어받는다.
후속 연구NORA-1.5는 웹-스케일 데이터 기반 VLA 사전학습 및 fine-tuning을 다루어, GR-2와 유사한 대규모 데이터 전이 사례를 보여줍니다.