Latent Action Pretraining from Videos

저자: Seonghyeon Ye, Joel Jang, Byeongguk Jeon, Sejune Joo, Jianwei Yang, Baolin Peng, Ajay Mandlekar, Reuben Tan, Yu-Wei Chao, Bill Yuchen Lin, Lars Liden, Kimin Lee, Jianfeng Gao, Luke Zettlemoyer, Dieter Fox, Minjoon Seo | 날짜: 2024-10-15 | URL: https://arxiv.org/abs/2410.11758 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 2

Figure 2: Overview of Latent Action Pretraining. (1) Latent Action Quantization: We first learn discrete

인터넷 규모의 라벨 없는 비디오에서 로봇 행동을 학습하기 위해 VQ-VAE 기반 잠재 행동 양자화와 Vision-Language-Action 모델 사전학습을 결합한 비지도 학습 방법을 제안한다.

Motivation

Achievement

Figure 3

Figure 3: Real-world Tabletop Manipulation Results. We evaluate on a total of 54 rollouts for each model

How

Figure 2

Figure 2: Overview of Latent Action Pretraining. (1) Latent Action Quantization: We first learn discrete

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 로봇 학습의 주요 제약인 행동 레이블 의존성을 제거하는 혁신적 접근으로, 비지도 학습을 통해 인터넷 규모 데이터 활용을 가능하게 하며, 상태 기술 기술을 능가하는 실제 성능 향상을 입증한 매우 중요한 연구이다.

같이 보면 좋은 논문

기반 연구R3M은 인간 비디오에서 사전학습된 시각 표현으로, 1448과 같이 인간 영상 기반 로봇 행동 학습 방법의 주요 기반이 된다.
다른 접근Latent Action Pretraining from Videos 논문은 R3M과 같이 Ego4D 등 인간 비디오 기반 비지도 representation을 이용하지만, latent action과 VLA 조합으로 다른 접근을 시도한다.
기반 연구Latent Action Pretraining from Videos는 비디오에서 추출된 latent를 활용한 정책 사전학습을 다루어, VIMA의 멀티모달 프롬프트 기반 정책 표현을 실질적으로 확장한다.
기반 연구1372는 대규모 in-the-wild 로봇 시연 데이터셋을 제공하여, 1448의 비지도 비디오 데이터기반 VLA 사전학습 기법 연구의 데이터 측면 기반을 제공한다.
다른 접근Phantom은 인간 비디오만 활용하여 로봇 행동을 학습하는 점에서, web-scale 비디오 기반의 잠재 행동 사전학습과 유사한 문제를 다룬다.
다른 접근UniSkill 논문은 web 비디오로부터 cross-embodiment skill transfer를 시도해 1448의 잠재 행동 사전학습 방법과 비교할 수 있는 대안이다.
다른 접근1481은 통합 latent action world model로 다양한 비디오 기반 행동 학습을 실현하며, 1448과 마찬가지로 라벨 없는 데이터에서 로봇 행동을 추출하는 접근을 제시한다.
후속 연구Latent Action Pretraining from Videos는 Moto 논문과 같이 비디오 데이터 기반 중간 표현 추출 및 사전학습 방식의 근간을 제공한다.
후속 연구Latent Action Pretraining from Videos 논문은 비디오 잠재 표현을 통한 액션 예측/생성을 다루며, Unified Video Action Model의 joint 비디오-액션 학습 방법에 기초 이론을 제공한다.
후속 연구VQ-VLA는 Vision-Language-Action 모델에서 scaling과 quantization 전략을 결합하여, 잠재 행동 양자화와 비지도 사전학습의 연계 측면에서 실질적 확장안을 제시한다.
응용 사례$_{0.5}$는 VLA 모델을 실제 로봇 제어에 적용하는 사례로, 1448의 사전학습 방식이 어떻게 현실 문제로 이어지는지 이해하는 데 도움이 된다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드