DreamGen: Unlocking Generalization in Robot Learning through Video World Models

저자: Joel Jang, Seonghyeon Ye, Zongyu Lin, Jiannan Xiang, Johan Bjorck, Yu Fang, Fengyuan Hu, Spencer Huang, Kaushil Kundalia, Yen-Chen Lin, Loic Magne, Ajay Mandlekar, Avnish Narayan, You Liang Tan, Guanzhi Wang, Jing Wang, Qi Wang, Yinzhen Xu, Xiaohui Zeng, Kaiyuan Zheng, Ruijie Zheng, Ming-Yu Liu, Luke Zettlemoyer, Dieter Fox, Jan Kautz, Scott Reed, Yuke Zhu, Linxi Fan | 날짜: 2025-05-19 | URL: https://arxiv.org/abs/2505.12705 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 2

Figure 2: DREAMGEN Overview. We begin by fine-tuning a video world model on teleoperated robot trajectories.

DreamGen은 비디오 월드 모델(video world model)을 활용하여 최소한의 원격조종 데이터로부터 로봇 정책을 학습하는 4단계 파이프라인으로, 신규 행동과 환경에 대한 일반화를 달성한다.

Motivation

Achievement

Figure 4

Figure 4: Scaling # of Neural Trajectories in RoboCasa. We vary the sizes of neural trajectories (x-axis) and

How

Figure 3

Figure 3 shows the (a) architecture we use to train the IDM model and the (b) architecture that we use to train the

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: DreamGen은 비디오 월드 모델을 로봇 학습의 효율적인 데이터 생성 도구로 재정의하여, 최소한의 원격조종 데이터로 다양한 행동과 환경 일반화를 달성하는 혁신적이고 실용적인 접근법을 제시한다. 다중 embodiment 실세계 검증과 DreamGen Bench라는 체계적 평가 도구까지 제공하여 로봇 학습 확장의 새로운 방향을 제시한다.

같이 보면 좋은 논문

기반 연구비디오 world model 기반 로봇 학습의 방법론적 기반을 제공한다.
다른 접근로봇 제어를 위한 비전-언어 기반 기초 모델의 유사한 방법론을 제시한다.
다른 접근world model을 활용한 로봇 학습의 일반화를 위한 대안적 프레임워크이다.
다른 접근로봇 학습을 위한 데이터 증강 및 시뮬레이션 활용 전략에서 유사한 접근법을 취한다.
다른 접근복잡한 지형에서 다목적 로봇 보행을 위한 대안적 계획 및 제어 방법이다.
다른 접근모션 클러스터링을 활용한 휴머노이드 로봇의 다양한 동작 학습에 관한 유사한 연구이다.
다른 접근egocentric 비디오로부터 로봇 조작 정책을 학습하는 대안적 접근법이다.
다른 접근휴머노이드 로봇의 범용 행동 학습을 위한 유사한 파운데이션 모델 접근법이다.
다른 접근로봇 조작 정책의 관점 일반화를 위한 시연 생성 방법을 다루는 유사한 연구이다.
다른 접근소량의 데이터로부터 일반화된 로봇 정책을 학습하는 대안적 방법론이다.
다른 접근비디오 생성 모델을 로봇 학습에 활용하는 유사한 접근법이다.
다른 접근비디오 데이터를 활용한 로봇 정책 학습의 대안적 접근법을 제시한다.
다른 접근고수준 의도로부터 전신 협응과 조작을 생성하는 대안적 방법론을 제시한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드