Genie: Generative Interactive Environments

저자: Jake Bruce, Michael Dennis, Ashley Edwards, Jack Parker-Holder, Yuge Shi, Edward Hughes, Matthew Lai, Aditi Mavalankar, Richie Steigerwald, Chris Apps, Yusuf Aytar, Sarah Bechtle, Feryal Behbahani, Stephanie Chan, Nicolas Heess, Lucy Gonzalez, Simon Osindero, Sherjil Ozair, Scott Reed, Jingwei Zhang, Konrad Zolna, Jeff Clune, Nando de Freitas, Satinder Singh, Tim Rocktäschel | 날짜: 2024-02-23 | URL: https://arxiv.org/abs/2402.15391 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1 | A whole new world: Genie is capable of converting a variety of different prompts into

Genie는 인터넷 비디오로부터 완전히 비감독 방식으로 학습된 첫 번째 생성형 인터랙티브 환경으로, 텍스트, 이미지, 스케치 등 다양한 프롬프트로부터 프레임 단위로 제어 가능한 가상 세계를 생성할 수 있다.

Motivation

Achievement

Figure 2

Figure 2 | Diverse trajectories: Genie is a gen-

How

Figure 3

Figure 3 | Genie model training: Genie takes in 𝑇frames of video as input, tokenizes them into

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: Genie는 비감독 행동 학습과 인터랙티브 환경 생성의 새로운 패러다임을 제시하는 매우 혁신적인 연구로, Foundation Model 규모에서 프레임 단위 제어성을 달성하며 미래의 일반화된 에이전트 훈련을 위한 중요한 기초를 마련한다.

같이 보면 좋은 논문

기반 연구Genie 논문은 병렬 시뮬레이션 환경에서 대규모 embodied agent 학습을 구현하여 1469의 simulation 플랫폼의 실제 활용 가능성을 보여준다.
기반 연구Genie는 생성형 인터랙티브 환경을 VLA 정책 사전학습·테스트에 활용할 수 있어, diffusion 기반 로봇 조작 정책 응용에 실질적 자원으로 쓰일 수 있습니다.
다른 접근Genie: Generative Interactive Environments는 복합적 시뮬레이션 환경에서 에이전트 학습을 지향하며, MineDojo의 접근에 대한 다양한 대안과 확장 가능성을 보여줍니다.
다른 접근Genie 논문 역시 대규모 generative 모델을 이용하여 인터랙티브 로봇 시뮬레이터를 구축해 1452와 유사 문제를 다른 방식으로 접근한다.
다른 접근Genie: Generative Interactive Environments는 생성을 통한 로봇 학습 환경 자동화 측면에서 RoboGen과 유사하지만, 적용 방법과 상호작용 방식이 다르다.
다른 접근Genie: Generative Interactive Environments도 대규모 상호작용 가능한 시뮬레이션 환경을 제공하므로, GRUtopia의 대규모 3D 도시 환경과 비교해볼 만합니다.
다른 접근Re$^3$Sim 논문은 3D 프린팅 기반 로봇 시뮬레이션 데이터 생성을 다룸으로써 Genie와는 다른 접근의 데이터 구축 방법을 보여준다.
후속 연구Open-vocabulary Queryable Scene Representations 논문은 Genie's open-ended world 생성 환경에서 장면을 쿼리하고 활용할 수 있는 구조적 표현 연구로 확장성을 보여줍니다.
후속 연구Genie는 생성 기반 가상 환경과 상호작용을 결합하여, 텍스트 조건부 영상 생성 기반의 범용 정책 학습 방식에 대한 이론적 토대를 제공합니다.
후속 연구GenSim 논문은 LLM을 활용해 Genie에서 요구하는 대규모 가상 작업과 시뮬레이션 데이터를 자동 생성하는 방법을 제시한다.
후속 연구Genie는 생성형 상호작용 환경 구축 기술을 제시하여 3D-VLA의 월드 모델링 및 행동 생성 전략의 기초가 된다.
후속 연구Genie: Generative Interactive Environments는 대규모 상호작용 환경 생성을 다루어, GameNGen의 diffusion 기반 실시간 시뮬레이션에 이론적 배경을 제공한다.
후속 연구Genie는 생성적 상호작용 환경을 통한 로봇 시뮬레이션 및 네비게이션 연구 기반을 제공하여, RoboTron-Nav의 시뮬레이션 기반 multitask 학습 관점에서 중요하다.
후속 연구Genie 논문은 비지도 학습 기반 데이터셋을 제공하여 DataMIL의 데이터 선택 정책의 적용 범위를 넓힌다.
후속 연구VLABench는 생성형 환경에서 언어 조건 정책을 벤치마킹 하는 측면에서 Genie로 생성된 다양한 virtual world 응용을 실제 평가로 확장합니다.
후속 연구Genie는 인터넷 비디오 기반의 생성형 인터랙티브 환경을 제공하여 Genie Envisioner가 활용할 수 있는 월드 모델의 근본적 토대를 제공합니다.
응용 사례MuBlE는 MuJoCo와 Blender 기반의 시뮬레이션 환경 및 벤치마크를 제공하여 Genie에서 생성된 가상세계가 물리 엔진 기반 환경에서 어떻게 활용될 수 있는지 보여줍니다.
반론/비판Genie는 생성적 상호작용 환경과 물리 기반 적합성을 중시하여, RoboFlamingo처럼 미세조정 최소화 방법의 장단점 평가에 반론적 시각을 제공한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드