MineDojo: Building Open-Ended Embodied Agents with Internet-Scale Knowledge

저자: Linxi Fan, Guanzhi Wang, Yunfan Jiang, Ajay Mandlekar, Yuncong Yang, Haoyi Zhu, Andrew Tang, De-An Huang, Yuke Zhu, Anima Anandkumar | 날짜: 2022-06-17 | URL: https://arxiv.org/abs/2206.08853 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 1

Figure 1: MINEDOJO is a novel framework for developing open-ended, generally capable agents

MineDojo는 Minecraft 게임을 기반으로 수천 개의 개방형 작업, 인터넷 규모의 멀티모달 지식베이스(YouTube 영상, Wiki, Reddit), 그리고 사전학습된 비디오-언어 모델을 보상함수로 활용하는 에이전트 학습 알고리즘을 통합하여 일반화 능력을 갖춘 embodied agent를 개발하는 프레임워크이다.

Motivation

Achievement

Figure 2

Figure 2: Visualization of our agent’s learned behaviors on four selected tasks. Leftmost texts are the

How

Figure 4

Figure 4: Algorithm design. MINECLIP is a contrastive video-language model pre-trained on

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: MineDojo는 개방형 환경, 인터넷 규모 지식베이스, 대규모 사전학습 모델을 통합하여 일반화된 embodied agent 연구의 완성도 높은 프레임워크를 제공하며, 전체 코드와 데이터를 공개함으로써 커뮤니티 기여도 우수하다. 다만 다른 도메인 전이 가능성 검증과 더 복잡한 작업에서의 성능 확장이 향후 과제이다.

같이 보면 좋은 논문

기반 연구MineDojo는 인터넷 기반 텍스트와 시각 데이터를 활용하여 ALFRED의 instruction-following benchmark를 더욱 다양하고 대규모 환경에 확장하는 실제 사례를 제공한다.
기반 연구MineDojo는 실제 환경(마인크래프트)에서 VLA 기반 로봇의 실행 실패 및 제약 만족에 관해 다양한 예시를 구현한다.
다른 접근MineDojo도 Minecraft 환경에서 LLM 기반 오픈엔디드 embodied agent 생성에 초점을 맞추고 있어, Voyager와 비교해 학습 방법과 커리큘럼 차이를 논의할 수 있다.
후속 연구Voyager는 MineDojo의 오픈엔디드 에이전트 프레임워크 위에서 LLM을 활용한 장기 탐색에 초점을 맞춰 더욱 진화된 시스템을 선보인다.
다른 접근Genie: Generative Interactive Environments는 복합적 시뮬레이션 환경에서 에이전트 학습을 지향하며, MineDojo의 접근에 대한 다양한 대안과 확장 가능성을 보여줍니다.
다른 접근MineDojo는 LLM 설명 기반 시뮬레이션 에이전트 학습에 중점을 두며 skill chaining보다는 open-ended 방식에 가깝다.
다른 접근MineDojo는 다양한 도구 사용 및 manipulation이 가능한 범용 agent를 다루어, UniAff의 통합 representation과 상이한 오픈월드 multi-task 접근을 보여준다.
다른 접근MineDojo(1477)는 마인크래프트 내에서의 오픈엔디드 언어-비전-행동 벤치마크를 제공하여 1621의 실제 로봇 환경 기반 벤치마크와 대상 및 난이도 관점에서 흥미로운 대조점을 제공한다.
다른 접근MineDojo는 대규모 웹 기반 무라벨 영상에서 정책을 학습하므로, CLAM의 라벨 없는 데이터로부터 continuous latent action space 학습 방법과 비교할 수 있습니다.
다른 접근MineDojo에서는 LLM, VLM 기반의 open-ended dual acting/decision 방식을 채택하므로 DualVLN과 완전히 다른 환경과 대상에 적용된 dual-system 사례입니다.
다른 접근Being-H0.5 논문도 다양한 embodied 환경에서 인간 중심의 범용 에이전트 학습을 추구해, 접근 방식의 차이와 한계를 분석할 수 있다.
후속 연구MineDojo는 Minecraft와 같은 오픈월드 환경에서 멀티태스크 학습 프레임워크를 제공하므로, DEPS 방식의 복수 목적 에이전트 연구에 핵심적 배경이 된다.
후속 연구MineDojo는 JARVIS-1의 마인크래프트 오픈월드 대용량 데이터셋과 에이전트 벤치마킹의 이론적 기반을 제공합니다.
후속 연구LLM-State는 MineDojo와 유사한 open-world 환경에서 장기 상태 추적과 작업 계획 실행의 효율성을 향상시키는 연구로 이어집니다.
후속 연구MineDojo는 Minecraft 기반 개방형 에이전트 플랫폼으로, MP5가 실제로 실험한 주요 인프라 및 멀티모달 태스크의 기초가 됩니다.
후속 연구MineDojo 논문은 Minecraft 환경에서 대규모 데이터로 embodied agent를 학습하는 방식의 기반을 제공하여, MineDreamer의 CoI 메커니즘 이해를 돕습니다.
후속 연구MineDojo는 Minecraft와 같은 상업 및 연구 환경 내 embodied agent 학습 프레임워크로, SIMA의 다양한 3D 환경 언어 기반 에이전트 개발에 이론적 인프라를 제공한다.
후속 연구MineDojo: Building Open-Ended Embodied Agents with Internet-Scale Knowledge는 대규모 heterogeneous 데이터셋으로부터 사전학습하는 전임 학습 방법론의 이론적 배경을 제공한다.
후속 연구MineDojo 논문은 대규모 시뮬레이션 환경에서 embodied agent의 시뮬레이터-현실 전이 및 generalization을 다뤄 관련 이론적 기반을 제공한다.
후속 연구MineDojo는 웹스케일 비전-언어 데이터와 궤적 데이터 통합 및 활용 방면에서 GR-3의 method와 유사하므로 개념적 기반이 됩니다.
응용 사례PaLM-E는 인터넷 규모 데이터와 멀티태스크 embodied agent를 실제 조작 환경에 적용한 사례로, MineDojo의 generalist agent 개념을 현실적 로봇 응용까지 발전시킵니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드