DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset

저자: Alexander Khazatsky, Karl Pertsch, Suraj Nair, Ashwin Balakrishna, Sudeep Dasari, Siddharth Karamcheti, Soroush Nasiriany, Mohan Kumar Srirama, Lawrence Yunliang Chen, Kirsty Ellis, Peter David Fagan, Joey Hejna, Masha Itkina, Marion Lepert, Yecheng Jason Ma, Patrick Tree Miller, Jimmy Wu, Suneel Belkhale, Shivin Dass, Huy Ha, Arhan Jain, Abraham Lee, Youngwoon Lee, Marius Memmel, Sungjae Park, Ilija Radosavovic, Kaiyuan Wang, Albert Zhan, Kevin Black, Cheng Chi, Kyle Beltran Hatch, Shan Lin, Jingpei Lu, Jean Mercat, Abdul Rehman, Pannag R Sanketi, Archit Sharma, Cody Simpson, Quan Vuong, Homer Rich Walke, Blake Wulfe, Ted Xiao, Jonathan Heewon Yang, Arefeh Yavary, Tony Z. Zhao, Christopher Agia, Rohan Baijal, Mateo Guaman Castro, Daphne Chen, Qiuyu Chen, Trinity Chung, Jaimyn Drake, Ethan Paul Foster, Jensen Gao, Vitor Guizilini, David Antonio Herrera, Minho Heo, Kyle Hsu, Jiaheng Hu, Muhammad Zubair Irshad, Donovon Jackson, Charlotte Le, Yunshuang Li, Kevin Lin, Roy Lin, Zehan Ma, Abhiram Maddukuri, Suvir Mirchandani, Daniel Morton, Tony Nguyen, Abigail O'Neill, Rosario Scalise, Derick Seale, Victor Son, Stephen Tian, Emi Tran, Andrew E. Wang, Yilin Wu, Annie Xie, Jingyun Yang, Patrick Yin, Yunchu Zhang, Osbert Bastani, Glen Berseth, Jeannette Bohg, Ken Goldberg, Abhinav Gupta, Abhishek Gupta, Dinesh Jayaraman, Joseph J Lim, Jitendra Malik, Roberto Martín-Martín, Subramanian Ramamoorthy, Dorsa Sadigh, Shuran Song, Jiajun Wu, Michael C. Yip, Yuke Zhu, Thomas Kollar, Sergey Levine, Chelsea Finn | 날짜: 2024-03-19 | URL: https://arxiv.org/abs/2403.12945 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 1

Fig. 1: We introduce DROID (Distributed Robot Interaction Dataset), an “in-the-wild” robot manipulation dataset with 76k

DROID는 북미, 아시아, 유럽의 564개 장면과 86개 작업에서 수집한 76k개의 시연 궤적(350시간)을 포함하는 대규모 다양한 로봇 조작 데이터셋이며, 이를 통해 훈련한 정책이 높은 성능과 일반화 능력을 보인다.

Motivation

Achievement

Figure 1

Fig. 1: We introduce DROID (Distributed Robot Interaction Dataset), an “in-the-wild” robot manipulation dataset with 76k

How

Figure 2

Fig. 2: The DROID robot platform. We use the same hardware

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: DROID는 로봇 조작의 대규모 분산 데이터 수집의 실질적 가치를 입증하고, in-the-wild 환경에서의 unprecedented 장면 다양성(564 scenes)과 지리적 다양성을 통해 로봇 정책의 일반화 능력을 크게 향상시키는 의미 있는 기여이다. 단일 하드웨어 스택 제약과 제한된 평가 실험은 아쉬우나, 오픈소스 공개와 명확한 기여로 로봇 학습 커뮤니티에 중대한 영향을 미칠 것으로 예상된다.

같이 보면 좋은 논문

기반 연구1323의 BridgeData V2는 대규모 로봇 시연 데이터셋으로, DROID와 같이 수집된 방대한 data를 통한 정책 성능 및 일반화 효과 분석의 근간이 된다.
다른 접근DROID는 실제 환경에서 수집된 대규모 manipulation 데이터셋으로, BridgeData V2와 유사한 문제를 다른 범위와 방식에서 해결합니다.
기반 연구DROID(1372)는 대규모 실제 데이터 기반 조작 벤치마크로, GRUtopia(1417)의 시뮬레이션 결과가 실제 데이터로 연결될 때의 활용성이 크다.
기반 연구DROID는 실제 다양한 환경의 로봇 조작 데이터를 제공하여 π0.5의 open-world generalization 평가 및 확장에 적용 가능하다.
다른 접근robosuite는 모듈형 시뮬레이션 및 벤치마크를 제공하여 DROID와 마찬가지로 다양한 로봇 조작 데이터셋을 다루지만 환경과 수집 범위가 다릅니다.
다른 접근R3M의 인간 비디오 기반 표현학습과 달리 DROID는 실제 환경에서 수집된 조작 데이터셋을 이용하여 정책 학습을 수행한다.
다른 접근DROID는 대규모 자연환경 로봇 데이터셋 확보에 집중하여, ROSIE의 확산 기반 증강과 실제 데이터 수집 기반 방법을 대비해볼 수 있다.
다른 접근DROID는 대규모 실세계 로봇 모방 데이터셋을 제공하며, LOTUS의 지속적 모방 학습이 목표로 하는 시각 기반 조작과 데이터 활용 방법론을 달리합니다.
후속 연구LOTUS는 다양한 테스크에 대한 로봇 연속적 모방 학습 프레임워크로 DROID의 대규모 데이터셋 활용을 실질적으로 확장 적용합니다.
다른 접근DROID는 실제 환경의 대규모 로봇 조작 데이터셋 구축 및 활용을 다루어 AutoRT의 데이터 수집과 다른 방식을 보여줍니다.
다른 접근DROID는 실제 환경에서 다양한 조작 데이터셋을 제공하여, PointWorld의 3D 포인트 기반 조작과 실 데이터 응용 결과를 비교할 수 있습니다.
후속 연구DROID는 실제 환경에서 VLA 정책 학습용 대규모 데이터를 제공하며, SPRINT 모델의 대규모 오프라인 RL과 skill chaining 성능 검증에 활용될 수 있다.
후속 연구DROID 논문은 대규모 실험 데이터를 제공하여, ExploRLLM의 샘플 효율성 및 정책 검증에 필요한 현실 데이터를 뒷받침합니다.
후속 연구1372는 대규모 in-the-wild 로봇 시연 데이터셋을 제공하여, 1448의 비지도 비디오 데이터기반 VLA 사전학습 기법 연구의 데이터 측면 기반을 제공한다.
후속 연구DROID와 같은 대규모 in-the-wild manipulation 데이터셋은 VLABench와 같이 실환경에서 벤치마크 평가를 지원하는 데이터의 이론적 기반이 됨.
후속 연구1535의 RoboArena는 DROID와 같이 다수 플랫폼과 여러 실제 환경에서 정책 평가를 지원하는 대규모 벤치마크 구축 사례로 후보 정책의 일반화 평가를 확장한다.
응용 사례RoboAgent 논문은 대규모 멀티환경 데이터로부터의 일반화 정책을 연구하며, DROID 데이터와 유사한 대규모 조작 연산 실험을 포함합니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드