D2E: Scaling Vision-Action Pretraining on Desktop Data for Transfer to Embodied AI

저자: Suhwan Choi, Jaeyoon Jung, Haebin Seong, Minchan Kim, Minyeong Kim, Yongjun Cho, Yoonshik Kim, Yubeen Park, Youngjae Yu, Yunsung Lee | 날짜: 2025-10-07 | URL: https://arxiv.org/abs/2510.05684 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1: Overview of D2E framework. (1) The OWA Toolkit captures 335.6 hours of rich desktop demon-

D2E는 데스크톱 환경(게임 등)에서 수집한 대규모 비전-액션 데이터를 사전학습 자료로 사용하여 로봇 조작 및 네비게이션 같은 구체화된 AI 작업으로 전이 학습하는 프레임워크를 제시한다.

Motivation

Achievement

Figure 1

Figure 1: Overview of D2E framework. (1) The OWA Toolkit captures 335.6 hours of rich desktop demon-

How

Figure 2

Figure 2: OWA Toolkit’s recording and storage architecture. (Left) ocap recorder captures perfectly

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: D2E는 데스크톱 환경을 구체화 AI의 실질적 사전학습 자료로 확립하는 종합 프레임워크를 제시하며, 공개 자료와 효율적 도구(OWA, Generalist-IDM, VAPT)를 통해 재현성과 실용성을 담보한다. 데이터 수집 비용 대비 로봇 성능의 우수한 달성은 AI 구체화 연구의 확장성 문제에 획기적 해결책을 제공한다.

같이 보면 좋은 논문

기반 연구D2E는 데스크톱 환경 데이터에서 pretrained foundation model generalization을 실험하여 1594가 제안한 generalization 패러다임의 실제 적용 가능성을 검토함.
기반 연구MuJoCo Playground는 데스크탑 환경에서의 대규모 비전-액션 데이터를 생성할 수 있는 시뮬레이션 플랫폼으로, D2E의 데이터 수집 기반이 될 수 있습니다.
다른 접근D2E는 장기 플레이 세그먼트에서 action pretraining을 통해 유사한 장기 계획, 모방 학습 효율성 관점에서 비교할 수 있다.
다른 접근Diffusion Models Are Real-Time Game Engines는 3D 환경에서의 고실감 world modeling을 다루어 D2E의 데스크탑 기반 사전학습 데이터와 world model 개념의 차이를 드러내는데 유용합니다.
다른 접근D2E는 데스크톱 데이터를 활용한 vision-action 사전학습 관점을 제공하여, 대규모 모델 사전학습 접근의 다른 길을 제시한다.
다른 접근Gemini Robotics 1.5 논문은 데스크톱 환경을 넘어서 실제 다양한 로봇 플랫폼으로 vision-action 사전학습 지식 전이 방법을 확장한다.
다른 접근로봇 학습을 위한 인간 비디오와 데스크톱 데이터라는 서로 다른 대규모 데이터 소스 활용 전략을 비교할 수 있습니다.
후속 연구WHALE 논문은 대규모 세계 모델 사전학습 및 범용 embodied agent의 이론적 프레임워크를 제시해 D2E의 스케일링 접근을 보완한다.
후속 연구Efficient Diffusion Transformer Policies는 대규모 사전학습 정책의 효율적인 활용을 논의하며, D2E의 데이터 전이 학습 방법과 시너지를 가질 수 있습니다.
응용 사례NORA-1.5는 world model 사전학습과 이를 통한 실제 로봇 응용을 보여주므로, D2E의 데스크톱 사전학습 전이 전략과 비교 실험 관점에서 참조할 만합니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드