DiWA: Diffusion Policy Adaptation with World Models

저자: Akshay L Chandra, Iman Nematollahi, Chenguang Huang, Tim Welschehold, Wolfram Burgard, Abhinav Valada | 날짜: 2025-08-05 | URL: https://arxiv.org/abs/2508.03645 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1: (a) Standard diffusion policies trained via imitation learning are limited by offline data. (b) DPPO [17]

DiWA는 학습된 world model을 활용하여 diffusion 기반 로봇 정책을 오프라인으로 미세조정하는 프레임워크로, RL을 통해 상상 속 롤아웃에서 정책을 개선한다.

Motivation

Achievement

Figure 1

Figure 1: (a) Standard diffusion policies trained via imitation learning are limited by offline data. (b) DPPO [17]

How

Figure 2

Figure 2: DiWA framework: (1) A world model is trained on unstructured robot play data to learn latent dynamics.

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: DiWA는 world model을 활용한 offlineRL로 diffusion policy 미세조정의 샘플 효율성을 획기적으로 개선한 혁신적 연구로, 실제 로봇 학습의 실무적 도전 과제를 해결하는 의미 있는 기여이다.

같이 보면 좋은 논문

기반 연구World Models 논문은 상상(rollout)을 통한 정책 개선이라는 DiWA의 중심 아이디어에 이론적 배경을 제공한다.
기반 연구1297은 시뮬레이션-실세계 간 정책 적응에 관한 실습적 전환법을 제안하여, DiWA의 상상 기반 policy 개선 방법의 현실 적용 토대를 설명한다.
기반 연구DiWA는 world models를 활용해 diffusion policy adaptation을 구현하며, Compose Your Policies!의 policy composition 개념을 더 세밀하게 확장합니다.
다른 접근MetaMorph는 transformer 기반 multi-policy adaptation을 다루어, diffusion policy adaptation with world models 접근과 대조적으로 볼 수 있다.
다른 접근DiWA 논문은 world model과 diffusion policy의 적응을 결합하여 DreamerV3와는 다른 방식의 범용 RL 정책 학습을 제안합니다.
다른 접근두 논문 모두 Diffusion Policy의 효율화에 초점을 두지만, DiWA는 월드 모델 기반 정책 적응에, MoDE는 Mixture-of-Experts 구조로 연산량 절감에 집중합니다.
다른 접근DiWA는 월드 모델 기반 정책 적응을 diffusion 방식으로 구현하여, EnerVerse의 embodied future space 예측과 유사 과제의 대안 접근입니다.
다른 접근1515의 Phantom은 오직 인간 비디오로만 로봇 정책을 학습·적응시키는 접근을 사용하여, world model 시뮬레이션 기반 로봇 미세조정(DiWA)과 비교된다.
응용 사례robosuite는 다양한 로봇 시뮬레이션 환경과 벤치마크를 제공하므로, DiWA와 같은 diffusion policy 기반 정책을 실제 적용 및 검증하는 데 활용될 수 있습니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드