DemoDiffusion: One-Shot Human Imitation using pre-trained Diffusion Policy

저자: Sungjae Park, Homanga Bharadhwaj, Shubham Tulsiani | 날짜: 2025-06-25 | URL: https://arxiv.org/abs/2506.20668 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 2

Fig. 2: Retargeted human hand trajectory to closed-loop robot action sequence, for the task T : “shut down the

DemoDiffusion은 단일 인간 시연으로부터 로봇이 조작 작업을 수행할 수 있도록 하는 방법으로, kinematic retargeting으로 얻은 궤적을 pre-trained diffusion policy를 이용해 개선한다.

Motivation

Achievement

Figure 4

Fig. 4: Real-World Manipulation Tasks. Human demonstrations for the 8 evaluation tasks, shown as two frames per task.

How

Figure 2

Fig. 2: Retargeted human hand trajectory to closed-loop robot action sequence, for the task T : “shut down the

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: DemoDiffusion은 pre-trained diffusion policy를 kinematic retargeting의 개선에 활용하는 우아한 접근법으로, 실제 환경에서 인간 시연만으로 로봇 조작을 가능하게 한다. 실세계 성능(83.8%)과 기존 방법 대비 우월성을 입증했으며, 실용적 배포 관점에서 높은 가치를 가진다.

같이 보면 좋은 논문

기반 연구MetaMorph 논문은 transformer 기반의 범용 행동 생성기를 소개하여 DemoDiffusion의 diffusion policy 기반 human imitation 접근법의 이론적 기반 역할을 합니다.
기반 연구DemoDiffusion 논문은 diffusion policy를 통해 one-shot imitation을 구현하여 MimicPlay의 모방 학습 전략을 강화합니다.
기반 연구Diffusion Policy 논문은 pre-trained diffusion policy를 활용하는 human imitation 및 action refinement의 이론적 기반을 제공한다.
기반 연구Grounding DINO는 robust visual feature로서 로봇 모방시연 추출의 기반을 제공하므로, DemoDiffusion의 입력 특성 안정화에 기여할 수 있습니다.
기반 연구DemoDiffusion은 one-shot imitation의 대안적 구조로 LLM 기반 스킬 체이닝과 imitation 및 RL 간 상호작용을 실증적으로 확장한다.
다른 접근Learning Fine-Grained Bimanual Manipulation with Low-Cost Hands는 실제 저비용 하드웨어에서의 imitation과 manipulation을 다루므로, DemoDiffusion의 one-shot imitation 성능과 실제 구현 간 차이를 분석하는 데 도움이 됩니다.
다른 접근DemoDiffusion 논문은 비슷하게 diffusion을 통한 one-shot imitation learning을 제안하지만, SPRINT와 달리 instruction relabeling 대신 diffusion 기반 imitation을 강조한다.
다른 접근Vision-Language Foundation Models as Effective Robot Imitators 논문은 one-shot imitation 영역에서 diffusion policy 외 VLM 기반 접근법을 제시한다.
다른 접근DemoDiffusion(1352)는 사전학습된 diffusion 모델을 활용하여 one-shot imitation을 달성하는 모델로, 적은 시연 기반 고정밀 조작과 유사 목표를 달성한다.
다른 접근DemoDiffusion 역시 one-shot imitation을 diffusion 기반 정책으로 해결하여 in-context imitation learning의 대체 솔루션을 제시한다.
다른 접근DemoDiffusion 논문은 pre-trained diffusion policy의 효율적 적용을 위한 one-shot imitation 흐름을 강조하며 distillation 방식의 trade-off를 비교할 수 있다.
다른 접근DemoDiffusion은 human demonstration 기반 action generation에서 diffusion/token 기반 접근의 상이한 특징을 제시하여 VQ-VLA와 비교가 가능하다.
후속 연구Motus는 latent action world model을 통해 DemoDiffusion의 kinematic retargeting 이후의 동작다양성 및 생성 능력을 한층 더 확장합니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드