저자: Cheng Chi, Zhenjia Xu, Siyuan Feng, Eric Cousineau, Yilun Du, Benjamin Burchfiel, Russ Tedrake, Shuran Song | 날짜: 2023-03-07 | URL: https://arxiv.org/abs/2303.04137 📄 PDF
Essence
Figure 1. Policy Representations. a) Explicit policy with different types of action representations. b) Implicit policy
Robot 조작 작업을 위한 visuomotor policy를 conditional denoising diffusion process로 표현하는 Diffusion Policy를 제안하며, 4개 벤치마크의 15개 작업에서 평균 46.9% 성능 향상을 달성했다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: Diffusion model의 강력한 생성 능력을 robot policy learning에 창의적으로 도입하여 multimodality, scalability, training stability 문제를 동시에 해결한 획기적 연구로, 광범위한 실험과 기술적 기여를 통해 robot learning 분야에 새로운 패러다임을 제시한다.
같이 보면 좋은 논문
기반 연구Diffusion Models for Robotic Manipulation: A Survey는 diffusion policy의 다양한 변형과 현황을 총정리하여, Diffusion Policy 논문의 기본적 배경을 제공한다.
후속 연구Diffusion Policy 논문은 diffusion model 기반의 비주얼-모터 정책 학습에 대한 기본 아이디어를 제공하여 응용 서베이의 핵심 기반이 됩니다.
다른 접근Diffusion Policy 논문은 action trajectory 생성을 diffusion 방식으로 model 하므로, UVA의 분리된 확산 헤드–공유 잠재 표현 방식과 비교 가능한 정책 학습 대안이 된다.
다른 접근Diffusion Policy(1362)는 시각 기반 정책 학습에서 diffusion 모델을 직접 활용하여,
1524의 Slow-Fast 구조 없이도 비슷한 접촉 기반 조작 문제 해결을 시도한다.
다른 접근1580의 Streaming Flow Policy는 diffusion이나 flow-matching 기반의 정책을 단순화하고 실시간에 맞춰 조정하는 대안 모델로, Diffusion Policy와 성능·효율성 비교가 가능하다.
후속 연구Diffusion Policy 논문은 diffusion/flow 기반 정책 모델의 기본 개념을 제공해, Streaming Flow Policy의 흐름 샘플링 파이프라인의 이론적 기반이 된다.
다른 접근Diffusion Policy 논문은 action diffusion을 활용해 ManiFlow의 consistency flow 방식과 다른 접근으로 generalization을 시도한다.
다른 접근Compose Your Policies는 diffusion/flow/trajectory 모델 정책 융합을 통해 동작 다양성과 성능을 끌어올리는 방안을 실험하므로, Diffusion Policy의 한계 극복의 새로운 접근법입니다.
후속 연구Diffusion Policy(1362)는 행동의 diffusion 기반 학습 주제를 개척하며, ROSIE(1565)의 text-to-image diffusion 기반 데이터 증강에 이론적 기반을 제공한다.
후속 연구Diffusion Policy: Visuomotor Policy Learning 논문은 확산 정책을 통한 비쥬얼-모터 제어의 이론적 기초를 제공해, 본 논문의 diffusion policy 기반 증류에 개념적 토대를 마련한다.
후속 연구Diffusion Policy 논문은 3D Diffusion Policy와 같은 diffusion 기반 로봇 정책 학습의 이론적 토대를 제공한다.
후속 연구Diffusion Transformer Policy는 diffusion policy의 아키텍처를 대형 transformer로 확장하여, scaling 관점에서 기존 diffusion policy보다 generalist 성능을 향상시킵니다.
후속 연구One-Step Diffusion Policy는 diffusion policy의 실행 속도 문제와 효율성 개선을 목표로, Diffusion Policy의 실용화 한계를 확장 해결한다.
후속 연구Diffusion Policy는
1522의 RDT-1B와 같이 action diffusion 기반 로봇 정책 학습의 이론적 기반이 된다.
후속 연구Diffusion Policy 논문은 CogACT에서 사용된 diffusion 기반 행동 생성 모듈의 핵심 이론적 배경을 제공하므로, 두 논문을 함께 읽으면 diffusion action transformer의 역할을 깊게 이해할 수 있습니다.
후속 연구Diffusion Policy 논문은 diffusion 기반 비주얼-모터 정책 학습의 핵심 방법론으로, 계층적 diffusion policy 아이디어의 이론적 기반이 됩니다.
후속 연구1375의 MoDE 논문은 Diffusion Policy의 효율적 확장(Mixture-of-Expert 등)을 통해
1362의 기본 구조를 성능과 자원 측면에서 발전시킨다.
후속 연구Diffusion Policy 논문은 Diffusion 기반 정책학습의 핵심 이론적 기반을 제공하여 NavigateDiff에 직간접적으로 영향을 준다.
후속 연구Diffusion Policy: Visuomotor Policy Learning via Action Diffusion은 3D 물리 환경에서 diffusion을 활용한 정책/제어 학습의 신경망 구조를 이론적으로 제공한다.
후속 연구Diffusion Policy 논문은 행동 생성에 diffusion을 활용하는 H³DP의 근간이 됩니다.
후속 연구Diffusion Policy는 시뮬레이션 상에서 diffusion 기반 로봇 제어 정책을 제안해
1488의 NavDP 방법론의 이론적 기반이다.
후속 연구Diffusion Policy는 VLA 모델에서 action diffusion을 통한 행동 생성 핵심 원리로, CEED-VLA의 추론 속도 개선 전략의 이론적 베이스다.
후속 연구Diffusion Policy 논문은 pre-trained diffusion policy를 활용하는 human imitation 및 action refinement의 이론적 기반을 제공한다.
후속 연구Diffusion Policy 논문은 action diffusion 기반 정책 학습의 기본 원리를 제안하며, Latent Action Diffusion의 이론적 바탕을 제공한다.
후속 연구Diffusion Policy 논문은 Vision-to-Action Flow Matching Policy(1613)의 디퓨전 기반 행동 예측의 구조적 기초를 제공함.
후속 연구Diffusion Policy(1362)는 vision-language-action 모델에 diffusion 기반 행동 정책 학습을 적용한 주요 이론적 기반을 제공한다.