RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation
저자: Songming Liu, Lingxuan Wu, Bangguo Li, Hengkai Tan, Huayu Chen, Zhengyi Wang, Ke Xu, Hang Su, Jun Zhu | 날짜: 2024-10-10 | URL: https://arxiv.org/abs/2410.07864📄 PDF
⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: arXiv 비독점 라이선스
Essence
Figure 1: Overview of Robotics Diffusion Transformer with 1B-Parameters (RDT-1B), a
bimanual manipulation을 위한 1.2B 파라미터 규모의 diffusion foundation model인 RDT를 제시하며, 다중 로봇 데이터셋 사전학습과 physically interpretable unified action space를 통해 높은 일반화 성능을 달성한다.
Motivation
Known: bimanual manipulation은 로봇 응용에서 필수적이지만 두 팔의 조정 복잡성과 데이터 부족으로 인해 어렵다. 최근 unimanual manipulation을 위한 foundation model 개발이 진행 중이다.
Gap: bimanual manipulation의 multi-modal action distribution을 효과적으로 표현하면서 동시에 heterogeneous multi-modal input의 scalability를 확보해야 한다. 또한 서로 다른 로봇의 action space variation으로 인한 negative transfer 문제가 해결되지 않았다.
Why: bimanual manipulation foundation model은 복잡한 실제 작업에 대한 일반화 가능성을 제공하며, 데이터 부족과 아키텍처 한계를 극복하는 것이 로봇 자동화의 실용적 응용에 중요하다.
Approach: diffusion transformer를 backbone으로 하여 multi-modality를 표현하고, physically interpretable unified action space를 도입하여 서로 다른 로봇의 action representation을 통합한다. 46개 데이터셋으로 사전학습 후 6K+ 에피소드의 bimanual 데이터로 fine-tuning한다.
Achievement
Figure 1: Overview of Robotics Diffusion Transformer with 1B-Parameters (RDT-1B), a
Multi-modal Action 표현: diffusion model의 capacity를 활용하여 bimanual manipulation의 복잡한 action distribution을 효과적으로 모델링
총평: RDT-1B는 bimanual manipulation을 위한 diffusion foundation model의 획기적 사례로, physically interpretable unified action space 개념과 맞춤형 architecture 설계를 통해 multi-modality와 data heterogeneity 문제를 효과적으로 해결하였으며, 대규모 사전학습과 강력한 실험 결과로 로봇 자동화의 실질적 진전을 보여준다.