Humanoid-DART: Humanoid Loco-Manipulation using Diffusion-guided Augmentation through Relabeling and Tracking
저자: Pranav Debbad, Kanish Thiagarajan, Victor Dhédin, Shafeef Omar, Majid Khadiv | 날짜: 2026-06-26T00:41:32Z | DOI: 10.48550/ARXIV.2606.26855📄 PDF
⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: CC BY
Essence
Fig. 2.
본 논문은 희소한 인간 시연으로부터 시작하여 diffusion model 기반의 궤적 생성과 강화학습 기반의 추적 정책을 반복적으로 결합하는 자가지도 프레임워크 Humanoid-DART를 제안한다. 이를 통해 목표 공간을 자동으로 탐색하면서 인간형 로봇의 다양한 로코-조작 기술을 학습할 수 있음을 보여준다.
Motivation
Known: 인간 시연을 활용한 인간형 로봇 제어는 주로 모션 캡처나 원격 조작을 통해 수집된 대규모 데이터셋에 의존해왔으며, diffusion model은 고차원 이미지 및 모션 합성에서 강력한 생성 모델로 입증되었다. 또한 강화학습에서의 커리큘럼 학습은 에이전트의 점진적 기술 습득을 가능하게 하는 잘 알려진 방법이다.
Gap: 기존의 로코-조작 학습 방법들은 시연 데이터의 커버리지에 의해 근본적으로 제한되어 있으며, 물체의 자세, 운반 구성, 파악 전략 등으로 인한 조합론적 태스크 공간을 직접 시연만으로는 효율적으로 커버할 수 없다. 또한 diffusion model 기반의 기존 인간형 로봇 제어 방법들은 대규모 데이터에 의존하고 있어 희소한 시연 환경에서의 확장성이 부족하다.
Why: 로코-조작 기술의 학습은 로봇 산업에서 핵심적인 문제이며, 시연 데이터 수집의 비용을 줄이면서도 다양한 목표 공간을 커버하는 정책을 학습하는 것은 실질적인 로봇 배포에 매우 중요하다.
Approach: Kinematic Motion Generator로 목표 조건부 Diffusion Transformer를 사용하여 궤적 생성하고, Physics-Based Evaluator로 시뮬레이션에서 물리적 타당성을 검증한 후, Motion Tracking Policy를 강화학습으로 학습시킨다. 이 세 컴포넌트를 반복적으로 결합하는 커리큘럼 알고리즘을 적용하며, 근처 목표로의 탐색 확장과 목표 재라벨링 전략을 통해 점진적으로 행동 레퍼토리를 확장한다.
Achievement
Fig. 1.
• 첫 번째 반복적 궤적 증강 파이프라인 제시: 목표 조건부 로코-조작 기술 학습을 위한 첫 번째 반복적 궤적 증강 파이프라인인 Humanoid-DART를 제시. • 세 가지 핵심 설계 선택: 계층적 목표 조건부 Diffusion Transformer, 객체 자세에 조건화된 강화학습 전신 컨트롤러, 목표 재라벨링 전략을 포함한 커리큘럼 알고리즘. • 아키텍처 혁신: 근 및 객체 모션을 국소 특성으로부터 분리하는 이중 분기 diffusion transformer 아키텍처와 구조화된 부분 언마스킹 기법 도입. • 실증적 검증: 푸시, 킥, 손 전달, 픽 앤 플레이스 태스크에서 단 4개의 기초 시연으로부터 광범위한 목표 공간 커버리지와 시드 분포를 벗어난 목표로의 일반화 달성.
How
Fig. 3.
• Egocentric 표현으로 전문가 시연을 분할 변환하고 로봇 로컬 좌표 프레임 기준으로 특성 정규화 • 이중 분기 backbone으로 근 및 객체 모션과 관절 위치 같은 국소 특성 분리 • 구조화된 부분 언마스킹으로 훈련 중 미래 특성 그룹을 선택적으로 노출하여 유용한 상관관계 학습 • 수원지 목표 분포 주변의 표본 목표 상태로 탐색 확장하는 커리큘럼 • 적합도 함수 threshold를 초과하는 궤적만 아카이브에 유지 • 근처 목표 롤아웃을 유효한 훈련 신호로 변환하는 목표 재라벨링 전략
Originality
• Diffusion model과 강화학습 추적의 반복적 결합으로 희소 시연 증강: 기존 character animation 분야의 PARC와 달리 연속적 객체-목표 공간에서 로봇-객체 접촉을 명시적으로 고려하여 로코-조작 문제를 해결 • 이중 분기 diffusion transformer 아키텍처: 근 모션과 객체 모션을 국소 특성으로부터 분리하는 새로운 아키텍처 설계 • 구조화된 부분 언마스킹: 희소 데이터 환경에서 신규 궤적 합성을 개선하는 새로운 훈련 기법
Limitation & Further Study
• 희소 데이터 환경에서 diffusion model의 mode collapse 위험성이 완전히 해결되지 않음 • 커리큘럼의 목표 샘플링 전략이 문제별 자동화되지 않으며 수동 조정이 필요할 가능성 • 물리 시뮬레이터 기반 검증으로 인한 시뮬레이션-현실 갭 존재 가능성 • 실제 로봇 실험이 제한적일 수 있으며 더 다양한 로코-조작 태스크에서의 검증 필요 • 계산 비용과 수렴 속도에 대한 상세한 분석 부족
총평: 본 논문은 희소 시연으로부터 인간형 로봇의 목표 조건부 로코-조작 기술을 학습하는 실질적인 문제를 해결하는 혁신적인 프레임워크를 제시한다. Diffusion model과 강화학습의 반복적 결합, 이중 분기 아키텍처, 구조화된 언마스킹 등 여러 기술적 기여를 통해 강한 실증적 결과를 달성하였으며, 실제 물리 로봇에서의 검증으로 실용적 가치를 입증하였다.