저자: Yifan Xie, YuAn Wang, Guangyu Chen, Jinkun Liu, Yu Sun, Wenbo Ding | 날짜: 2026-04-27 | URL: https://arxiv.org/abs/2604.24681 📄 PDF
라이선스: arXiv 비독점 라이선스
Figure 1: Overview of the HA-2.2M curation pipeline. Large-scale unlabeled human demonstration
본 논문은 대규모 인간 시연 영상으로부터 로봇 조작을 위한 인간-의도 사전을 학습하는 MoT-HRA 프레임워크를 제안한다. 220만 에피소드의 HA-2.2M 데이터셋을 구성하고, 3D 궤적 예측, MANO 스타일 손 모션 모델링, 로봇 행동 변환의 3단계 계층적 구조로 인간 시연의 재사용 가능한 부분을 보존하면서 로봇 특화 제어를 학습한다.
Figure 2: Overview of MoT-HRA. Given an image, a language instruction, and chunk-sized query
HA-2.2M 데이터셋: 220만 에피소드의 대규모 이질 인간 시연 데이터셋으로 손 중심 필터링, 공간 재구성, 시간 분할, 언어 정렬을 적용. MoT-HRA 프레임워크: 계층적 vision-language-action 모델로 인간 의도 사전을 로봇 제어에 전이. 실험 검증: 손 모션 생성, SimplerEnv 시뮬레이션, 실제 로봇 조작 과제에서 MoT-HRA가 모션 타당성, spatial grounding, 분포 변화 하 제어 견고성을 향상.
Figure 2: Overview of MoT-HRA. Given an image, a language instruction, and chunk-sized query
총평: 본 논문은 대규모 인간 시연으로부터 로봇 조작을 학습하는 실질적 도전에 대해 잘 정의된 계층적 접근을 제시한다. 220만 에피소드 HA-2.2M 데이터셋과 MoT-HRA의 knowledge insulation 설계는 인간 행동의 재사용 가능한 구조를 보존하면서 로봇 특화 제어를 학습하는 점에서 기여도가 있다. 다만 데이터셋 필터링 정확성, 실제 로봇 평가의 포괄성, 계산 효율성 분석이 강화될 필요가 있다.