Learning Human-Intention Priors from Large-Scale Human Demonstrations for Robotic Manipulation

저자: Yifan Xie, YuAn Wang, Guangyu Chen, Jinkun Liu, Yu Sun, Wenbo Ding | 날짜: 2026-04-27 | URL: https://arxiv.org/abs/2604.24681 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1: Overview of the HA-2.2M curation pipeline. Large-scale unlabeled human demonstration

본 논문은 대규모 인간 시연 영상으로부터 로봇 조작을 위한 인간-의도 사전을 학습하는 MoT-HRA 프레임워크를 제안한다. 220만 에피소드의 HA-2.2M 데이터셋을 구성하고, 3D 궤적 예측, MANO 스타일 손 모션 모델링, 로봇 행동 변환의 3단계 계층적 구조로 인간 시연의 재사용 가능한 부분을 보존하면서 로봇 특화 제어를 학습한다.

Motivation

Achievement

Figure 2

Figure 2: Overview of MoT-HRA. Given an image, a language instruction, and chunk-sized query

HA-2.2M 데이터셋: 220만 에피소드의 대규모 이질 인간 시연 데이터셋으로 손 중심 필터링, 공간 재구성, 시간 분할, 언어 정렬을 적용. MoT-HRA 프레임워크: 계층적 vision-language-action 모델로 인간 의도 사전을 로봇 제어에 전이. 실험 검증: 손 모션 생성, SimplerEnv 시뮬레이션, 실제 로봇 조작 과제에서 MoT-HRA가 모션 타당성, spatial grounding, 분포 변화 하 제어 견고성을 향상.

How

Figure 2

Figure 2: Overview of MoT-HRA. Given an image, a language instruction, and chunk-sized query

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 본 논문은 대규모 인간 시연으로부터 로봇 조작을 학습하는 실질적 도전에 대해 잘 정의된 계층적 접근을 제시한다. 220만 에피소드 HA-2.2M 데이터셋과 MoT-HRA의 knowledge insulation 설계는 인간 행동의 재사용 가능한 구조를 보존하면서 로봇 특화 제어를 학습하는 점에서 기여도가 있다. 다만 데이터셋 필터링 정확성, 실제 로봇 평가의 포괄성, 계산 효율성 분석이 강화될 필요가 있다.

같이 보면 좋은 논문

기반 연구MANO 스타일 손 모션 모델링의 방법론적 기반을 제공하는 연구이다.
후속 연구대규모 손-물체 상호작용 데이터를 로봇 조작 학습에 활용하는 기반 연구를 제공한다.
다른 접근언어 기반 로봇 조작 및 장면 상호작용을 위한 다른 접촉 계획 방법을 제안한다.
다른 접근3317도 egocentric 비디오에서의 손 또는 물체 추적 및 재구성을 다루며 1758과 유사한 문제 영역을 공유한다.
다른 접근인간 의도 및 행동을 로봇 조작에 전이하는 유사한 연구 방향을 공유한다.
다른 접근대규모 인간 조작 데이터를 로봇 학습에 활용하는 유사한 접근법을 다른 방식으로 구현한다.
다른 접근인간 시연 영상으로부터 로봇 정책을 학습하는 동일한 문제를 다루는 대안적 접근법이다.
후속 연구대규모 인간 비디오 데이터를 로봇 조작 학습에 활용하는 기반 방법론을 제공한다.
다른 접근대규모 인간 시연 데이터로부터 로봇 조작을 위한 표현을 학습하는 유사한 접근법을 취한다.
다른 접근3D 궤적 예측과 계층적 구조를 활용한 로봇 조작 학습의 대안적 방법론을 제시한다.
다른 접근손 동작 모델링 및 로봇 조작 학습을 위한 인간 시연 활용이라는 공통 주제를 다룬다.
다른 접근대규모 인간 시연으로부터 로봇 행동을 학습하는 유사한 문제 설정을 가진다.
다른 접근인간형 로봇 제어를 위한 비디오 기반 모션 이해의 다른 방법론을 제안한다.
다른 접근대규모 데이터셋을 활용한 로봇 조작 정책 학습이라는 동일한 목표를 다른 방법으로 접근한다.
다른 접근양손 조작 데이터 수집 및 학습이라는 유사한 문제를 다른 방식으로 해결한다.
다른 접근대규모 인간 데이터를 활용한 범용 로봇 dexterous 조작 학습이라는 공통 목표를 다른 방법론으로 접근한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드