Human2Robot: Learning Robot Actions from Paired Human-Robot Videos

저자: Sicheng Xie, Haidong Cao, Zejia Weng, Zhen Xing, Haoran Chen, Shiwei Shen, Jiaqi Leng, Zuxuan Wu, Yu-Gang Jiang | 날짜: 2025-02-23 | URL: https://arxiv.org/abs/2502.16587 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1: HUMAN2ROBOT: An human-video-conditioned

VR 원격조종으로 수집한 정밀하게 정렬된 인간-로봇 비디오 쌍 데이터셋 H&R과 이를 활용한 Human2Robot 프레임워크를 제시하여, Video Prediction Model을 통해 인간 동작으로부터 로봇 동작을 프레임 수준에서 학습하고 미학습 태스크에 일반화한다.

Motivation

Achievement

Figure 2

Figure 2: Dataset Overview. (L) The ratio of four basic task

How

Figure 3

Figure 3: Architecture overview of HUMAN2ROBOT. Our approach consists of two training stages. In the first stage, we tra

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: VR 원격조종을 통한 정밀한 데이터 수집과 conditional video generation 패러다임의 결합으로 인간-로봇 학습의 근본적 한계를 해결한 영향력 있는 연구이다. 다만 embodiment gap 문제의 미해결과 평가 범위의 제한이 실제 적용성을 다소 제약한다.

같이 보면 좋은 논문

기반 연구LM-Nav(1461)은 인간 및 로봇 비디오의 정렬/매핑 방식에서 Human2Robot(1425)가 참조한 대표적인 navigation 중심 프레임워크이다.
기반 연구Human2Robot은 사람-로봇간 paired demonstration을 통해 perception-action gap을 다루는 실제 응용을 제시하여, Embodied-R1와 직접적인 현장 적용 사례로 연결됩니다.
다른 접근UniSkill은 인간 동작 비디오에서 다양한 로봇 몸체로의 스킬 이식 기술을 다루므로, Human2Robot 프레임워크와 인간-로봇 generalization 주제에서 대조적 접근법입니다.
후속 연구Human2Robot: Learning Robot Actions from Paired Human–Robot Data 논문은 인간 행동의 로봇 정책 전이 연구에 이론적 기반을 제공해, UniSkill의 인간-로봇 cross-embodiment 스킬 학습에 토대를 마련한다.
다른 접근Human2Robot은 사람의 행동 궤적 기반 imitation learning을 활용한 정책 학습으로, 역방향 자동회귀인 Chain-of-Action과 상반되는 시퀀스 생성 패러다임을 보여줍니다.
다른 접근EgoScale은 대규모 인간 이고센트릭 비디오 데이터 프리트레이닝을 통해 소량의 정렬 데이터로 고성능 정책을 만드므로 Human2Robot의 직접 정렬 학습법과 대조적입니다.
후속 연구Plan-Seq-Learn은 인간-로봇 시퀀스 데이터에서 LLM 가이드 강화학습으로 unseen task 적응을 높이는 방안을 제시하여 Human2Robot의 데이터 학습/전이 과정을 확장합니다.
후속 연구Phantom은 인간 비디오만으로 로봇 정책을 학습하는 최신 방식으로, 정렬된 인간-로봇 비디오 쌍 데이터셋 활용을 한 단계 진화시킨 사례를 보여줍니다.
후속 연구Human2Robot(1425)는 인간-로봇 페어 영상 기반 정책 학습을 다루며, 1634가 웹 비디오에서 직접 로봇 조작 정책을 추출하는 동기와 토대가 된다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드