Masquerade: Learning from In-the-wild Human Videos using Data-Editing

저자: Marion Lepert, Jiaying Fang, Jeannette Bohg | 날짜: 2025-08-13 | URL: https://arxiv.org/abs/2508.09976 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 1

Fig. 1: Overview of Masquerade. Left: Large-scale in-the-wild egocentric human videos are edited to obtain “robotized”

Masquerade는 in-the-wild 인간 영상을 데이터 편집을 통해 로봇화된 시연으로 변환하고, 이를 통해 사전학습된 visual encoder로 로봇 조작 정책을 학습하는 방법을 제안한다. 675K 프레임의 편집된 인간 영상으로 사전학습 후 50개의 로봇 시연으로 fine-tuning하여 기존 방법 대비 5-6배 향상된 성능을 달성한다.

Motivation

Achievement

Figure 4

Fig. 4: Average success rate (%) on three bimanual

How

Figure 2

Fig. 2: Overview of Masquerade. (1) In-the-wild egocentric human videos are converted into “robotized” clips by extracti

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: Masquerade는 visual embodiment gap을 명시적으로 해결하면서 대규모 in-the-wild 인간 영상을 로봇 학습에 활용하는 창의적이고 실용적인 방법론을 제시한다. 적절한 평가와 ablation으로 핵심 설계 선택의 효과를 입증했으며, 로봇 데이터 부족 문제를 완화하는 데 의미 있는 기여를 한다.

같이 보면 좋은 논문

다른 접근2093도 손-물체 상호작용 또는 손 동작 재구성을 다루며, 1758의 egocentric 비디오 기반 재구성과 유사한 문제를 다른 방식으로 해결한다.
다른 접근인간 시연 데이터를 로봇 학습에 활용하는 유사한 방법론을 제시한다.
다른 접근인간 시연을 통해 로봇 조작 기술을 학습하는 유사한 프레임워크를 제시한다.
다른 접근인간 비디오 데이터를 활용한 로봇 정책 학습의 대안적 접근법이다.
다른 접근egocentric 시점에서의 로봇 조작 데이터 수집 및 정책 학습을 다루는 관련 연구이다.
다른 접근인간 상호작용 비디오를 활용한 로봇 조작 학습의 유사한 접근 방식이다.
다른 접근인간 비디오로부터 로봇 제어 정책을 학습하는 유사한 접근법을 제시한다.
다른 접근비디오 데이터를 활용한 물리 기반 캐릭터 제어 정책 학습에서 유사한 문제를 다룬다.
다른 접근인간 동작 데이터를 로봇 조작 학습에 적용하는 관련 연구이다.
다른 접근인간 비디오를 활용한 로봇 조작 정책 학습의 유사한 접근 방식을 제시한다.
다른 접근Masquerade는 데이터 기반 인간 비디오 모방을 위한 데이터 셀렉션 알고리즘을 제안하여, survey에서 논의한 다양한 학습 방법의 효율성과 적용성에 실제적 대안을 제시합니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드