ZeroMimic: Distilling Robotic Manipulation Skills from Web Videos

저자: Junyao Shi, Zhuolun Zhao, Tianyou Wang, Ian Pedroza, Amy Luo, Jie Wang, Jason Ma, Dinesh Jayaraman | 날짜: 2025-03-31 | URL: https://arxiv.org/abs/2503.23877 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 1

Fig. 1: ZeroMimic distills robotic manipulation skills from egocentric web videos for zero-shot deployment across divers

ZeroMimic은 EpicKitchens 데이터셋의 일반 인간 비디오로부터 로봇 조작 스킬을 직접 추출하여, 로봇별 데모나 탐색 없이 즉시 배포 가능한 이미지 목표 조건부 스킬 정책을 생성하는 첫 번째 시스템이다.

Motivation

Achievement

Figure 5

Fig. 5: ZeroMimic Zero-Shot Performance Overview. ZeroMimic demonstrates strong generalization capabilities, achieving

How

Figure 3

Fig. 3: ZeroMimic is composed of the grasping phase and the post-grasp phase. The grasping phase (top) leverages

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: ZeroMimic은 in-the-wild 인간 비디오로부터 로봇 조작 스킬을 직접 추출하는 실질적이고 확장 가능한 접근법을 제시하며, 71%대의 현실적 성공률로 실용성을 입증한다. 로봇 학습의 데이터 병목을 해소하는 중요한 진전이지만, 평가 범위 확대와 실패 분석 강화가 향후 과제이다.

같이 보면 좋은 논문

기반 연구MimicPlay는 인간 영상 모방 기반 조작정책 학습의 초석적 연구로, ZeroMimic의 인간 영상 기반 스킬 추출에 논리적 배경을 제공합니다.
기반 연구LERF 논문은 언어 임베딩과 방사장(radiance field)을 결합한 표현 학습을 다루며, ZeroMimic의 이미지-조건 스킬 정책 생성에 필요한 표현 학습 기초를 제공한다.
기반 연구Human2Robot(1425)는 인간-로봇 페어 영상 기반 정책 학습을 다루며, 1634가 웹 비디오에서 직접 로봇 조작 정책을 추출하는 동기와 토대가 된다.
다른 접근$_0$: A Vision-Language-Action Flow Model은 다양한 태스크에 대한 범용 정책 학습의 또다른 접근법으로 ZeroMimic과 대조적입니다.
다른 접근Phantom(1515)는 인간 비디오만으로 로봇 스킬을 학습하는 방법론으로, 1634의 로봇별 데모 없이 배포 가능한 정책 생성과 근본적 목표가 같다.
후속 연구ZeroMimic 논문은 웹 비디오 기반 로봇 스킬 추출을 다루며, WholeBodyVLA의 대규모 저비용 비디오 학습 전략의 근간이 되는 데이터 소싱 및 활용 방식에 참고할 만하다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드