ZeroMimic: Distilling Robotic Manipulation Skills from Web Videos
저자: Junyao Shi, Zhuolun Zhao, Tianyou Wang, Ian Pedroza, Amy Luo, Jie Wang, Jason Ma, Dinesh Jayaraman | 날짜: 2025-03-31 | URL: https://arxiv.org/abs/2503.23877📄 PDF
⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: CC BY
Essence
Fig. 1: ZeroMimic distills robotic manipulation skills from egocentric web videos for zero-shot deployment across divers
ZeroMimic은 EpicKitchens 데이터셋의 일반 인간 비디오로부터 로봇 조작 스킬을 직접 추출하여, 로봇별 데모나 탐색 없이 즉시 배포 가능한 이미지 목표 조건부 스킬 정책을 생성하는 첫 번째 시스템이다.
Motivation
Known: 최근 로봇 조작 학습은 imitation learning에 크게 의존하고 있으며, 인간 비디오 데이터셋은 조작 스킬에 대한 풍부한 정보를 담고 있다. 또한 VLM, affordance 학습, 3D 비전 기술 등의 발전이 있었다.
Gap: 기존 접근법들은 로봇별 데모 데이터의 의존성이 높거나, 인간 비디오로부터 직접 정책을 생성할 때 낮은 성능을 보인다. H2R을 제외한 선행 연구들은 로봇 데이터 없이 in-the-wild 비디오로부터 실용적 성능의 정책을 생성하지 못했다.
Why: 로봇과 시나리오 특화 데모 수집은 확장성이 떨어지므로, 웹상의 다양한 인간 비디오로부터 스킬을 습득할 수 있다면 일반 목적 로봇 개발의 병목을 해소할 수 있다.
Approach: ZeroMimic은 grasping phase(VRB를 통한 affordance 예측 + AnyGrasp를 통한 grasp 선택)와 post-grasp phase(HaMeR로 추출한 인간 손목 궤적을 3D 좌표계에 grounding하고 6D 궤적 정책 학습)로 구성된 두 단계 시스템을 제안한다.
총평: ZeroMimic은 in-the-wild 인간 비디오로부터 로봇 조작 스킬을 직접 추출하는 실질적이고 확장 가능한 접근법을 제시하며, 71%대의 현실적 성공률로 실용성을 입증한다. 로봇 학습의 데이터 병목을 해소하는 중요한 진전이지만, 평가 범위 확대와 실패 분석 강화가 향후 과제이다.