저자: Zhi Wang, Botao He, Kelin Yu, Seungjae Lee, Ruohan Gao, Furong Huang, Yiannis Aloimonos | 날짜: 2026 | DOI: 10.48550/ARXIV.2605.24934 📄 PDF
라이선스: arXiv 비독점 라이선스
HumanEgo는 인간의 자아중심 영상(egocentric video)으로부터 로봇 조작 정책을 학습하는 프레임워크로서, Interaction-Centric Tokens(ICT)를 통해 구체화 격차(embodiment gap)를 해결하고 flow matching 정책과 조밀한 보조 목표들을 결합하여 30분의 인간 영상만으로 92.5% 성공률을 달성한다.
Fig. 4: Overall Real-World Evaluation. Real-world success rate (%) for each method across
Fig. 2: System overview of HumanEgo. Arm inpainting and visual keypoints bridge the visual gap;
총평: HumanEgo는 인간 자아중심 영상으로부터 로봇 정책을 학습하는 문제에 명확한 해결책을 제시한다. Interaction-Centric Tokens를 통한 혁신적 표현과 조밀한 보조 감시의 조합은 기술적으로 타당하며, 30분 영상으로 92.5% 성공률과 zero-shot 전이 능력은 실용적 의의가 크다. 다만 Aria 센서 의존도와 제한된 작업 평가 범위가 일반화 가능성에 의문을 제기한다.