EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data

저자: Ruijie Zheng, Dantong Niu, Yuqi Xie, Jing Wang, Mengda Xu, Yunfan Jiang, Fernando Castañeda, Fengyuan Hu, You Liang Tan, Letian Fu, Trevor Darrell, Furong Huang, Yuke Zhu, Danfei Xu, Linxi Fan | 날짜: 2026-02-18 | URL: https://arxiv.org/abs/2602.16710 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 1

Figure 1: EgoScale: Two-stage human-to-robot learning framework. A flow-based Vision-Language-Action

20,854시간의 대규모 이고센트릭 인간 비디오 데이터로 VLA 모델을 사전학습한 후 소량의 정렬된 인간-로봇 중간학습 데이터로 미세조정하여 22-DoF 손가락 조작 로봇에서 54% 성공률 향상을 달성했다.

Motivation

Achievement

Figure 4

Figure 4: Main Experimental Results. Comparison of Human Pre-train + Mid-Training, Human Pretraining,

How

Figure 2

Figure 2: Human Data Collection and Model Architecture. (Left) Aligned human-robot mid-training data

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 본 논문은 대규모 이고센트릭 인간 데이터의 스케일링 법칙을 최초로 입증하고 이를 고자유도 손가락 조작에 효과적으로 적용한 중요한 기여를 한다. 명확한 실험 설계와 강력한 실증 결과(54% 성공률 향상, 일회성 전이)는 인간 데이터 기반 로봇 학습의 실행 가능성을 확실히 보여주지만, 포즈 추정 노이즈, 중간학습 데이터 수집 비용, 태스크/플랫폼 다양성 제한이 실제 배포 확대를 위해 해결해야 할 과제로 남아있다.

같이 보면 좋은 논문

기반 연구1510의 OpenVLA는 오픈소스 VLA 모델로, EgoScale에서 대규모 인간 비디오 토대로 사전학습한 VLA와의 벤치마킹 및 검증이 가능하다.
기반 연구EgoScale은 DexGarmentLab의 양손 조작 개념을 다양한 작업으로 확장하여 더 포괄적인 조작 학습 환경을 제공합니다.
다른 접근1450의 Learning Fine-Grained Bimanual Manipulation은 저비용 하드웨어를 활용한 섬세한 양손 조작 학습을 다루며, EgoScale의 대규모 데이터 접근법과 상보적으로 비교 가능하다.
다른 접근Human2Robot은 정렬된 인간-로봇 비디오 쌍에서 직접 로봇 액션을 추론하여 EgoScale과는 다른 인간-비디오 기반 정책 학습 파이프라인을 제시합니다.
다른 접근대규모 인간 비디오에서 로봇 학습을 위해 world model과 egocentric video라는 서로 다른 접근법을 사용
후속 연구MimicPlay는 인간 영상을 통한 장기 imitation learning을 다루며, EgoScale의 대규모 인간 모습 활용 관점에서 연구 방향을 확장합니다.
후속 연구EgoScale에서 제시하는 다양하고 이질적인 행동 데이터 및 벤치마크는 D3IL의 인간 유사 행동 다양성 메트릭 및 평가 환경 설계에 배경이 된다.
후속 연구EgoScale은 다양한 인간 시연 데이터로 로봇 조작 학습을 확대한 대형 데이터셋을 제공하며 1467의 자동 데이터 생성 방법의 기반이 된다.
후속 연구UniSkill은 다양한 인간 비디오 모방을 통한 cross-embodiment skill imitation을 제안해 EgoScale의 이고센트릭 데이터 기반 프리트레이닝을 구체적 로봇 스킬에 확장 적용합니다.
후속 연구EgoScale 논문은 다양한 egocentric 데이터셋을 활용해 Dex1B와 같은 대규모 손재주 시연 생성/학습 맥락의 기반을 제공한다.
응용 사례Robotic Skill Acquisition via Instruction Augmentation는 다양한 인간 영상을 활용한 로봇 스킬 학습과 연결되어, EgoScale의 egocentric human 영상 활용과 시너지가 있습니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드