저자: Ruihan Yang, Qinxi Yu, Yecheng Wu, Rui Yan, Borui Li, An-Chieh Cheng, Xueyan Zou, Yunhao Fang, Xuxin Cheng, Ri-Zhao Qiu, Hongxu Yin, Sifei Liu, Song Han, Yao Lu, Xiaolong Wang | 날짜: 2025-07-16 | URL: https://arxiv.org/abs/2507.12440 📄 PDF
Essence
Figure 1: EgoVLA. Our vision-language-action model learns manipulation skills from egocentric human
egocentric human 비디오로부터 Vision-Language-Action (VLA) 모델을 학습하여 로봇 조작 정책을 획득하고, Inverse Kinematics과 retargeting을 통해 인간 행동을 로봇 행동으로 변환한다.
Evaluation
Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: 본 논문은 egocentric human 비디오를 활용한 VLA 학습이라는 혁신적 접근으로 로봇 데이터 수집의 확장성 문제를 효과적으로 해결하며, unified action space 설계와 종합적인 벤치마크 제안을 통해 높은 실용성과 학술적 기여를 제시한다.
같이 보면 좋은 논문
기반 연구DexCap으로 수집한 손동작 데이터를 EgoVLA의 Vision-Language-Action 모델에 통합하면 더욱 정교한 bimanual humanoid 조작이 가능해집니다.
기반 연구DexMimicGen으로 생성된 대규모 양손 조작 데이터는 EgoVLA의 Vision-Language-Action 모델 학습에 풍부한 훈련 소스를 제공합니다.
기반 연구Vision-Language-Action 모델 학습을 위한 방법론적 기반을 제공한다.
다른 접근인간 비디오로부터 로봇 조작 정책을 학습하는 다른 VLA 접근법을 제시한다.
다른 접근1904도 손-물체 상호작용의 동작 추정 또는 생성 모델을 다루며
1758의 joint generative motion prior 접근법과 유사한 방향성을 가진다.
다른 접근범용 로봇 학습을 위한 대규모 다양한 작업 데이터 생성의 유사한 접근법을 제안한다.
다른 접근계층적 행동 계획을 통한 휴머노이드 로봇의 복잡한 작업 수행이라는 유사한 문제를 다른 방식으로 해결한다.
다른 접근egocentric 인간 시연 데이터를 로봇 조작 학습에 활용하는 대안적 프레임워크이다.
다른 접근대규모 데이터를 활용한 로봇 조작 학습에서 다른 접근법을 취하는 대안적 연구이다.
다른 접근인간 동영상 데이터를 활용한 휴머노이드 로봇의 다양한 작업 수행 능력 학습을 다루는 관련 연구이다.
다른 접근egocentric 비디오로부터 로봇 조작 정책을 학습하는 대안적 접근법이다.
다른 접근egocentric 인간 비디오로부터 로봇 조작 정책을 학습하는 유사한 접근법을 다루는 연구이다.
후속 연구EgoDex의 대규모 egocentric 비디오와 3D hand pose 데이터는 EgoVLA의 Vision-Language-Action 모델 학습을 위한 핵심 데이터 소스입니다.
다른 접근egocentric 시점에서의 로봇 조작을 위한 시각적 학습이라는 유사한 문제를 다루는 연구이다.
다른 접근언어 및 비전 입력을 활용한 휴머노이드 로봇의 다양한 작업 수행을 위한 계층적 제어 프레임워크를 공유한다.
다른 접근시각 정보 기반 로봇 조작 기술 학습의 대안적 접근법이다.
다른 접근LLM 기반 태스크 계획과 로봇 조작을 결합한 프레임워크로 유사한 문제를 다룬다.
다른 접근인간 시연으로부터 로봇 조작 정책을 학습하는 대안적 방법론이다.
다른 접근egocentric 비디오로부터 로봇 조작 정책을 학습하는 유사한 접근법을 제안한다.
다른 접근인간 비디오 데이터를 활용한 로봇 정책 일반화의 대안적 접근법이다.
다른 접근대규모 데이터를 통한 로봇 조작 학습에서 다른 방법론을 사용하는 대안적 연구이다.
다른 접근egocentric 시각 정보를 활용한 로봇 조작 정책 학습의 대안적 접근법이다.
다른 접근인간 동작 데이터를 활용하여 로봇 전신 제어 정책을 학습하는 유사한 프레임워크이다.
다른 접근비디오 시연으로부터 로봇 파지 정책을 학습하는 유사한 접근법을 취한다.
다른 접근에고센트릭 비디오로부터 조작 가능한 행동 표현을 학습하는 관련 연구이다.
다른 접근egocentric 인간 비디오로부터 로봇 행동을 학습하는 대안적 VLA 접근법이다.
후속 연구EgoVLA의 Vision-Language-Action 모델과 retargeting 기술은 HEAD의 egocentric vision 기반 navigation과 reaching 능력을 언어 지시까지 확장할 수 있습니다.