Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos

저자: Hao Luo, Yicheng Feng, Wanpeng Zhang, Sipeng Zheng, Ye Wang, Haoqi Yuan, Jiazheng Liu, Chaoyi Xu, Qin Jin, Zongqing Lu | 날짜: 2025-07-21 | URL: https://arxiv.org/abs/2507.15597 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1: Being-H0 acquires dexterous manipulation skills by learning from large-scale human videos in the

Being-H0는 대규모 인간 비디오로부터 학습한 민첩한 Vision-Language-Action 모델로, physical instruction tuning 패러다임을 통해 인간의 손 동작을 명시적으로 모델링하여 로봇 조작 작업으로 전이한다.

Motivation

Achievement

Figure 2

Figure 2: Overview of Being-H0. The text tokenizer and visual encoder are shared by both pretraining

How

Figure 3

Figure 3: Physical Instruction Tuning. Our training paradigm bridges human video datasets and robotic

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: Being-H0는 대규모 인간 비디오로부터 민첩한 로봇 조작을 학습하는 새로운 패러다임을 제시하며, physical instruction tuning과 part-level motion tokenization을 통해 기존 VLA의 데이터 부족 문제를 혁신적으로 해결한다. 명시적 동작 모델링 접근법과 UniHand 데이터셋은 로봇 공학 분야에 중요한 기여를 제공한다.

같이 보면 좋은 논문

기반 연구EgoMimic의 egocentric 비디오 스케일링 기법이 Being-H0의 대규모 인간 비디오 활용 방법론의 기반을 제공한다.
기반 연구vision-language-action을 audio modality로 확장한 multimodal 접근이다
기반 연구대규모 인간 비디오 데이터를 로봇 조작 학습에 활용하는 기반 방법론을 제공한다.
다른 접근인간 시연 영상으로부터 로봇 정책을 학습하는 동일한 문제를 다루는 대안적 접근법이다.
다른 접근자연어 명령으로부터 로봇의 물리적 상호작용을 생성하는 다른 데이터 기반 방법이다.
다른 접근일상 작업 수행을 위한 로봇 시뮬레이션 프레임워크 구축의 다른 방법론을 제시한다.
다른 접근인간 비디오로부터 로봇 조작 정책을 학습하는 다른 VLA 접근법을 제시한다.
후속 연구Vision-Language-Action 모델 학습을 위한 방법론적 기반을 제공한다.
다른 접근인간 시연 데이터를 활용한 로봇 조작 정책 학습의 다른 방법을 제시한다.
다른 접근로봇 조작을 위한 멀티모달 정책 학습의 대안적 접근법을 제시한다.
다른 접근대규모 인간 데이터를 활용한 로봇 학습을 위한 다른 프레임워크를 제시한다.
다른 접근로봇 조작을 위한 학습 기반 접근법이라는 공통 주제를 공유하는 연구다.
다른 접근둘 다 대규모 인간 비디오에서 humanoid 기초 모델을 학습하지만 Being-H0는 손 동작 명시적 모델링을, Ψ0는 flow-based expert를 강조한다.
다른 접근양손 로봇 조작을 위한 데이터 기반 학습 접근법으로 유사한 문제를 다룬다.
다른 접근인간-물체 상호작용 데이터를 활용한 로봇 파지 학습이라는 공통 주제를 다룬다.
후속 연구Vision-Language-Action 사전훈련이 텍스트 조건부 모션 생성의 이론적 기반을 제공함
후속 연구vision-language-action 사전훈련의 기본 방법론을 human motion에 적용한다
후속 연구대규모 vision-language-action 데이터를 활용한 사전훈련의 기반이 되는 연구다
후속 연구대규모 조작 데이터 학습의 기반 방법론을 제공한다.
후속 연구EgoScale의 다양한 egocentric 조작 데이터가 Being-H0의 손 동작 모델링을 더 정교하게 발전시킬 수 있다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드