Being-H0.5: Scaling Human-Centric Robot Learning for Cross-Embodiment Generalization

저자: Hao Luo, Ye Wang, Wanpeng Zhang, Sipeng Zheng, Ziheng Xi, Chaoyi Xu, Haiweng Xu, Haoqi Yuan, Chi Zhang, Yiqing Wang, Yicheng Feng, Zongqing Lu | 날짜: 2026-01-19 | URL: https://arxiv.org/abs/2601.12993 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1: Being-H0.5 at a Glance. We scale human-centric robot learning with Being-H0.5 toward

Being-H0.5는 인간 중심 학습 패러다임과 통합 액션 공간을 활용하여 다양한 로봇 플랫폼 간 일반화를 가능하게 하는 기초 Vision-Language-Action 모델이다. 35,000시간 이상의 멀티모달 데이터로 구성된 UniHand-2.0을 통해 30개의 로봇 플랫폼에서 강력한 cross-embodiment 성능을 달성한다.

Motivation

Achievement

Figure 1

Figure 1: Being-H0.5 at a Glance. We scale human-centric robot learning with Being-H0.5 toward

How

Figure 2

Figure 2: Overview of UniHand 2.0. UniHand 2.0 is our large-scale pre-training recipe for human-centric

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: Being-H0.5는 인간 중심 학습 패러다임과 대규모 통합 데이터셋을 활용하여 cross-embodiment 로봇 일반화의 중요한 진전을 이룬 의미 있는 연구이며, Mixture-of-Flow, Manifold-Preserving Gating 등의 기술 혁신과 실세계 배포 성공이 로봇공학의 확장성 문제를 해결하는 데 기여한다.

같이 보면 좋은 논문

기반 연구CALVIN은 장기적 언어 조건부 조작작업 벤치마크로 cross-embodiment 평가와 표준화 데이터셋 구조에 기반을 제공한다.
기반 연구1306의 대규모 로봇 표준 및 데이터셋은 1318의 UniHand-2.0 기반 데이터 구축과 cross-embodiment 일반화의 근거가 된다.
기반 연구Being-H0.5(1318)는 다양한 cross-embodiment, cross-scene 로봇 작업에 세련된 동형 네트워크를 적용하여 튜토리얼 개념의 실제 활용을 보여준다.
기반 연구Being-H0.5는 cross-embodiment를 강조하며, 다중 로봇 플랫폼에서의 일반화 성능을 강조한다는 점에서 다양한 현장 적용을 비교할 수 있다.
기반 연구NORA-1.5는 world models 활용과 cross-embodiment VLA 학습에 대한 이론적 토대를 제공하여 Being-H0.5의 연구 배경을 보완합니다.
다른 접근Being-H0.5는 사람이 중심이 되는 다양한 로봇 형태에 대한 범용 학습 전략을 제시하여, MetaMorph의 Transformer 기반 approach와 대조됩니다.
다른 접근Being-H0.5 논문도 다양한 embodied 환경에서 인간 중심의 범용 에이전트 학습을 추구해, 접근 방식의 차이와 한계를 분석할 수 있다.
다른 접근1318은 cross-embodiment(이질적인 로봇간) 학습 문제를 scaling human-centric 로봇러닝으로 해결하여, 1450의 저비용 텔레오퍼레이션 기반 bimanual manipulation와 다른 스케일 접근법을 보여준다.
다른 접근LOTUS는 다양한 데이터와 변화하는 태스크에 대한 일반화 능력을 탐구하며 cross-embodiment learning에 대해 Being-H0.5와 유사하면서도 다른 접근을 제시합니다.
다른 접근1546은 다양한 플랫폼에서 zero-shot 정책 적용을 연구하여, 1318의 cross-embodiment 학습을 실제배포 관점에서 보완한다.
다른 접근ManipBench는 다양한 낮은 수준 제어 작업에 VLM들을 벤치마킹하여 multi-platform 및 cross-embodiment 성능을 비교할 수 있다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드