WholeBodyVLA: Towards Unified Latent VLA for Whole-Body Loco-Manipulation Control

저자: Haoran Jiang, Jin Chen, Qingwen Bu, Li Chen, Modi Shi, Yanjie Zhang, Delong Li, Chuanzhe Suo, Chuang Wang, Zhihui Peng, Hongyang Li | 날짜: 2025-12-11 | URL: https://arxiv.org/abs/2512.11047 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1: Introducing WholeBodyVLA, a humanoid system that operates on Agibot X2 robot and

WholeBodyVLA는 Vision-Language-Action 프레임워크로 humanoid 로봇의 대규모 공간에서 end-to-end 전신 조작-이동(loco-manipulation) 제어를 가능하게 한다. Unified latent learning으로 저비용 영상에서 학습하고 LMO RL policy로 정확한 이동 실행을 보장한다.

Motivation

Achievement

Figure 1

Figure 1: Introducing WholeBodyVLA, a humanoid system that operates on Agibot X2 robot and

How

Figure 2

Figure 2: Pipeline of WholeBodyVLA. LAM is pretrained on manipulation and manipulation-

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: WholeBodyVLA는 humanoid loco-manipulation의 오랜 과제를 action-free 영상 학습과 맞춤형 RL policy로 창의적으로 해결한 강력한 기여이다. 실제 로봇에서의 입증과 21.3% 성능 향상이 실질적 가치를 증명하나, 단일 플랫폼 검증과 이산 명령 제약은 향후 개선 대상이다.

같이 보면 좋은 논문

기반 연구Expressive Whole-Body Control for Humanoid Robots는 Whole-Body Locomotion의 표현적 제어 기초를 제공합니다.
기반 연구OmniH2O는 인간-휴머노이드간 whole-body 조작 시뮬레이션과 영상 데이터를 WholeBodyVLA의 대규모 전신 제어 학습의 기초로 삼을 수 있다.
기반 연구ZeroMimic 논문은 웹 비디오 기반 로봇 스킬 추출을 다루며, WholeBodyVLA의 대규모 저비용 비디오 학습 전략의 근간이 되는 데이터 소싱 및 활용 방식에 참고할 만하다.
다른 접근WholeBodyVLA는 여러 로봇에서 whole-body 제어를 위한 통합 VLA 표현 모델을 제안하여, Gemini Robotics 1.5의 다양한 플랫폼 대응과 유사 주제를 다룹니다.
다른 접근Motus는 로코-매니퓰레이션을 위한 unified latent action world model을 제안하여, WholeBodyVLA와 비교되는 대안적 잠재공간 제어 접근법을 보여준다.
후속 연구WHALE은 world model 학습과 행동 조건화로 대규모 embodied 환경의 일반화 문제를 다루고, WholeBodyVLA의 확장적 배경이 됩니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드