Being-H0.7: A Latent World-Action Model from Egocentric Videos

저자: Hao Luo, Wanpeng Zhang, Yicheng Feng, Sipeng Zheng, Haiweng Xu, Chaoyi Xu, Ziheng Xi, Yuhui Fu, Zongqing Lu | 날짜: 2026-04-30 | URL: https://arxiv.org/abs/2605.00078 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 2

Figure 2: Latent reasoning and latent world-action model. Left: Learnable latent queries are inserted

이 논문은 egocentric video로부터 학습된 latent world-action model인 Being-H0.7을 제시한다. 행동 생성 사이에 학습 가능한 latent query를 추론 인터페이스로 도입하고, future-informed dual-branch 설계를 통해 미래 프레임 생성 없이 세계 모델의 예측 능력을 VLA의 효율성과 결합한다.

Motivation

Achievement

Figure 3

Figure 3: Being-H0.7 Architecture. We pack the prior and posterior branches into a single MoT sequence

시뮬레이션 성능: 6개 벤치마크(LIBERO, LIBERO Plus, RoboTwin 2.0, RoboCasa, CALVIN ABC, CALVIN ABCD)에서 최첨단 또는 동등한 성능 달성. 실제 로봇 작업: 3개 로봇 플랫폼에서 12개 도전적 작업(빠른 굴러오는 공 잡기, 움직이는 용기에 붓기, 옷 접기, 컨베이어에서 패키지 분류, 못 박기 등) 평가에서 5개 능력 지향 스위트 모두 최고 성능. 배포 효율성: 3-4 ms/step 체제에서 동작하며 test-time future generation 부담 없음.

How

Figure 3

Figure 3: Being-H0.7 Architecture. We pack the prior and posterior branches into a single MoT sequence

• Learnable latent query를 perception과 action 사이 명시적 추론 인터페이스로 도입

• Future-informed dual-branch 설계: prior branch는 현재 문맥에서 latent 상태 추론, posterior branch는 학습 중에만 사용되며 미래 관찰 임베딩으로 query 대체

• Dual-branch 정렬을 통해 prior query가 future-aware, action-useful 구조 학습

• Norm과 rank 제약을 통한 정칙화로 latent 상태 collapse 방지

• Mixture-of-Transformers 시퀀스로 dual-branch 구현하여 효율적 문맥 공유

• Latency-aware universal asynchronous chunking(UAC)으로 배포 최적화

Originality

• World-action modeling을 latent 공간으로 재정의하여 픽셀 공간 예측의 비효율성 해결 (기존은 WAM이 비디오 생성에 의존)

• Future-informed dual-branch 설계로 test-time에는 posterior branch 제거 가능 (training-only privileged supervision)

• Learnable latent query를 명시적 추론 인터페이스로 도입 (기존 VLA는 이러한 명시적 구조 없음)

• Hidden-state alignment과 가벼운 정칙화로 stable하고 scalable한 latent 학습 달성

Limitation & Further Study

• Posterior branch 설계의 정당성: 왜 posterior embedding이 정확히 행동에 유용한 정보를 포함하는지 명확한 이론적 설명 부족. 단순히 future observation의 임베딩이 미래 관련 정보를 담보하는지 불명확.

• Latent query의 수와 dimensionality 선택 기준 미명시: ablation study를 통해 이들 하이퍼파라미터가 성능과 배포 효율성에 미치는 영향을 더 상세히 분석 필요.

• Generalization 평가의 제한: 실제 로봇 작업이 12개로 제한적이며, 매우 다양한 domain shift나 zero-shot generalization 시나리오에서의 성능 부족.

• 계산 오버헤드 상세 분석 부족: prior와 posterior branch 동시 학습 시 메모리와 계산 비용 상세 분석 필요. 배포 효율성 주장이 주로 latency 기준.

• 후속 연구: 더 큰 모델 스케일에서의 성능, 더 다양한 로봇 embodiment, 극단적 미래 예측 거리에서의 안정성 개선 필요.

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: Being-H0.7은 world-action modeling을 latent 공간으로 재정의하여 미래 예측의 이득을 유지하면서도 픽셀 생성의 비효율성을 제거한 강력한 기여를 한다. Future-informed dual-branch 설계와 latent query 기반 인터페이스는 창의적이고 효과적이며, 광범위한 시뮬레이션 및 실제 로봇 평가에서 일관된 성능 향상을 입증한다. 다만 posterior branch의 정당성, latent 구조의 이론적 근거, 그리고 일부 하이퍼파라미터 선택의 명확화가 필요하다.

같이 보면 좋은 논문

다른 접근latent 표현을 활용한 로봇 행동 생성 모델을 제안하는 유사 연구이다.
다른 접근에고센트릭 비디오로부터 조작 가능한 행동 표현을 학습하는 관련 연구이다.
다른 접근비디오 기반 세계 모델과 행동 정책을 결합하는 유사한 접근법을 탐구한다.
다른 접근embodied AI에서 메타인지적 추론 및 동적 의사결정을 다루는 관련 연구이다.
다른 접근자아중심 비디오로부터 로봇 조작 정책을 학습하는 유사한 비전-액션 모델을 제안한다.
다른 접근VLA 모델의 행동 생성 효율성을 개선하기 위한 latent 기반 접근법을 제안하는 관련 연구이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드