Being-0: A Humanoid Robotic Agent with Vision-Language Models and Modular Skills

저자: Haoqi Yuan, Yu Bai, Yuhui Fu, Bohan Zhou, Yicheng Feng, Xinrun Xu, Yi Zhan, Börje F. Karlsson, Zongqing Lu | 날짜: 2025-03-16 | URL: https://arxiv.org/abs/2503.12533 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1. Overview of the Being-0 framework. The humanoid agent framework, Being-0, comprises three key components: (1)

Being-0는 Foundation Model, VLM 기반 Connector, 모듈식 스킬 라이브러리를 계층적으로 통합하여 인간형 로봇이 복잡한 장기 과제를 수행할 수 있도록 하는 프레임워크이다. Connector 모듈이 언어 기반 계획을 실행 가능한 스킬 명령으로 변환하고 보행과 조작을 동적으로 조율한다.

Motivation

Achievement

How

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: Being-0는 인간형 로봇을 위한 실용적이고 효율적인 hierarchical agent 프레임워크로, Connector 모듈을 통한 창의적인 중간층 설계와 실제 하드웨어 구현으로 embodied AI 분야에 의미 있는 기여를 한다. 높은 완수율과 4.2배 효율성 향상은 제안 방식의 효과를 입증하지만, FM의 클라우드 의존성과 실내 중심 평가는 실용성 확대를 위한 개선 과제이다.

같이 보면 좋은 논문

다른 접근1813도 물리 기반 캐릭터 또는 로봇의 동작 제어 및 계획을 다루며 1973의 box rearrangement 시스템과 유사한 문제 영역을 공유한다.
다른 접근VLM과 스킬 라이브러리를 결합한 로봇 에이전트의 대안적 구현 방법이다.
다른 접근VLM을 활용한 로봇의 장기 과제 수행을 위한 계층적 계획의 대안적 접근법이다.
다른 접근Foundation Model 기반 인간형 로봇의 복잡한 작업 수행을 위한 유사 프레임워크이다.
다른 접근VLA 모델의 실시간 모니터링 및 오류 복구를 다루는 유사한 접근법이다.
다른 접근계층적 로봇 제어 프레임워크에서 언어 모델과 실행 정책을 통합하는 유사 접근법이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드