BFM-Zero: A Promptable Behavioral Foundation Model for Humanoid Control Using Unsupervised Reinforcement Learning

저자: Yitang Li, Zhengyi Luo, Tonghe Zhang, Cunxi Dai, Anssi Kanervisto, Andrea Tirinzoni, Haoyang Weng, Kris Kitani, Mateusz Guzek, Ahmed Touati, Alessandro Lazaric, Matteo Pirotta, Guanya Shi | 날짜: 2025-11-06 | DOI: 10.48550/arXiv.2511.04131 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 2

Figure 2: An overview of the BFM-Zero framework. After the pre-training stage, BFM-Zero forms a latent

BFM-Zero는 unsupervised RL과 Forward-Backward 모델을 활용하여 휴머노이드 로봇의 다양한 제어 작업을 단일 정책으로 수행할 수 있는 promptable behavioral foundation model을 제시한다. 공유 잠재 공간에 모션, 목표, 보상을 임베딩하여 zero-shot 추론과 few-shot 적응을 가능하게 한다.

Motivation

Achievement

Figure 1

Figure 1: BFM-Zero enables versatile and robust whole-body skills. (A-C) Diverse zero-shot inference

How

Figure 2

Figure 2: An overview of the BFM-Zero framework. After the pre-training stage, BFM-Zero forms a latent

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: BFM-Zero는 unsupervised RL을 통해 휴머노이드 로봇의 실제 배포에서 처음으로 promptable foundation model을 성공적으로 구현하였으며, zero-shot 다중 작업 수행과 few-shot 적응의 균형을 이루는 실용적 솔루션을 제시한다. 이는 로봇 제어의 패러다임 전환을 제시하는 중요한 기여이다.

같이 보면 좋은 논문

다른 접근휴머노이드 로봇의 다양한 행동을 단일 모델로 학습하는 다른 foundation model 접근법이다.
다른 접근물리 기반 전신 모션 모방 학습의 대안적 접근법을 제시한다.
다른 접근unsupervised 방식으로 휴머노이드 로봇의 다양한 동작을 학습하는 관련 연구이다.
다른 접근1821도 휴머노이드 전신 제어를 다루며, 2039의 언어 지시 기반 접근법과 유사한 다목적 제어 목표를 공유한다.
다른 접근휴머노이드 로봇의 다목적 제어를 위한 단일 정책 학습의 다른 접근법을 제시한다.
다른 접근쿵푸·댄싱 등 고동적 동작 모방을 위한 대안적 물리 기반 제어 방법론을 제시한다.
다른 접근1821은 humanoid 로봇 제어를 위한 다른 RL 접근법을 제시하여 본 논문과 유사한 고자유도 로봇 제어 문제를 다룬다.
다른 접근휴머노이드 로봇 제어를 위한 잠재 공간 표현 학습을 활용하는 관련 연구이다.
다른 접근다양한 동적 동작의 물리적 충실도를 보존하는 대안적 전신 제어 방법론이다.
다른 접근복잡한 장기 과제 수행을 위한 정책 합성 방법론으로 유사한 접근법을 취한다.
다른 접근휴머노이드 로봇의 behavioral foundation model 구축을 위한 관련 연구이다.
다른 접근대규모 사전학습과 실제 환경 적응을 결합한 유사한 목표를 가진 관련 연구이다.
다른 접근도메인 시프트에 강건한 휴머노이드 로봇 제어를 위한 history-conditioned 강화학습 프레임워크를 제안한다.
다른 접근휴머노이드 로봇의 전신 제어를 위한 behavioral foundation model을 제시하는 관련 연구이다.
다른 접근diffusion model을 활용한 휴머노이드 동작 제어를 위한 유사한 접근법을 제안한다.
다른 접근휴머노이드 로봇의 자연스러운 동작 제어를 위한 다른 기반 모델 접근법이다.
다른 접근두 논문 모두 휴머노이드 전신 제어를 다루지만, 1905는 캡처 포인트 등 고전적 균형 원리를 RL에 통합하는 방식으로 낙상 회복에 특화되어 있다.
다른 접근휴머노이드 로봇의 다중 기술 전환 및 계층적 제어를 다루는 유사 연구이다.
다른 접근다양한 기술 간 매끄러운 전환을 위한 하이브리드 정책 프레임워크로, RPG와 유사한 방법론적 접근을 취한다.
다른 접근휴머노이드 로봇의 다양한 제어 작업을 단일 정책으로 수행하는 foundation model 접근법이다.
다른 접근1821은 humanoid 제어를 위한 다른 접근법을 제시하며 BFMTrack과 같은 문제를 다른 방식으로 해결한다.
후속 연구HOI 모방 학습의 이론적/방법론적 기반을 제공한다.
후속 연구접촉이 풍부한 전신 조작 학습의 방법론적 기반을 제공한다.
후속 연구휴머노이드 로봇 locomotion을 위한 DRL 기반 제어의 이론적·방법론적 기반을 제공한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드