HumanoidVLM: Vision-Language-Guided Impedance Control for Contact-Rich Humanoid Manipulation

저자: Yara Mahmoud, Yasheerah Yaqoot, Miguel Altamirano Cabrera, Dzmitry Tsetserukou | 날짜: 2026-01-21 | URL: https://arxiv.org/abs/2601.14874 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1: Overall architecture of the proposed HumanoidVLM framework.

HumanoidVLM은 vision-language model과 retrieval-augmented generation을 결합하여 휴머노이드 로봇이 egocentric 이미지로부터 task-specific impedance parameters와 gripper configuration을 자동으로 선택하는 적응형 조작 프레임워크이다.

Motivation

Achievement

Figure 3

Figure 3: Retrieval accuracy of the VLM–RAG system across

How

Figure 1

Figure 1: Overall architecture of the proposed HumanoidVLM framework.

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 본 논문은 VLM과 RAG를 humanoid manipulation에 효과적으로 적용하여 semantic perception과 compliant control을 처음 체계적으로 연결했으며, 높은 retrieval 정확도와 실제 로봇 실험을 통해 타당성을 입증했다. 다만 고정된 database 규모와 sensor 제약이 향후 확장성을 제한하는 점이 개선 대상이다.

같이 보면 좋은 논문

기반 연구VLM 기반 작업 인식이 계층적 다단계 조작의 기반이 된다
다른 접근HumanoidVLM도 휴머노이드 로봇의 복잡한 조작 작업 수행을 위한 제어 프레임워크를 제안한다.
다른 접근비전-언어 모델을 로봇 제어에 활용하는 유사한 접근법을 공유하는 관련 연구이다.
다른 접근둘 다 접촉 기반 휴머노이드 제어를 다루지만 HumanoidVLM은 VLM 기반에, HMC는 heterogeneous control에 집중한다
다른 접근비전 기반 입력을 활용하여 휴머노이드 로봇의 조작 정책을 학습하는 관련 연구이다.
다른 접근휴머노이드 로봇의 조작 태스크를 위한 고수준 지식과 저수준 제어를 결합하는 접근법을 공유한다.
다른 접근Foundation model을 로봇 조작 작업에 적용하는 관련 연구이다.
다른 접근VLM을 활용한 로봇 조작 제어를 다루는 관련 연구로 유사한 문제를 해결한다.
후속 연구멀티모달 VLM의 능력을 휴머노이드의 임피던스 제어에 특화하여 적용했다
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드