Do You Have Freestyle? Expressive Humanoid Locomotion via Audio Control

저자: Zhe Li, Cheng Chi, Yangyang Wei, Boan Zhu, Tao Huang, Zhenguo Sun, Yibo Peng, Pengwei Wang, Zhongyuan Wang, Fangzhou Liu, Chang Xu, Shanghang Zhang | 날짜: 2025-12-29 | URL: https://arxiv.org/abs/2512.23650 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1.

RoboPerform은 오디오를 직접 제어 신호로 사용하여 음악에 맞춰 춤을 추거나 음성에 맞춰 제스처를 생성하는 휴머노이드 로봇 제어 프레임워크로, 명시적 모션 재구성을 제거하여 저지연 및 고충실도를 달성한다.

Motivation

Achievement

Figure 2

Figure 2. Overview of RoboPerform. We propose a two-stage approach: train an adaptor to inject kinematic information int

How

Figure 2

Figure 2. Overview of RoboPerform. We propose a two-stage approach: train an adaptor to inject kinematic information int

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: RoboPerform은 오디오 제어 신호를 휴머노이드 로봇 모션에 직접 통합하는 novel한 접근으로, retargeting-free 설계와 content-style decomposition을 통해 저지연 고충실도 실시간 성능을 달성한 의미 있는 기여이다. 다만 실제 로봇 배포 및 sim-to-real 검증이 추가되면 실용성이 더욱 강화될 것이다.

같이 보면 좋은 논문

기반 연구expressive motion generation의 기본 방법론을 제공하는 연구다
기반 연구오디오 기반 동작 생성의 방법론적 기반을 제공하는 연구이다.
다른 접근음악이나 오디오에 맞춘 로봇 동작 생성을 위한 대안적 방법론을 제시한다.
다른 접근audio-to-motion generation을 다른 generalist 모델 접근법과 비교할 수 있다
다른 접근휴머노이드 로봇의 표현적 동작 생성을 위한 유사한 학습 프레임워크를 다룬다.
다른 접근자연어나 오디오를 활용한 휴머노이드 로봇의 표현적 동작 제어를 다루는 유사한 연구이다.
다른 접근로봇의 표정 또는 입술 움직임 애니메이션 생성을 위한 대안적 방법론을 제안한다.
다른 접근오디오 또는 언어 입력을 기반으로 휴머노이드 로봇의 동작을 생성하는 유사한 접근법을 취한다.
후속 연구vision-language-action을 audio modality로 확장한 multimodal 접근이다
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드