UniAct: Unified Motion Generation and Action Streaming for Humanoid Robots

저자: Nan Jiang, Zimo He, Wanhe Yu, Lexi Pang, Yunhao Li, Hongjie Li, Jieming Cui, Yuhan Li, Yizhou Wang, Yixin Zhu, Siyuan Huang | 날짜: 2025-12-30 | DOI: 10.48550/arXiv.2512.24321 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1. UniAct, a unified framework for multimodal motion generation and action streaming. UniAct enables humanoid rob

UniAct는 MLLM과 causal streaming pipeline을 결합한 두 단계 프레임워크로, 인간형 로봇이 언어, 음악, 궤적 등 다양한 multimodal 명령을 sub-500ms 지연시간으로 실행할 수 있게 한다.

Motivation

Achievement

Figure 3

Figure 3. UA-Net dataset analysis. (a) Representative text descriptions of human motions from UA-Net. (b) Rendered motio

How

Figure 2

Figure 2. Overview of UniAct and multimodal representations.

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: UniAct는 MLLM과 robust tracking을 unified framework로 통합하여 실제 humanoid robot에서 multimodal instruction following을 low latency로 달성한 의미 있는 연구이며, UA-Net 데이터셋 기여와 함께 embodied AI 분야에서 중요한 진전을 나타낸다.

같이 보면 좋은 논문

다른 접근휴머노이드 로봇의 다양한 동작 생성을 위한 다른 학습 기반 접근법을 제안한다.
다른 접근멀티모달 명령을 처리하는 로봇 제어를 위한 다른 언어 모델 기반 접근법을 제안한다.
다른 접근휴머노이드 로봇의 다양한 작업 수행을 위한 다른 통합 제어 프레임워크를 제시한다.
다른 접근인간형 로봇의 멀티모달 입력 처리를 위한 다른 대형 언어 모델 기반 접근법이다.
다른 접근로봇의 다양한 명령 실행을 위한 다른 스트리밍 파이프라인 기반 방법론을 다룬다.
다른 접근휴머노이드 로봇의 다양한 조작 명령 실행을 위한 다른 통합 프레임워크를 다룬다.
응용 사례통합된 멀티모달 제어 방법을 휴머노이드 로봇에 적용한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드