Humanoid Locomotion as Next Token Prediction

저자: Ilija Radosavovic, Bike Zhang, Baifeng Shi, Jathushan Rajasegaran, Sarthak Kamat, Trevor Darrell, Koushil Sreenath, Jitendra Malik | 날짜: 2024-02-29 | URL: https://arxiv.org/abs/2402.19469 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 2

Figure 2: Humanoid locomotion as next token prediction. We collect a dataset on trajectories from various sources, such

이 논문은 인간형 로봇의 보행 제어를 언어 모델링의 next token prediction 문제로 재해석한 연구이다. causal transformer를 이용해 sensorimotor trajectories를 자동회귀적으로 예측하되, 불완전한 모달리티(예: 액션 없는 비디오)도 활용할 수 있도록 설계했다.

Motivation

Achievement

Figure 4

Figure 4: Training dataset. To train our model, we construct a dataset of trajectories coming from four different source

제로샷 실제 환경 배포: San Francisco의 다양한 지형에서 학습된 정책이 추가 훈련 없이 보행 성공. 데이터 효율성: 27시간의 보행 데이터만으로 실제 환경 적응 가능. 명령 일반화: 학습 중 보지 못한 후진 보행 등의 새로운 명령에 대한 일반화 능력 입증. 불완전 데이터 활용: 모션캡처 데이터, YouTube 인간 비디오 등 이질적 소스를 통합 학습. 시뮬레이션 성능: 강화학습 기반 최신 기법과 비교 가능한 성능 달성.

How

Figure 3

Figure 3: A general framework for training with different data sources. Our data modeling allows us to train our

• sensorimotor 궤적 T = (o₁,a₁,o₂,a₂,...,oₜ,aₜ)를 K개 토큰으로 토큰화

• 자동회귀 확률 모델: p(t) = ∏ p(tₖ|tₖ₋₁,...,t₁)

• 음의 로그 우도로 훈련하되, Gaussian 분포 가정 하에 MSE 손실 사용

• 완전한 궤적(neural network policy, model-based controller)과 불완전한 궤적(motion capture, YouTube)을 mask token으로 통합

• 테스트 시 자동회귀적으로 액션 실행 후 감각 예측은 무시

• 다양한 데이터 소스를 결합 훈련(joint training) 또는 단계적 사전훈련(pre-training)

Originality

• 로보틱 제어를 next token prediction으로 명확히 재구성하여 NLP의 성공 사례를 체계적으로 이전

• 감지와 모터 모달리티를 함께 모델링(조건부 액션 분포 대신 결합 분포 학습)

• mask token을 통한 다양한 모달리티 불완전성 처리 방식이 간단하면서도 효과적

• 인터넷 비디오 같은 완전히 다른 형태의 데이터를 로보틱 정책 학습에 체계적으로 통합

Limitation & Further Study

• 27시간의 학습 데이터로도 복잡한 시나리오에 대한 견고성이 충분한지 미상. 후속 연구 방향: (1) 다양한 로봇 형태(사족 로봇, 조작 로봇)로의 확장 필요, (2) 동적 환경이나 장애물 회피 같은 더 복잡한 과제에 대한 성능 평가, (3) 실제 환경에서의 재훈련(adaptation) 메커니즘 개발, (4) 모달리티 불완전성이 극심한 경우의 성능 분석

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 이 논문은 언어 모델링 패러다임을 로봇 제어에 효과적으로 적용한 강력한 연구이다. 제로샷 실제 환경 배포, 불완전한 데이터의 창의적 활용, 다양한 소스 통합 등에서 명확한 기여를 보여주며, 기술적으로도 건전하고 실험 결과도 설득력 있다.

같이 보면 좋은 논문

기반 연구causal transformer 기반 sensorimotor 예측의 이론적 기반을 제공하는 연구이다.
다른 접근인간형 로봇의 운동 학습에서 다른 방법론을 사용하는 연관 연구이다.
다른 접근affordance 분석과 공간 추론을 활용한 로봇 조작 계획이라는 유사한 접근법을 취한다.
다른 접근휴머노이드 로봇 제어를 위한 대안적 학습 방법을 제시하는 연구이다.
다른 접근휴머노이드 로봇 제어를 위한 다른 신경망 기반 방법을 제안하는 연구이다.
다른 접근로봇 보행 제어를 위한 대안적 시퀀스 모델링 접근법을 제시한다.
다른 접근로봇의 구현화 인식 및 계획을 위한 유사한 문제를 다루는 연구이다.
다른 접근인간형 로봇의 보행 정책 학습에 대한 다른 접근법을 제안하는 연구이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드