HoRD: Robust Humanoid Control via History-Conditioned Reinforcement Learning and Online Distillation

저자: Puyue Wang, Jiawei Hu, Yan Gao, Junyan Wang, Yu Zhang, Gillian Dobbie, Tao Gu, Wafa Johal, Ting Dang, Hong Jia | 날짜: 2026-02-04 | URL: https://arxiv.org/abs/2602.04412 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1. Framework overview. Two-stage teacher–student learning pipeline for robust humanoid control under partial obse

HoRD는 history-conditioned reinforcement learning과 online distillation을 결합한 두 단계 학습 프레임워크로, 휴머노이드 로봇이 도메인 시프트 상황에서 강건한 제어를 수행하도록 한다.

Motivation

Achievement

Figure 2

Figure 2. Results of HoRD on six representative motions, while red markers indicate ground-truth skeleton joints. Qualit

How

Figure 1

Figure 1. Framework overview. Two-stage teacher–student learning pipeline for robust humanoid control under partial obse

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: HoRD는 history-conditioned 동역학 추론과 sparse 명령 처리라는 두 가지 핵심 혁신을 통해 휴머노이드 제어의 강건성과 일반화 문제를 효과적으로 해결하며, 광범위한 실험 검증과 데이터셋 공개로 실용적 가치를 입증한다.

같이 보면 좋은 논문

기반 연구실제 humanoid locomotion의 기반 기술을 history-conditioned RL로 더 robust하게 발전시킨 형태입니다.
기반 연구history 조건부 정책 학습의 기반이 되는 sim-to-real 전이를 위한 강건한 제어 프레임워크를 제공한다.
다른 접근온라인 적응과 증류를 결합하여 도메인 랜덤화 없이 강건한 로봇 제어를 달성하는 유사한 두 단계 접근법을 사용한다.
다른 접근실제 환경 배포 시 도메인 시프트 문제를 해결하기 위한 history 기반 적응 방법론을 제시한다.
다른 접근도메인 시프트에 강건한 휴머노이드 로봇 제어를 위한 history-conditioned 강화학습 프레임워크를 제안한다.
다른 접근도메인 랜덤화와 history 정보를 활용한 강건한 휴머노이드 로봇 제어 방법을 제안한다.
다른 접근둘 다 robust humanoid control이지만 HoRD는 history conditioning에, RGMP-S는 geometric prior에 기반한 다른 접근법입니다.
다른 접근휴머노이드 로봇의 안전한 실제 환경 적응을 위한 대안적 미세조정 방법이다.
다른 접근휴머노이드 로봇의 강건한 제어를 위한 온라인 증류 및 도메인 적응 방법을 다루는 관련 연구이다.
후속 연구HOVER의 다목적 전신 제어 프레임워크를 기반으로 도메인 시프트 강건성을 추가한 확장 연구이다.
후속 연구물리 기반 캐릭터 제어와 모션 모방 학습의 기반 방법론을 제공한다.
후속 연구15분 학습의 빠른 sim-to-real을 history conditioning과 결합하여 더 robust하고 효율적인 humanoid control을 달성합니다.
후속 연구물리 기반 전신 제어 및 모션 생성의 기반 방법론을 제공한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드