TD-GRPC: Temporal Difference Learning with Group Relative Policy Constraint for Humanoid Locomotion

저자: Khang Nguyen, Khai Nguyen, An T. Le, Jan Peters, Manfred Huber, Ngo Anh Vien, Minh Nhat Vu | 날짜: 2025-05-19 | URL: https://arxiv.org/abs/2505.13549 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 2

Fig. 2: Overview of TD-GRPC for Humanoid Locomotion: Starting from an initial state s0 encoded into latent state z0 with

본 논문은 Humanoid Locomotion을 위해 TD-MPC 프레임워크에 Group Relative Policy Optimization (GRPO)와 trust-region constraint를 통합한 TD-GRPC를 제안하여, off-policy 학습의 불안정성과 policy mismatch 문제를 해결한다.

Motivation

Achievement

Figure 3

Fig. 3: Episode Returns of TD-GRPC and Baselines on H1–2 in Humanoid Locomotion Tasks: TD-GRPC achieves rapid convergenc

How

Figure 2

Fig. 2: Overview of TD-GRPC for Humanoid Locomotion: Starting from an initial state s0 encoded into latent state z0 with

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 본 논문은 GRPO와 trust-region constraint를 통합한 TD-GRPC를 제안하여 humanoid locomotion의 off-policy 학습 안정성을 효과적으로 개선한 의미 있는 연구이나, 실제 로봇 검증과 이론적 분석 심화, 그리고 더 광범위한 task 평가가 필요하다.

같이 보면 좋은 논문

기반 연구1883은 Group Relative Policy Optimization(GRPO)의 기반 연구로, 2145의 TD-GRPC가 이를 TD-MPC 프레임워크에 통합하는 기반을 제공한다.
다른 접근2062도 휴머노이드 로코모션을 위한 강화학습 최적화 방법을 제안하며, 2145의 TD-GRPC와 유사한 학습 안정성 문제를 다른 방식으로 해결한다.
다른 접근2017도 휴머노이드 로코모션을 위한 강화학습 기반 제어를 다루며, 2145의 안정적 학습 목표와 유사한 견고성 관심사를 공유한다.
다른 접근2158도 로봇 제어를 위한 강화학습 알고리즘 개선을 다루며, 2145의 GRPO와 trust-region constraint 통합과 유사한 방법론적 관심사를 공유한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드