저자: Qijun Liao, Zhaoxin Yu, Jue Yang | 날짜: 2026-05-05 | URL: https://arxiv.org/abs/2605.04185 📄 PDF
라이선스: CC BY
본 논문은 강화학습에서 이질적(heterogeneous) 관절별 액추에이터 속도 제약을 정확히 처리하는 Dynamic Decoupled Spherical Radial Squashing (DD-SRad) 기법을 제안한다. 기존의 isotropic spherical 방법은 ℓ∞ 박스 형태의 제약을 ℓ2 공 형태로 압축하여 실현 가능 집합을 손실하는 반면, DD-SRad는 차원별 적응 반경(per-dimension adaptive radius)을 독립적으로 계산하여 정확한 ℓ∞ 커버리지를 달성한다.
Figure 5 presents the post-convergence per-dimension utilization radar charts across four MuJoCo
하드 제약 만족: Theorem 2.4에서 확률 1로 모든 제약 |a_i^t - a_i^{t-1}| ≤ δ_i 만족 증명. 기하학적 정렬: ℓ∞ 박스와 정확히 일치하는 실현 가능 집합으로 30~50% 제약 공간 커버리지 개선. 그래디언트 보존: Proposition 2.5에서 Jacobian이 대각 행렬이고 조건수(condition number)가 κ = max_i δ_i / min_i δ_i로 제한됨을 보이며, 경계 근처에서도 그래디언트 손실 최소화. 실증 성능: MuJoCo 벤치마크에서 제약 위반 0건 유지하며 제약 없는 상한과 동등한 최고 수익률 달성, IsaacLab의 Unitree H1/G1에서 공식 사양으로부터 end-to-end 최적성 검증.
Figure 4 presents the mean return learning curves across four MuJoCo environments (Ant-v5,
총평: 본 논문은 이질적 속도 제약을 가진 강화학습 문제에 대해 이론적으로 건전하고 실무적으로 효과적인 해결책을 제시한다. 기하학적 직관, 엄밀한 정리, 광범위한 실증이 결합되어 있으며, 실 로봇 배포 경로를 명확히 제시하는 점이 돋보인다. 다만 UI=0 미분 불가능성, 제한된 실험 범위, 수렴성 증명 부재가 소수의 약점이나 전반적으로 게재 가치가 충분하다.