Essence
Average episode reward as function of the noise strenght for SHAC, SHAC-ASAM, and
이 논문은 differentiable simulator 기반 first-order policy gradient(FoPG) 강화학습 알고리즘인 SHAC에 sharpness-aware optimization(ASAM)을 결합한 SHAC-ASAM을 제안하여, 첫 번째 방법의 샘플 효율성을 유지하면서 zeroth-order 방법(PPO) 수준의 강건성과 일반화 성능을 달성한다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: Sharpness-aware optimization을 differentiable simulation 기반 강화학습에 결합한 참신하고 실용적인 접근으로, 로봇 정책의 sim-to-real 강건성 향상에 유의미한 기여를 하지만 실제 로봇 실험의 부재가 아쉬운 부분이다.
같이 보면 좋은 논문
기반 연구강화학습을 실제 물리 시스템 제어에 적용한 유사 사례이다.
기반 연구행동 섭동에 대한 견고성 평가를 확장하여 적용한다.
기반 연구미분 가능 시뮬레이터 기반 정책 최적화의 이론적 기반을 제공한다.
다른 접근강화학습의 안전성을 확보하기 위한 다른 접근법을 제시하는 관련 연구로 추정된다.
다른 접근로봇 정책 학습의 일반화 성능 개선을 위한 다른 접근법을 제시한다.
다른 접근동일한 로봇 강화학습 일반화 문제에 대한 대안적 최적화 기법을 다룬다.
후속 연구SPECTER2 유사도 0.93로 Reinforcement Learning Policy Optimization와 Scientific AI for Physics and Environment가 맞닿아, 'Improving generalization of robot locomotion policies via sharpness-aware reinforcement learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.91로 Reinforcement Learning Policy Optimization와 Scientific AI for Physics and Environment가 맞닿아, 'Improving generalization of robot locomotion policies via sharpness-aware reinforcement learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.91로 Reinforcement Learning Policy Optimization와 Scientific AI for Physics and Environment가 맞닿아, 'Improving generalization of robot locomotion policies via sharpness-aware reinforcement learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 Scientific Machine Learning for Dynamics와 Scientific AI for Physics and Environment가 맞닿아, 'Improving generalization of robot locomotion policies via sharpness-aware reinforcement learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 Reinforcement Learning Policy Optimization와 Scientific AI for Physics and Environment가 맞닿아, 'Improving generalization of robot locomotion policies via sharpness-aware reinforcement learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.