저자: Maeva Guerrier, Karthik Soma, Hassan Fouad, Giovanni Beltrame | 날짜: 2025 | DOI: arXiv:2505.18858 📄 PDF
강화학습(RL)의 안전성 문제를 제어 장벽 함수(Control Barrier Functions, CBFs)를 활용하여 해결하는 혁신적 접근법을 제시한다. 세 가지 CBF 통합 방식을 통해 로봇이 안전한 행동을 학습하면서도 목표 달성 성능을 유지하도록 한다.
그림 1: 세 가지 안전 가드레일 변형 - 필터(초록색), 보상 기반(주황색), 감쇠(파란색)
그림 2: 유니사이클 모델의 장애물 회피 CBF 구성 - 로봇 축을 따라 ε만큼 이동한 점 x'를 사용
기술적 구현:
한계점:
후속 연구 방향:
총평: 본 논문은 강화학습의 안전성 문제에 대해 제어 장벽 함수를 "가드레일"로 재해석하여 세 가지 구체적인 통합 방식을 제안한 점에서 실용성 있는 접근법을 보여준다. 다만 실험이 단일 장애물 환경으로 제한되어 있고 동적 장애물 처리 능력 및 이론적 안전 보장의 비교 분석이 부재한 점이 연구의 완성도를 저해한다.