SHIELD: Safety on Humanoids via CBFs In Expectation on Learned Dynamics
저자: Lizhi Yang, Blake Werner, Ryan K. Cosner, David Fridovich-Keil, Preston Culbertson, Aaron D. Ames | 날짜: 2025-05-16 | URL: https://arxiv.org/abs/2505.11494📄 PDF
⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: arXiv 비독점 라이선스
Essence
Fig. 1. A humanoid robot implementing the SHIELD architecture au-
SHIELD는 학습 기반 휴머노이드 로봇 컨트롤러에 안전 계층을 추가하여 실시간 제약 조건 명시와 확률적 안전 보장을 동시에 제공하는 프레임워크이다. 동적 잔차 모델과 확률적 이산 시간 제어 배리어 함수(S-DTCBF)를 통해 기존 블랙박스 RL 정책을 재학습 없이 안전화한다.
Motivation
Known: RL 기반 로봇 컨트롤러는 복잡한 작업에서 우수한 성능을 보이지만 공식적 안전 보장이 부족하다. CBF는 정확한 동역학 모델이 있을 때 효과적이지만 humanoid와 같은 복잡한 시스템에는 적용이 어렵다.
Gap: 학습 기반 컨트롤러의 견고한 성능과 형식적 안전 보장 사이의 간극이 존재한다. 기존 모델 기반 방법은 정확한 동역학 모델을 요구하지만 실제 humanoid 시스템에서는 이를 획득하기 어렵다.
Why: Humanoid 로봇이 인간 환경에서 작동해야 하므로 실시간 안전 제약 명시와 강력한 안전 보장이 필수적이다. 동시에 성능을 유지하면서 재학습 없이 새로운 제약을 추가할 수 있어야 한다.
Approach: SHIELD는 세 단계로 구성된다: (1) 사용자가 안전 제약 수학적으로 명시, (2) 실제 하드웨어 데이터로 CVAE 기반 동역학 잔차 모델 학습, (3) 학습된 잔차 분포를 활용하여 S-DTCBF 제약을 만족하도록 참조 신호 생성.
Achievement
Fig. 2. SHIELD enables real-world pedestrian avoidance with a humanoid robot, using a “general-purpose” RL policy. Top:
계층적 안전 아키텍처: 기존 autonomy stack 위에 비침습적(minimally-invasive) 안전 계층을 추가하여 재학습 없이 새로운 제약을 런타임에 명시 가능
확률적 안전 보장: S-DTCBF 공식을 통해 유한 시간 K 스텝 내 제약 위반 확률에 대한 형식적 보증 제공
성능-안전 균형: CVAE 기반 동역학 잔차 모델로 추적 성능 개선과 동시에 확률적 안전 보장 달성
실제 humanoid 검증: Unitree G1 로봇에서 실내/외부 환경에서의 장애물 회피 및 보행자 회피 성공 실증
총평: SHIELD는 학습 기반 humanoid 컨트롤러의 실제 배포를 위한 현실적이고 실용적인 안전 보장 방법을 제시하며, 데이터 기반과 모델 기반 방법의 간격을 효과적으로 연결한다. 실제 로봇 실험 검증과 함께 이론적 안전 보장을 제공하여 로봇 안전 연구에 상당한 기여를 한다.