저자: Alexander Robey, Zachary Ravichandran, Vijay Kumar, Hamed Hassani, George J. Pappas | 날짜: 2024-10-17 | URL: https://arxiv.org/abs/2410.13691 📄 PDF
라이선스: arXiv 비독점 라이선스
Figure 1: Jailbreaking LLM-controlled robots.
LLM 기반 로봇 제어 시스템의 보안 취약점을 조사하기 위해 RoboPAIR 알고리즘을 제안하며, 이는 채팅봇 jailbreak와 달리 실제 물리적 해로운 행동을 유도하는 최초의 공격 방식이다.
Figure 3: Jailbreaking elicits harmful robotic actions. When directly prompted, LLM-controlled
Figure 4: Jailbreaking the Unitree Go2.
총평: 본 연구는 LLM 제어 로봇의 물리적 안전성 위협을 최초로 체계적으로 입증한 중요한 보안 연구로, 실제 배포된 상용 로봇에 대한 jailbreak 성공은 AI 안전 분야에서 획기적인 발견이다. 다만 방어 메커니즘에 대한 구체적 제안은 후속 연구로 남겨져 있어 실제 배포 환경에서의 완전한 방어 책임은 산업체에 전가되는 측면이 있다.