저자: Bangguo Yu, Hamidreza Kasaei, Ming Cao | 날짜: 2023-04-11 | URL: https://arxiv.org/abs/2304.05501 📄 PDF
라이선스: arXiv 비독점 라이선스
Fig. 2: The architecture of the target navigation framework. The framework takes RGB-D images as input to generate a
대형 언어모델(LLM)을 활용하여 의미적 맵과 프론티어 선택을 통해 미지의 환경에서 시각적 목표 항법을 수행하는 프레임워크를 제안한다. Zero-shot과 feed-forward 두 가지 패러다임으로 상식적 추론을 이용한 효율적 탐색을 달성한다.
Fig. 1: Visual target navigation example. The robot explores
Fig. 2: The architecture of the target navigation framework. The framework takes RGB-D images as input to generate a
총평: LLM의 상식적 지식을 의미적 탐색에 활용하는 창의적인 접근으로 학습 비용을 크게 절감하면서도 우수한 일반화 성능을 달성했다. Zero-shot 학습 능력과 실제 로봇 실험을 통해 실용성을 입증한 의미 있는 연구이나, 실시간 성능과 다양한 환경에서의 확장성 검증이 필요하다.