Essence
Figure 1: Embodied instruction following with LM-Nav: Our system takes as input a set of raw observations
LM-Nav는 GPT-3, CLIP, ViNG 세 가지 사전학습된 모델을 조합하여 자연언어 명령으로 로봇이 실제 환경에서 네비게이션을 수행하는 시스템이다. 로봇 데이터에 대한 언어 주석 없이도 복잡한 실외 환경에서 장거리 네비게이션을 실현한다.
Evaluation
Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: LM-Nav는 사전학습 대규모 모델의 획기적 조합을 통해 로봇 학습의 주요 병목(언어 주석)을 제거하면서도 실제 환경에서의 자연언어 네비게이션을 달성한 혁신적 연구다. 파인튜닝 없는 모듈식 설계와 실제 환경 검증이 학계와 산업 양쪽 모두에 높은 영향력을 제시한다.
같이 보면 좋은 논문
기반 연구Bridging Language and Action는 language-conditioned policy에 대한 survey로, LM-Nav처럼 대형 언어/시각 모델을 로봇 정책에 연동하는 근간을 제공한다.
기반 연구Neural Scaling Laws in Robotics는 대규모 멀티모달 모델이 네비게이션 성능에 끼치는 영향을 분석하여, LM-Nav와 같은 대규모 사전학습 기반 시스템의 성능 기초를 제공합니다.
다른 접근로봇의 오픈 어휘 내비게이션 문제를 다루지만 VLMaps와는 다른 접근법으로 의미론적 공간 표현을 구성한다.
다른 접근LM-Nav는 대규모 언어/비전 기반 모델을 이용한 navigation 중심 접근을 제시하며, 실세계 휴머노이드 로코모션처럼 실제 로봇 적용의 또 다른 예시를 보여준다.
다른 접근ApexNav는 자연언어 기반 로봇 네비게이션을 위한 적응적 탐색 전략을 제시하여, LM-Nav와 달리 효율적인 경로 탐색 측면을 강조합니다.
후속 연구LM-Nav는 LLM을 활용한 의미적 맵과 내비게이션이라는 점에서 L3MVN의 기본 개념 및 실험적 근간이 됩니다.
후속 연구LM-Nav(1461)은 인간 및 로봇 비디오의 정렬/매핑 방식에서 Human2Robot(1425)가 참조한 대표적인 navigation 중심 프레임워크이다.
후속 연구RoboCerebra는 장기 경로 네비게이션과 open-vocabulary 명령 인식 측면에서 LM-Nav의 네비게이션 성능 평가를 실제 롱-호라이즌 스케일로 확장한다.
후속 연구LOVON은 open-vocabulary 객체 탐색과 계층적 계획이 결합된 legged robot 연구로, LM-Nav의 실제 환경 네비게이션을 더욱 동적이고 복잡한 setting으로 확장시킵니다.
후속 연구LM-Nav: Robotic Navigation with Large Pre-Trained Models of Language, Vision, and Action은 대규모 프리트레이닝된 멀티모달 정책을 RL 기반 네비게이션에 적용한 프레임워크를 기술한다.
응용 사례RT-2는 web-scale vision-language-action 지식을 실제 로봇에 적용함으로써, LM-Nav의 multi-modal 대규모 사전학습 기반 내비게이션 아이디어가 실제 조작 응용에도 접목될 수 있음을 보입니다.