저자: Boyuan Chen, Fei Xia, Brian Ichter, Kanishka Rao, Keerthana Gopalakrishnan, Michael S. Ryoo, Austin Stone, Daniel Kappler | 날짜: 2022-09-20 | URL: https://arxiv.org/abs/2209.09874 📄 PDF
Essence
Fig. 1: NLMap + SayCan overview. We propose an open-vocabulary and
NLMap은 Visual Language Model을 기반으로 한 개방형 어휘의 쿼리 가능한 장면 표현을 제안하여, LLM 기반 로봇 플래너가 실제 환경의 객체를 인식하고 위치를 파악한 후 맥락-조건부 계획을 수립할 수 있도록 한다.
Evaluation
Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: NLMap은 VLM 기반의 개방형 어휘 장면 표현을 LLM 플래너와 효과적으로 통합하여 로봇이 동적으로 환경 맥락을 인식하고 계획할 수 있도록 한 혁신적인 연구이며, 실제 로봇 실험에서도 기존 방법으로 불가능했던 작업들을 성공적으로 수행하여 실용적 가치를 입증했다.
같이 보면 좋은 논문
기반 연구VLMaps의 시각-언어 기반 공간 지도 개념을 확장하여 보다 복잡한 로봇 작업에 적용한다.
다른 접근Visual Language Maps는 시각언어 맵의 다른 구축 방식을 살펴볼 수 있는 동종 연구다.
기반 연구LERF 논문은 언어-내장형 신(scene) 표현을 제안하며, NLMap과 유사한 오픈어휘 장면 표현 모델의 기초가 된다.
기반 연구Open-vocabulary Queryable Scene Representations for Real World는 free-form query 기반 open vocabulary 3D scene representation의 평가와 적용 면에서 OVSG의 개념을 발전시킵니다.
다른 접근Context-Aware Entity Grounding 논문은 3D 씬 어노테이션 및 오픈-보캐뷸러리 네비게이션과 관련된 다른 시맨틱 맵핑 접근법을 보여준다.
기반 연구Open-vocabulary Queryable Scene Representations 논문은 Genie's open-ended world 생성 환경에서 장면을 쿼리하고 활용할 수 있는 구조적 표현 연구로 확장성을 보여줍니다.
기반 연구Open-vocabulary Queryable Scene Representations for Real World Robotics 논문은 실제 환경에서 open-vocabulary 질의 기반의 장면표현을 탐구하여 DivScene의 데이터셋이 지닌 활용 가능성을 확장할 수 있습니다.
기반 연구Open-vocabulary Queryable Scene Representations 논문은 실제 환경에서 navigation 및 경로계획에 있어 다양한 입력 쿼리를 처리하는 응용 사례로 FDM의 안전경로 계획과 연관지어 볼 수 있습니다.
다른 접근Open-vocabulary Queryable Scene Representations for Real World는 로봇의 시맨틱 메모리 및 open-vocabulary grounding 관점에서 CLIP-Fields와 유사 주제를 다르게 전개합니다.
다른 접근Open-vocabulary Queryable Scene Representations for Real World Robotics(1505)은 Grounding DINO의 오픈셋 객체 탐지 문제에 대해 씬 표현에 중점을 둔다.
다른 접근Open-vocabulary Queryable Scene Representations 논문은 비디오는 아니지만, 시각-언어 정보를 활용해 open-vocabulary 신(scene) 표현을 통해 NaVid과 다른 navigation 접근법을 다룹니다.
다른 접근Open-vocabulary Queryable Scene Representations for Real World은 open-vocabulary semantic map construction에서 zero-shot 3D localization 문제에 대해 BeliefMapNav와 다른 구조를 지향합니다.
다른 접근Open-vocabulary Queryable Scene Representations 논문은 자유도 높은 목표 지정 네비게이션을 다루어 OctoNav-Bench와 비교에 적합합니다.
다른 접근GC-VLN은 open-vocabulary 네비게이션에서 instruction을 그래프 제약 조건으로 모델링하여, 장면 표현 및 플래닝 문제를 다른 방식으로 해결한다.
다른 접근TrackVLA++는 오픈어휘 기반 장면 표현 대신 메모리 및 장기 추론에 기반한 네비게이션 강점을 부각시켜, 다른 시맨틱 메모리 방식의 잠재적 이점을 보여줍니다.
후속 연구Open-vocabulary queryable scene representations 논문은 현실 환경에서 오픈보캐뷸러리 객체 탐색의 기반이 되는 장면 표현법을 다룹니다.
후속 연구MapNav는 Open-vocabulary 시맨틱 맵을 메모리 구조로 활용하며, NLMap의 open-world map representation을 ASM 구조로 구체화해 효율성을 높입니다.
후속 연구TRAVEL 논문은 open-vocabulary 기반 장면표현을 실제 navigation 및 planning에 직접 응용, NLMap의 쿼리기반 표현 모델의 실질적 활용 예시를 제공한다.
후속 연구Open X-Embodiment는 다양한 로봇 정책의 실시간 평가와 자동화 프레임워크 구축의 토대를 제공하여 AutoEval 시스템의 실제적 구현에 기여한다.
후속 연구Open-vocabulary Queryable Scene Representations 논문은 OmniVLA가 목표로 하는 open-vocabulary 기반 로봇 네비게이션의 장면 표현과 맵핑 부분에 선구적 역할을 한다.