DivScene: Towards Open-Vocabulary Object Navigation with Large Vision Language Models in Diverse Scenes

저자: Zhaowei Wang, Hongming Zhang, Tianqing Fang, Ye Tian, Yue Yang, Kaixin Ma, Xiaoman Pan, Yangqiu Song, Dong Yu | 날짜: 2024-10-03 | URL: https://arxiv.org/abs/2410.02730 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC0 / Public Domain

Essence

Figure 2

Figure 2: Data collection process. On the left, we show the process of collecting scenes. We prompt GPT-4o to

Large Vision-Language Models (LVLMs)의 embodied 환경 이해와 네비게이션 능력을 탐구하기 위해 81개 장면 유형과 5,707개 객체 범주를 포함하는 대규모 데이터셋 DivScene을 제시하고, CoT 설명을 통한 fine-tuning으로 GPT-4o를 20% 이상 상회하는 성능 달성.

Motivation

Achievement

Figure 2

Figure 2: Data collection process. On the left, we show the process of collecting scenes. We prompt GPT-4o to

How

Figure 2

Figure 2: Data collection process. On the left, we show the process of collecting scenes. We prompt GPT-4o to

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 이 논문은 open-vocabulary object navigation 작업을 처음 체계적으로 정의하고 기존의 100배 이상 다양한 객체를 포함하는 대규모 벤치마크를 제시하여 높은 학술적 기여도를 가짐. LVLM의 embodied AI 능력을 평가하기 위한 중요한 자산을 제공하며, BFS 기반 이모테이션 러닝과 CoT 설명의 조합으로 실용적이고 효율적인 학습 방법을 제시한 점이 탁월함.

같이 보면 좋은 논문

기반 연구CoWs on Pasture는 open-vocabulary object navigation의 초기 CLIP 기반 접근을 제공하여, DivScene에서 제안한 데이터셋 및 평가 방식을 준비하는 기반이 됩니다.
기반 연구ApexNav는 zero-shot object navigation에서 적응적 탐색전략을 제시해, DivScene의 오픈보캐뷸러리 네비게이션 벤치마크 목적에 부합합니다.
다른 접근DivScene은 대형 사전학습 언어모델을 활용한 open-vocabulary navigation을 제시하여, ApexNav와의 의미-기하학적 탐색 방식 비교가 가능하다.
다른 접근L3MVN은 대규모 LLM을 이용한 open-vocabulary 시각적 목표 항법 프레임워크로 유사 문제를 접근하되 데이터셋 설계 대신 접근합니다.
다른 접근A Survey on Vision-Language-Action Models for Autonomous Driving은 DivScene의 embodied navigation과 차별적으로 운전-기반 시나리오에서 VLA 모델을 다룹니다.
후속 연구Open-vocabulary Queryable Scene Representations for Real World Robotics 논문은 실제 환경에서 open-vocabulary 질의 기반의 장면표현을 탐구하여 DivScene의 데이터셋이 지닌 활용 가능성을 확장할 수 있습니다.
후속 연구Visual Language Maps for Robot Navigation은 대규모 장면-객체 맵핑, 언어-비전-행동의 통합을 다루는 DivScene의 실제 내비게이션 적용 사례입니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드