Advances in Embodied Navigation Using Large Language Models: A Survey

저자: Jinzhou Lin, Han Gao, Xuxiang Feng, Rongtao Xu, Changwei Wang, Man Zhang, Li Guo, Shibiao Xu | 날짜: 2023-11-01 | URL: https://arxiv.org/abs/2311.00530 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Fig. 1: This presentation exhibit a temporal map depicting the works of embodied navigation from 2022 to 2024, and we

이 논문은 Large Language Models (LLMs)과 embodied intelligence의 융합에 초점을 맞춰 LLM 기반 navigation 모델들의 최신 동향을 종합적으로 조사하고, 기존 모델과 데이터셋의 장단점을 분석한 서베이이다.

Motivation

Achievement

Figure 2

Fig. 2: The first type utilizes LLMs to analyze incoming visual or textual data to extract goal-relevant information, up

How

Figure 2

Fig. 2: The first type utilizes LLMs to analyze incoming visual or textual data to extract goal-relevant information, up

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 이 논문은 빠르게 성장하는 LLM 기반 embodied navigation 분야에 대한 첫 번째 체계적 서베이로서, 현재까지의 연구 성과를 명확히 분류하고 미래 방향을 제시하는 중요한 기여를 한다. 다만, 기술적 깊이와 실제 구현상의 도전과제에 대한 더욱 구체적인 분석이 보강된다면 실무자들에게 더욱 유용한 자료가 될 것이다.

같이 보면 좋은 논문

기반 연구1303은 VLN에서 대형 언어모델을 활용한 최신 동향을 조사하며, 1432에서 제시한 웹 기반 이미지-텍스트 쌍의 활용 효과를 심층적으로 논의한다.
기반 연구Large Model Empowered Embodied AI: A Survey는 LLM과 embodied intelligence 융합의 포괄적 기초 지식을 제공한다.
기반 연구A Survey on Vision-Language-Action Models for Embodied AI는 Embodied navigation의 기술 동향과 LLM/VLA 융합의 전반적인 맥락을 제공한다.
기반 연구Multimodal Fusion and Vision-Language Models의 종합적인 서베이는 LLM 기반 네비게이션 모델 비교 및 접근방식을 체계적으로 고찰할 수 있도록 도운다.
다른 접근Advances in Embodied Navigation Using Large Language Models 논문은 대형 언어모델 기반 로봇 내비게이션에 초점을 맞추어, 본 VLN 서베이에 LLM 활용 관점을 추가한다.
다른 접근Advances in Embodied Navigation Using LLM(1303)는 LLM을 기반으로 한 대규모 embodied robot planning 문제를 다른 frame(work)에서 접근한다.
후속 연구ApexNav는 Vision-Language 기반 zero-shot 객체 탐색 전략을 실환경 환경에 적용한 사례로 navigation 연구 흐름의 실질적 진화를 보여준다.
후속 연구Visual Embodied Brain 논문은 대규모 멀티모달 LLM 기반 네비게이션 및 embodied reasoning 어프로치를 실제 로봇에 적용하는 사례로, LLM 기반 네비게이션 연구의 실제 응용을 보여준다.
응용 사례ManipBench는 언어·시각 기반 내비게이션 및 조작 모델의 실제 저수준 동작 평가 지표와 벤치마크로서, LLM 기반 navigation 서베이의 참조점이 된다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드