Exploring Embodied Multimodal Large Models: Development, Datasets, and Future Directions

저자: Shoubin Chen, Zehao Wu, Kai Zhang, Chunyu Li, Baiyang Zhang, Fei Ma, Fei Richard Yu, Qingquan Li | 날짜: 2025-02-21 | URL: https://arxiv.org/abs/2502.15336 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1: A timeline of research progress in the field of Embodied Perception, Navigation

Embodied Multimodal Large Models (EMLMs)는 Large Language Models, Large Vision Models 등의 기초 모델들을 결합하여 지각, 인지, 행동을 물리적 환경에서 통합하는 체계적인 종합 리뷰이다. 본 논문은 300개 논문을 분석하여 EMLMs의 발전, 데이터셋, 및 미래 방향에 대한 첫 번째 체계적 분석을 제공한다.

Motivation

Achievement

Figure 1

Figure 1: A timeline of research progress in the field of Embodied Perception, Navigation

How

Figure 1

Figure 1: A timeline of research progress in the field of Embodied Perception, Navigation

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 본 리뷰는 EMLMs 분야의 첫 번째 체계적 종합 분석으로서, foundational models부터 embodied tasks까지 full-stack을 다루며 최신 연구 동향을 포괄적으로 정리했다. 명확한 구조와 풍부한 사례로 이 급속히 발전하는 분야의 현황과 미래 방향을 제시하는 매우 가치 있는 리뷰이다.

같이 보면 좋은 논문

기반 연구Exploring Embodied Multimodal Large Models 논문은 Open X-Embodiment를 활용한 다양한 대형 모델 사례분석을 통해 RT-X를 비롯한 모델들의 응용 및 한계를 조명한다.
기반 연구Foundation Models in Robotics는 로봇 도메인에서의 기초 모델 이슈를 함께 리뷰하며, Embodied Multimodal Large Models 논문의 논의 범위를 보완합니다.
기반 연구9092의 VLA 서베이는 embodied multimodal large model(EMLM)이라는 메타 프레임워크의 도입과 발전 배경을 종합적으로 다뤄, 관련 모델 연구의 기반을 제공한다.
기반 연구Exploring Embodied Multimodal Large Models 논문은 최신 embodied AI의 데이터, 모델, 시스템적 발전을 추가로 보완해준다.
기반 연구A Survey on Vision-Language-Action Models: An Action Tokenization Perspective는 VLA model의 전반적 개념·동향 정리로서, EMLM 리뷰 논문의 이론적 토대가 됩니다.
후속 연구Open-World Object Manipulation은 대규모 VLA와 벤치마크를 통한 실제 오브젝트 조작 사례로, EMLM(VLM+LLM+Action)의 미래지향적 응용 방향을 보여줍니다.
후속 연구Embodied Multimodal Large Models와 관련 survey 논문은 Voyager와 같이 LLM 기반 lifelong agent의 구조와 문제의식에 강한 이론적 배경을 제공한다.
후속 연구1445의 Large Model Empowered Embodied AI Survey는 EMLM의 응용, 데이터, 벤치마크 등 후속 세대 발전 방향을 더욱 폭넓은 관점에서 체계적으로 리뷰한다.
후속 연구OmniVLA는 물리적으로 그라운딩된 멀티모달 VLA 모델로, EMLM 리뷰의 종합 방향성을 실제 구현 사례로 확장한 결과입니다.
후속 연구Exploring Embodied Multimodal Large Models는 EMLM 전반의 구조와 발전을 리뷰하여, DualVLA의 부분 분리 전략의 학문적 뒷받침이 됩니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드