JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation
저자: Shuang Zeng, Dekang Qi, Xinyuan Chang, Feng Xiong, Shichao Xie, Xiaolong Wu, Shiyi Liang, Mu Xu, Xing Wei, Ning Guo | 날짜: 2025-09-26 | URL: https://arxiv.org/abs/2509.22548📄 PDF
⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: arXiv 비독점 라이선스
Essence
Figure 1: JanusVLN, using RGB-only video, decouples visual semantics and spatial geometry to
JanusVLN은 시각-언어 네비게이션에서 spatial-geometric과 visual-semantic 정보를 분리하여 dual implicit neural memory로 모델링하는 프레임워크를 제안한다. 3D 기하학적 선행 지식과 MLLM의 의미론적 이해를 결합하여 효율적이고 공간 인식적인 에이전트 네비게이션을 실현한다.
Motivation
Known: 최근 VLN 방법들은 MLLM의 강력한 의미론적 이해를 활용하고 있으며, explicit semantic memory(텍스트 인지 맵, 과거 프레임 저장)를 구축해왔다. 그러나 2D image-text 쌍으로 사전학습된 CLIP 기반 인코더는 3D 기하학적 구조와 공간 정보 이해에 부족하다.
Gap: 기존 방법들은 공간 정보 손실, 계산 중복, 메모리 팽창 문제로 인해 효율적 네비게이션이 어렵고, 명시적 메모리는 궤적 길이에 따라 지수적으로 증가하여 중요 정보 추출을 방해한다. 또한 2D 시각 인코더로는 3D 기하학적 구조와 공간 관계를 적절히 포착할 수 없다.
Why: 효율적이고 공간 인식적인 네비게이션을 위해서는 의미론적 이해와 기하학적 공간 인식을 동시에 처리하는 것이 필수적이다. RGB-only 입력만으로도 3D 공간 정보를 활용하면 실제 로봇 배포 시 하드웨어 의존성을 줄일 수 있다.
Approach: 인간 뇌의 반구 특화(좌뇌 의미론, 우뇌 공간 인식)에 영감받아, 3D visual geometry foundation model(VGGT)로부터 spatial-geometric 정보를 추출하고, MLLM의 visual encoder로부터 visual-semantic 정보를 추출한다. 두 인코더의 key-value 캐시를 fixed-size dual implicit memory로 구성하고, initial window와 sliding window 방식으로 효율적으로 업데이트한다.
Achievement
Figure 1: JanusVLN, using RGB-only video, decouples visual semantics and spatial geometry to
SOTA 성능 달성: VLN-CE 벤치마크에서 20개 이상의 최근 방법을 능가하며, 다중 데이터타입 사용 방법 대비 10.5-35.5%, RGB만 사용하면서도 더 많은 훈련 데이터 사용 방법 대비 3.6-10.8% 성공률 향상
계산 효율성: 초기 및 슬라이딩 윈도우 방식으로 중복 계산을 제거하고 효율적인 incremental update 실현
메모리 효율성: fixed-size neural representation으로 메모리 크기가 궤적 길이에 따라 증가하지 않음
3D 공간 이해 향상: RGB-only 입력에서 3D spatial cues(원근, occlusion, 기하학적 구조)를 활용하여 공간 추론 능력 강화
보조 데이터 불필요: depth나 point cloud 같은 별도의 3D 데이터 없이도 3D 기하학적 정보 추출 가능
How
Figure 2: The framework of JanusVLN. Given an RGB-only video stream and navigation instruc-
3D visual geometry foundation model(VGGT)을 통해 RGB로부터 depth와 point cloud 정보 추출
총평: JanusVLN은 VLN 분야에서 implicit dual memory 패러다임을 도입하여 의미론적 이해와 3D 공간 인식을 효과적으로 결합한 혁신적인 연구이다. RGB-only 입력으로 SOTA 성능을 달성하면서도 계산 효율성과 메모리 효율성을 모두 확보하여 향후 embodied AI 연구의 새로운 방향을 제시한다.