DualVLA: Building a Generalizable Embodied Agent via Partial Decoupling of Reasoning and Action

저자: Zhen Fang, Zhuoyang Liu, Jiaming Liu, Hao Chen, Yu Zeng, Shiting Huang, Zehui Chen, Lin Chen, Shanghang Zhang, Feng Zhao | 날짜: 2025-11-27 | URL: https://arxiv.org/abs/2511.22134 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 1

Figure 1. DUALVLA first constructs a sparse, information-dense embodied reasoning dataset by combining video event predi

DualVLA는 Vision-Language-Action 모델에서 추론 능력을 추가할 때 발생하는 행동 성능 저하(action degeneration)를 해결하기 위해, 이중층 데이터 프루닝과 이중 교사 적응형 증류 전략을 통해 추론과 행동을 부분적으로 분리하는 접근법을 제시한다.

Motivation

Achievement

Figure 2

Figure 2. VLMs possess strong reasoning ability but lack action

How

Figure 1

Figure 1. DUALVLA first constructs a sparse, information-dense embodied reasoning dataset by combining video event predi

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 본 논문은 Vision-Language-Action 모델의 실질적인 문제인 action degeneration을 명확히 정의하고, 이를 해결하기 위한 이중층 프루닝과 이중 교사 증류 전략을 제시함으로써 추론 능력과 조작 능력의 균형을 효과적으로 달성하였다. 특히 VLA 평가를 위한 다차원적 프레임워크 제시는 향후 embodied AI 연구의 평가 표준으로서 중요한 기여를 한다.

같이 보면 좋은 논문

기반 연구Real-World Humanoid Locomotion with RL은 행동-추론 trade-off 상황에서 RL적 접근 이론을 제안하여 DualVLA의 설계 근거가 된다.
기반 연구1442의 JARVIS-1은 메모리 증강형 멀티태스크 embodied agent로 reasoning-context와 action 모듈 부분 분리에 관한 아이디어를 DualVLA의 구현에 이론적 기반을 제공한다.
기반 연구Exploring Embodied Multimodal Large Models는 EMLM 전반의 구조와 발전을 리뷰하여, DualVLA의 부분 분리 전략의 학문적 뒷받침이 됩니다.
다른 접근1545의 Robot Learning in the Era of Foundation Models는 VLA 모델 post-training 시 행동 성능 저하와 해결책 등, DualVLA의 문제의식을 보다 다양한 관점에서 리뷰한다.
다른 접근DualVLA도 Partial Parameter Sharing dual-system 접근을 택해, OpenHelix의 디자인 리뷰와 시너지 높게 비교 가능하다.
다른 접근DualVLA는 partial modality와 전문가 네트워크 융합을 통한 unified VLA 정책을 제시하여, UniVLA와 같이 통합적인 시퀀스 모델링에 대안이 되는 멀티모달 구조를 제공한다.
다른 접근Discrete Diffusion VLA는 행동 토큰의 분리와 디퓨전 적용에 집중하며, DualVLA의 추론-행동 분리 문제에 다른 관점의 접근을 제시합니다.
다른 접근VLA-Reasoner는 VLA 모델 내 추론과 행동을 강화학습 기반 구조로 효과적으로 조합하는 방안을 다루어 DualVLA의 부분적 분리 전략과 비교해볼 수 있다.
다른 접근SimpleVLA-RL은 RL 기반 VLA 파인튜닝의 단순화와 스케일 확장에 초점을 맞추어, VLA-RFT와 다른 강화학습 접근을 보여준다.
후속 연구DualVLA는 시스템 2 수준의 reasoning task와 VLA 구조의 결합 기반을 제시해, reflective planning 방식과 밀접하다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드