Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision

저자: Haoyang Li, Guanlin Li, Youhe Feng, Chen Zhao, Zhuoran Wang, Yang Li, Qizhe Wei, Shifeng Bao, Haitao Shen, Yihan Zhao, Tong Yang, Jing Zhang | 날짜: 2026-07-01 | DOI: 10.48550/arXiv.2606.30552


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

Figure 1

Figure 1: The framework of ZR-0. ZR-0 combines a vision-language model (VLM) with a Diffusion

ZR-0는 embodiment마다 상이한 저수준 state/action space와 달리 조작 작업 이면의 고수준 인지 과정(장면 인식, 계획, 하위작업 분해)은 embodiment에 무관하게 공유된다는 관찰에 기반해, dense Embodied Chain-of-Thought(ECoT) 감독을 통해 cross-embodiment representation을 정렬하는 2.6B 파라미터 dual-stream VLA 모델이다.

Motivation

Achievement

Figure 1

Figure 1: The framework of ZR-0. ZR-0 combines a vision-language model (VLM) with a Diffusion

  1. ZR-0 모델 제안: System1/System2 인지 프레임워크에 기반한 2.6B 파라미터 dual-stream VLA 모델로, VLM(Qwen3-VL-2B-Instruct 초기화)과 DiT 기반 action expert를 cross-attention으로 결합.
  2. 추론 비용 없는 ECoT 활용: action expert가 VLM의 input prompt feature에만 attend하도록 cross-attention mask를 설계해, 학습 시 ECoT 감독의 representation 이득을 얻으면서 추론 시 ECoT 생성을 완전히 생략해도 성능 저하가 없음을 입증.
  3. ProcCorpus-60M 데이터셋 활용: Open X-Embodiment, DROID, RH20T 등 다양한 오픈소스 로봇 데이터셋을 통합하고 전체 프레임의 96.8%에 dense ECoT annotation(장면 묘사, 진행 상황, 계획, 하위작업, bounding box, action token)을 부여한 약 6천만 프레임(약 1000시간, 40만+ trajectory) 규모의 사전학습.
  4. 다양한 embodiment에서의 검증: LIBERO(단일 팔), RoboTwin 2.0(양팔), RoboCasa GR-1 Tabletop(휴머노이드) 세 시뮬레이션 벤치마크와 xArm 실물 실험 전반에서 강력한 성능을 입증.

How

Figure 1

Figure 1: The framework of ZR-0. ZR-0 combines a vision-language model (VLM) with a Diffusion

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 고수준 reasoning의 embodiment-agnostic한 성격에 착안하여 dense ECoT 감독으로 cross-embodiment representation을 정렬하고, 추론 시 비용 없이 이를 활용하는 실용적 설계가 돋보이는 연구로, 대규모 데이터셋 구축과 다양한 embodiment에서의 검증을 통해 VLA 연구에 의미 있는 기여를 한다.

같이 보면 좋은 논문

기반 연구embodiment에 무관한 고수준 인지 표현 학습이라는 공통된 기반 개념을 공유한다.
다른 접근humanoid loco-manipulation 학습에 대한 서로 다른 접근 방식을 제시한다.
응용 사례dexterous manipulation 데이터셋을 활용해 VLA 모델 학습에 적용될 수 있다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드