TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies

저자: Ruijie Zheng, Yongyuan Liang, Shuaiyi Huang, Jianfeng Gao, Hal Daumé, Andrey Kolobov, Furong Huang, Jianwei Yang | 날짜: 2024-12-13 | URL: https://arxiv.org/abs/2412.10345 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1: An illustration of our method. The first image shows the original robot’s observation, while the second

Visual trace prompting 기법을 통해 VLA 모델의 spatial-temporal 인식을 향상시켜 로봇 조작 작업의 성능을 개선한 연구이다. 150K 로봇 조작 궤적 데이터셋을 수집하고 TraceVLA 모델을 개발하여 시뮬레이션과 실제 로봇 환경에서 우수한 성능을 입증했다.

Motivation

Achievement

Figure 3

Figure 3: (Left): 7B TraceVLA vs. 7B OpenVLA. (Right): 4B TraceVLA-Phi3 vs. 4B OpenVLA-Phi3.

How

Figure 2

Figure 2: An illustration of visual trace generation. Given a sequence of historical image observations, we first

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: Visual trace prompting은 직관적이면서도 효과적인 기법으로, VLA 모델의 공간-시간 인식을 실질적으로 개선하며 광범위한 실험(시뮬레이션 및 실제 로봇)을 통해 우수한 성능을 일관되게 입증했다. ICLR 2025 게재 논문으로서 로봇 조작 분야의 실질적 기여도가 높다.

같이 보면 좋은 논문

기반 연구Transferring Foundation Models 논문은 Internet-scale pretrained 모델로부터 추론 기반 시각 마스크를 추출·활용하는 토대, TraceVLA의 데이터 활용 패러다임과 유사함.
기반 연구TraceVLA는 visual trace prompting을 통한 spatio-temporal action reasoning을 강조하여, ReKep의 제약 기반 reasoning을 확장한다.
기반 연구TraceVLA 논문은 visual trace prompting을 통해 spatial-temporal 네비게이션 능력을 강화하며, NaVILA의 vision-language-action 기반 네비게이션을 한 단계 진화시킵니다.
기반 연구FAST는 Vision-Language-Action 모델에서 효율적인 액션 토크나이제이션을 논의하여 TraceVLA의 토큰 압축 및 양자화 연구에 이론적 기반을 제공한다.
기반 연구TraceVLA는 시각적 트레이스 프롬프트를 통한 공간-시간적 추론을 시도하여, DexGraspVLA의 시각·언어·행동 연계 방식을 확장합니다.
다른 접근robosuite는 다양한 조작 작업의 시뮬레이션 및 벤치마크를 제공하여 TraceVLA의 large-scale trajectory 데이터셋 및 평가 환경과 다른 플랫폼 기반 대안이 된다.
다른 접근OpenVLA는 오픈소스 VLA 모델로, TraceVLA가 강조하는 효율성과 범용성 측면에서 비교할 만한 대안적인 접근법을 제시한다.
다른 접근SpatialVLA는 Vision-Language-Action 모델의 공간적 표현을 강조하며, TraceVLA와 다른 방법으로 spatial-temporal 인식을 시도한다.
다른 접근TraceVLA는 visual trace prompting을 통한 공간-시간적 행동 추론을 강조하여, EmbodiedVSR의 scene graph 기반 COT reasoning과 주제를 공유합니다.
다른 접근TraceVLA는 시각적 추적(prompting) 기반의 공간-시간적 관계 reasoning을 통해 From Seeing to Doing과 유사하게 zero-shot 로봇 조작 일반화를 시도합니다.
다른 접근TraceVLA는 공간-시간적 행동 추론을 위한 비디오 기반 메모리 및 프롬프트 기법을 사용하여 MEM의 멀티스케일 메모리 아이디어와 네비게이션-조작 장기 문제를 다른 방법으로 풀었습니다.
후속 연구TraceVLA 논문은 visual trace와 action reasoning을 통한 spatial affordance 예측의 핵심 방법론을 RoboPoint에 적용할 수 있다.
후속 연구VLA-Cache 논문은 TraceVLA와 같이 VLA 토큰의 효율적 운용(재사용, 캐싱)을 통해 추론 효율화라는 같은 목표를 구체적으로 확장함.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드