V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning

저자: Mido Assran, Adrien Bardes, David Fan, Quentin Garrido, Russell Howes, , , Matthew Muckley, Ammar Rizvi, Claire Roberts, Koustuv Sinha, Artem Zholus, Sergio Arnaud, Abha Gejji, Ada Martin, Francois Robert Hogan, Daniel Dugas, Piotr Bojanowski, Vasil Khalidov, Patrick Labatut, Francisco Massa, Marc Szafraniec, Kapil Krishnakumar, Yong Li, Xiaodong Ma, Sarath Chandar, Franziska Meier, Yann LeCun, Michael Rabbat, Nicolas Ballas | 날짜: 2025-06-11 | URL: https://arxiv.org/abs/2506.09985 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 1

Figure 1 V-JEPA 2 Overview. Leveraging 1M hours of internet-scale video and 1M images, we pretrain the V-JEPA 2

V-JEPA 2는 1백만 시간 이상의 인터넷 규모 비디오로 사전학습한 자기지도학습 비디오 모델로, 비디오 이해·예측·로봇 계획을 모두 가능하게 한다.

Motivation

Achievement

Figure 1

Figure 1 V-JEPA 2 Overview. Leveraging 1M hours of internet-scale video and 1M images, we pretrain the V-JEPA 2

How

Figure 2

Figure 2 Multistage training. (Left) We first pretrain the V-JEPA 2 video encoder on internet-scale image and

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: V-JEPA 2는 인터넷 규모 자기지도학습과 최소한의 로봇 상호작용 데이터를 결합하여 비디오 이해, 예측, 실제 로봇 계획을 모두 달성한 획기적 연구로, 세계 모델 기반 일반 에이전트 개발의 새로운 방향을 제시한다.

같이 보면 좋은 논문

기반 연구MC-JEPA는 대규모 자기지도 영상 예측 프레임워크로, V-JEPA 2가 대규모 비디오 데이터로 이해와 계획을 학습하는 이론적 초석을 제공한다.
기반 연구V-JEPA 2는 대규모 3D/비디오 기반 self-supervised representation을 개발하여, 1517에서 제안된 3D world model과 연계된다.
다른 접근R3M: A Universal Visual Representation 논문은 영상 데이터로부터 로봇 조작에 강인한 visual representation을 제공하여, V-JEPA 2의 비디오 기반 예측 및 행동 연결과 다른 방식의 접목을 보여준다.
다른 접근Unified Video Action Model은 비디오 기반 행위 예측을 다루어 대규모 비디오 데이터 활용이라는 관점에서 V-JEPA 2의 자체지도 접근과 대조된다.
다른 접근SimpleVLA-RL은 강화학습 기반 VLA 훈련에 집중하는 반면, V-JEPA 2는 자체 지도 비디오 프리트레이닝을 통한 이해·예측에 중점을 두어 학습 방식과 범위 면에서 대조적이다.
후속 연구V-JEPA 2는 웹 규모 비디오로 VLA 모델을 self-supervised 방식으로 학습하는 아키텍처를 제공하여, GR-3와 유사한 대규모 co-training 전략의 기초가 됩니다.
응용 사례Foundation Model Driven Robotics 논문은 대규모 사전학습 비디오 모델을 실제 로봇 애플리케이션에 적용할 때의 과제를 실제 사례와 함께 폭넓게 다룬다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드