World Simulation with Video Foundation Models for Physical AI

저자: , , Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Elizabeth Cha, Yu-Wei Chao, Prithvijit Chattopadhyay, Mike Chen, Yongxin Chen, Yu Chen, Shuai Cheng, Yin Cui, Jenna Diamond, Yifan Ding, Jiaojiao Fan, Linxi Fan, Liang Feng, Francesco Ferroni, Sanja Fidler, Xiao Fu, Ruiyuan Gao, Yunhao Ge, Jinwei Gu, Aryaman Gupta, Siddharth Gururani, Imad El Hanafi, Ali Hassani, Zekun Hao, Jacob Huffman, Joel Jang, Pooya Jannaty, Jan Kautz, Grace Lam, Xuan Li, Zhaoshuo Li, Maosheng Liao, Chen-Hsuan Lin, Tsung-Yi Lin, Yen-Chen Lin, Huan Ling, Ming-Yu Liu, Xian Liu, Yifan Lu, Alice Luo, Qianli Ma, Hanzi Mao, Kaichun Mo, Seungjun Nah, Yashraj Narang, Abhijeet Panaskar, Lindsey Pavao, Trung Pham, Morteza Ramezanali, Fitsum Reda, Scott Reed, Xuanchi Ren, Haonan Shao, Yue Shen, Stella Shi, Shuran Song, Bartosz Stefaniak, Shangkun Sun, Shitao Tang, Sameena Tasmeen, Lyne Tchapmi, Wei-Cheng Tseng, Jibin Varghese, Andrew Z. Wang, Hao Wang, Haoxiang Wang, Heng Wang, Ting-Chun Wang, Fangyin Wei, Jiashu Xu, Dinghao Yang, Xiaodong Yang, Haotian Ye, Seonghyeon Ye, Xiaohui Zeng, Jing Zhang, Qinsheng Zhang, Kaiwen Zheng, Andrew Zhu, Yuke Zhu | 날짜: 2025-10-28 | URL: https://arxiv.org/abs/2511.00062 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 2

Figure 2: Overall architecture of [Cosmos-Predict2.5]. As shown on the right, in the latent space, the model

Cosmos-Predict2.5는 flow-based architecture 기반의 세계 시뮬레이션 기초 모델로, Text2World, Image2World, Video2World 생성을 단일 모델에 통합하여 로보틱스와 자율주행 시스템을 위한 합성 데이터 생성과 폐루프 시뮬레이션을 가능하게 한다.

Motivation

Achievement

How

Figure 1

Figure 1: Our video curation pipeline transforms raw, unstructured video data from diverse real-world sources

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 본 논문은 Physical AI 시뮬레이션을 위한 통합된 flow-based 기초 모델을 제시하며, 대규모 데이터, 개선된 아키텍처, 정교한 post-training을 통해 실질적인 성능 향상을 달성했다. 오픈소스 공개로 embodied intelligence 연구의 접근성을 크게 높일 것으로 예상된다.

같이 보면 좋은 논문

기반 연구비디오 foundation model을 이용한 세계 시뮬레이션과 DreamDojo의 인간 비디오 학습이 결합되어 더 포괄적인 물리적 AI 시스템을 구축할 수 있습니다.
다른 접근A3VLM 논문은 비슷하게 3D 장면 및 동작 모델링을 다루지만, action articulation-aware 특성을 강조하며 Cosmos-Predict2.5의 flow-based 세계 생성과 차별점이 있다.
다른 접근Cosmos-Predict2.5 또한 세계 시뮬레이션을 통해 다양한 물리 AI 과제에 접근하는 대안적 프레임워크를 제안합니다.
후속 연구WHALE 프레임워크도 world model+policy 기반 데이터 합성 및 시뮬레이션을 시도하므로, Cosmos-Predict2.5 개념의 응용 확장에 해당합니다.
다른 접근Genie Envisioner(1406)는 시각 기반 생성/시뮬레이션 환경 통합을 다루는 반면, 1632는 flow 기반 세계 시뮬레이션 및 합성 데이터 생성에 치중한다.
후속 연구Data Scaling Laws in Imitation Learning(1348)은 합성 데이터 규모가 로봇 정책의 일반화에 미치는 영향을 개량적으로 분석하여 1632의 합성 시뮬레이션 프레임워크의 데이터 확장 전략의 타당성을 검증할 수 있다.
후속 연구PointWorld 논문은 3D Point Cloud 기반 대규모 world model 학습 및 시뮬레이션을 다루며, Cosmos-Predict2.5와 연계해 실제 로봇 데이터 생성을 한층 확장한다.
응용 사례MP5 논문은 복잡한 open-ended 환경(Minecraft)에서 Cosmos-Predict2.5와 유사한 통합 world simulation 방식을 적용합니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드