Evaluating Newtonian Mechanics in Video Generative Models with Real Physical Systems
저자: Antonios Tragoudaras, Chenyu Zhang, Daniil Cherniavskii, Antonios Vozikis, Thijmen Nijdam, Derck W. E. Prinzhorn, Mark Bodracska, Nicu Sebe, Andrii Zadaianchuk, Stratis Gavves | 날짜: 2026 | URL: https://openreview.net/forum?id=f4xAzcMug6📄 PDF
⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
Morpheus는 130개의 실제 물리 현상 영상을 기반으로 video generative models(VGMs)가 Newtonian dynamics를 얼마나 잘 이해하는지 평가하는 physics-informed 프레임워크로, conservation law와 physics-informed neural network 기반의 해석 가능한 지표를 통해 물리적 타당성을 정량화한다.
Motivation
Known: 기존 VGM 평가는 EvalCrafter, VBench, AIGCBench 등 시각적 충실도·시간적 일관성·프롬프트 정합성을 측정하는 지표에 집중해왔으며, 물리적 타당성 평가는 human judgment나 VLM 기반 subjective assessment, 혹은 trajectory matching·object tracking 기반 방법(VideoCon-Physics, PhyGenBench, PhysBench, VAMP, Physics-IQ)에 의존해왔다.
Gap: 기존 방법들은 subjective하거나 trajectory matching에 의존하여 다수의 물리적으로 타당한 생성물이 존재하는 상황(예: projectile motion의 다양한 parabola)에서 물리 법칙 위반을 제대로 판별하지 못하며, mass·inertia·force coupling 같은 관측 불가능한 물리 제약을 검증할 수 없다는 근본적 한계가 있다.
Why: VGM이 로보틱스, 자율주행, 과학 시뮬레이션 등에서 world model로 활용되려면 단순히 시각적으로 그럴듯한 것을 넘어 실제 physical invariants(에너지, 운동량 보존 등)를 준수해야 하므로, 이를 엄밀하고 정량적으로 검증하는 평가 체계가 embodied AI 신뢰성 확보에 필수적이다.
Approach: Newtonian rigid-body 시스템에 국한하여 실제 촬영된 130개 영상을 conditioning으로 사용해 VGM이 생성한 영상의 물체 궤적을 추출하고, physics-informed neural network와 vision-language foundation model을 활용해 governing ODE 및 conservation law 대비 해석 가능한 지표로 물리적 타당성을 평가한다.
Achievement
Morpheus 프레임워크 제안: conservation law에 기반한 해석 가능한 물리 지표 suite를 통해 VGM의 physical reasoning을 체계적으로 평가하는 최초의 physics-informed 평가 프레임워크 중 하나를 제시.
130개 실제 물리 영상 데이터셋 구축: 다양한 Newtonian rigid-body 현상을 포착한 real-world video 데이터를 curation하여 controlled initial condition으로 사용.
SOTA VGM 대규모 벤치마킹: Veo3, Kling 같은 closed-source 모델과 Wan2.1, COSMOS, CogVideoX, PyramidalFlow, LTX-Video 등 open-source 모델을 대상으로 물리 법칙 준수 여부를 정량 평가.
핵심 발견: 고급 프롬프팅과 video conditioning을 사용해도 현대 VGM들은 시각적으로는 미려한 영상을 생성하지만 물리 법칙을 일관되게 인코딩하지 못함을 실증.
How
실제 촬영 영상에 대해 object mask 기반 realistic style transfer로 augmentation 수행.
augmentation된 영상의 첫 프레임(혹은 video conditioning 시 다중 프레임)과 텍스트 설명을 프롬프트로 사용해 VGM으로 영상 생성.
생성된 영상과 실제 영상 모두에서 trajectory extraction pipeline(tracking + depth 기반 unreliable trajectory discarding: 객체 존재 여부, 움직임 여부, 고유성 여부 판별)을 통해 물체 궤적 추출.
기존의 subjective(human/VLM) 평가나 trajectory matching 기반 평가와 달리, conservation law라는 "infallible"한 물리적 기준을 활용해 다수의 물리적으로 타당한 생성물이 존재하는 상황에서도 엄밀한 판별이 가능하도록 설계.
physics-informed neural network를 fully observable scientific data가 아닌 noisy video 데이터에서 latent physical state 추정에 재활용(repurpose)한 점이 독창적.
Newtonian rigid-body로 범위를 제한하여 결정론적이고 정량 검증 가능한 물리 시스템에 집중함으로써 fluid dynamics나 electromagnetics 같은 chaotic system 대비 실현 가능한 평가 체계를 구축.
Limitation & Further Study
Newtonian rigid-body 설정에 국한되어 fluid dynamics, thermodynamics, electromagnetics, optics 등 더 복잡한 비선형/카오스적 물리 현상으로의 일반화는 다루지 않음.
130개라는 비교적 제한된 real-world video 규모로 인해 다양한 물리 시나리오나 edge case에 대한 커버리지가 부족할 수 있음.
trajectory extraction 과정에서 depth estimation, tracking, discarding 등 여러 단계의 파이프라인 오차가 누적되어 최종 Morpheus Score의 신뢰도에 영향을 줄 가능성이 있으며, 이에 대한 오차 분석이 본문 발췌만으로는 명확히 드러나지 않음.
후속 연구로 non-rigid body, 유체나 변형 가능한 물체 등으로 프레임워크 확장이 필요.
총평: VGM의 physical plausibility를 conservation law 기반의 정량적이고 해석 가능한 지표로 평가한다는 점에서 기존의 주관적·궤적매칭 기반 평가의 한계를 잘 극복한 의미 있는 연구이며, 향후 embodied AI 및 world model 평가의 표준화에 기여할 잠재력이 크다.
기반 연구SPECTER2 유사도 0.90로 Computational Molecular Design와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Evaluation of openai o1: Opportunities and challenges of agi'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.90로 Computational Molecular Design와 Scientific Information Extraction and QA가 맞닿아, 'Scimage: How good are multimodal large language models at scientific text-to-image generation? arXiv preprint arXiv:2412.02368, 2024.'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.