EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models

저자: Hu Yue, Siyuan Huang, Yue Liao, Shengcong Chen, Pengfei Zhou, Liliang Chen, Maoqing Yao, Guanghui Ren | 날짜: 2025-05-14 | URL: https://arxiv.org/abs/2505.09694 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 2

Figure 2: Overview of the EWMBENCH benchmark design. The framework begins with unified

본 논문은 Embodied World Models (EWMs)의 성능을 평가하기 위한 전문 벤치마크인 EWMBench를 제안하며, 시각적 장면 일관성, 동작 정확성, 의미론적 정렬이라는 세 가지 핵심 측면을 기반으로 로보틱 조작 작업에서의 물리적 타당성과 행동 일관성을 평가한다.

Motivation

Achievement

Figure 4

Figure 4: Evaluation Results of Video Generative Models.

How

Figure 2

Figure 2: Overview of the EWMBENCH benchmark design. The framework begins with unified

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 본 논문은 embodied AI 분야에서 그간 간과된 EWM 평가의 중요한 갭을 채우는 체계적이고 포괄적인 벤치마크를 제시하며, 실제 로봇 데이터 기반 데이터셋과 다차원 평가 메트릭을 통해 향후 embodied world model 개발에 실질적인 기여를 할 것으로 예상된다.

같이 보면 좋은 논문

기반 연구Structured World Models from Human Videos 논문은 scene consistency, motion accuracy 등 world model 평가 관점에서 EWMBench의 이론적 배경을 제공합니다.
기반 연구EnerVerse 논문은 4D Splatting 기반 world model의 효율성을 다루어, EWMBench의 세계 모델 평가 기준을 만드는 데 이론적 배경을 제공합니다.
다른 접근VLABench는 언어조건 로봇 정책의 대규모 벤치마크를 제시하여 EWMBench와 유사한 평가 목적을 가지면서도 평가 포커스와 프로토콜이 다릅니다.
다른 접근DreamDojo는 대규모 휴먼 비디오로 학습된 월드 모델 기반 벤치마크를 제시하여, EWMBench의 목적과 유사하지만 다른 데이터 소스로 접근합니다.
응용 사례Diffusion Models Are Real-Time Game Engines는 real-time 3D 환경의 시각·상태 일관성 평가가 중요한 점에서 EWMBench의 평가 항목과 실제 엔진 적용 관점에서 상호 연결됩니다.
응용 사례ManipBench는 저수준 매니퓰레이션에서 VLM을 평가하여, EWMBench에서 제안하는 embodied world model 평가에 실제 평가 시나리오를 제공합니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드