SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models

저자: Andong Deng, Taojiannan Yang, Shoubin Yu, Lincoln Spencer, Mohit Bansal, Chen Chen, Serena Yeung-Levy, Xiaohan Wang | 날짜: 2026 | URL: https://openreview.net/forum?id=tQaBS1vS3N 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. SCIVIDEOBENCH features research-level experimental videos accompanied by challenging questions that rigorously

SciVideoBench는 연구 수준(research-level)의 과학 실험 비디오에 대한 고난도 추론 능력을 평가하기 위한 새로운 비디오 벤치마크로, 25개 이상의 전문 학문 분야에서 수집된 실험 영상을 기반으로 1,000개의 정교한 multiple-choice 질문을 구성하였다.

Motivation

Achievement

Figure 5

Figure 5. Chain-of-thought performance gains across proprietary and open-source models. Proprietary models exhibit consi

  1. 연구 수준 벤치마크 구축: 25개 이상의 전문 학문 분야를 아우르는 241개의 peer-reviewed 실험 비디오로부터 1,000개의 정교한 QA 쌍을 구축하여, 기존 college-level 벤치마크와 차별화되는 research-level 난이도를 달성했다.
  2. 최신 LMM들의 성능 부족 확인: Gemini 2.5 Pro, Qwen2.5-VL을 포함한 최신 proprietary 및 open-source LMM들이 SciVideoBench에서 일관되게 낮은 정확도를 보여 상당한 개선 여지가 있음을 실증했다.
  3. 핵심 요인 분석 제공: reasoning complexity, visual grounding, model architecture 등 성능에 영향을 미치는 요인에 대한 심층 분석을 통해 향후 LMM 개발 방향에 대한 통찰을 제공했다.

How

Figure 2

Figure 2. Overview of our annotation pipeline. We manually annotate example QA pairs, and then a multi-agent LLM system

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: SciVideoBench는 기존 비디오 벤치마크의 포화 문제를 지적하며 연구 수준의 과학적 추론을 요구하는 새로운 벤치마크를 제안한 의미 있는 연구로, 향후 멀티모달 AI co-scientist 개발에 중요한 이정표가 될 수 있다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 Clinical Time-Series Modeling와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Gemini: a family of highly capable multimodal models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Clinical Time-Series Modeling와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'GPT-4o System Card'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구비디오 기반 멀티모달 추론 평가의 기초 제공
다른 접근특정 소외 인구를 위한 멀티모달 VQA 데이터셋 구축이라는 유사한 목표를 다른 대상 집단으로 다룬다.
다른 접근과학 비디오 추론을 다른 도메인 비디오 벤치마크로 접근
후속 연구차트 이미지 이해를 위한 멀티모달 학습의 기반 기술
후속 연구실험 영상 이해 벤치마크를 확장한 후속 연구
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드