Can Vision Language Models Learn Intuitive Physics from Interaction?

저자: Luca M. Schulze Buschoff, Konstantinos Voudouris, Can Demircan, Eric Schulz | 날짜: 2026 | URL: https://openreview.net/forum?id=sfVahQ4EWP 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 2

Figure 2. Performance by test task and training task for Qwen3-VL-8B. Rows show models evaluated on a given task. Column

Vision language model이 시뮬레이션 환경과의 interaction(강화학습, GRPO)을 통해 학습하더라도, supervised fine-tuning(SFT)과 마찬가지로 일반화 가능한 intuitive physics 직관을 습득하지 못한다는 것을 보인 연구이다. 훈련된 과제 내 성능은 향상되지만 관련된 다른 물리 과제로의 전이는 실패한다.

Motivation

Achievement

Figure 3

Figure 3. Qwen3-VL-8B trained on all four conditions and evaluated on the real images of block towers from Lerer et al.

  1. 훈련 과제 내 ceiling 성능: interactive와 non-interactive 조건 모두 훈련된 과제에서는 거의 완벽한(ceiling) 성능을 달성했다.
  2. 일반화 실패: 두 방법 모두 훈련되지 않은 관련 물리 과제(시각적 통계 및 물리 원리를 공유하더라도)로는 신뢰성 있게 일반화되지 않았으며, interaction 여부와 무관하게 이 결과가 일관되게 나타났다.
  3. 실제 이미지 일반화 실패: Lerer et al. (2016)의 실제 나무 블록 탑 이미지 데이터셋에 대한 평가에서도 훈련된 모델들이 일관된 일반화 성능을 보이지 못했다.
  4. 경쟁력(competence) vs 수행(performance) 괴리: 활성화(activation)로부터 tower stability와 같은 물리량은 layer-wise decoding을 통해 높은 정확도로 디코딩 가능했으나, 이러한 내부 표상이 실제 텍스트 출력 성능으로 전환되지 않았다.

How

Figure 1

Figure 1. Overview of all combinations of datasets and action types. Datasets: We train models on two related datasets,

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: Interaction 기반 강화학습이 VLM의 일반화 가능한 intuitive physics 학습에 만능 해법이 아님을 보이는 실증적으로 탄탄하고 흥미로운 부정적 결과 연구로, 향후 embodied learning과 VLM 물리적 추론 연구에 중요한 경종을 울리는 기여이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 Statistical Causal Inference Methods와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Can foundation models actively gather information in interactive environments to test hypotheses? arXiv preprint arXiv:2412.06438, 2024.'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근모델의 대화형 탐색 능력을 다른 벤치마크로 평가한다.
기반 연구SPECTER2 유사도 0.92로 Statistical Causal Inference Methods와 Scientific Information Extraction and QA가 맞닿아, 'MMSCI: A dataset for graduate-level multi-discipline multimodal scientific understanding'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91 기준으로 'Can Vision Language Models Learn Intuitive Physics from Interaction?'의 AI4S 방법론을 'Towards uncovering how large language model works: An explainability perspective'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구SPECTER2 유사도 0.91로 Statistical Causal Inference Methods와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'OmniScientist: Toward a Co-evolving Ecosystem of Human and AI Scientists'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구AI 모델과 뇌 표현 간 정렬 연구를 대규모 CKA 분석으로 확장한다.
후속 연구VLM의 intuitive physics 학습 한계를 확장 분석하는 연구이다
기반 연구AI-brain alignment 분석을 확장한 후속 연구이다.
다른 접근AI 평가를 위한 통계적 신뢰구간 추정이라는 유사 목표를 다룬다.
다른 접근temporal order judgment 재현에 대한 다른 접근을 제시한다.
다른 접근VLM의 물리적 직관 학습 능력을 평가하는 유사한 실험 설계이다
후속 연구물리적 상태 변수 추출과 인간 직관 정렬의 이론적 기반을 공유한다.
후속 연구foundation model의 다운스트림 성능 분석에 필요한 이론적 배경을 제공한다.
후속 연구모델 비교의 정밀도를 높이는 통계적 방법론이 관련 실험 설계의 기초가 된다
반론/비판모델 학습 방식(SFT vs RL)의 한계를 다루는 대조적 관점을 제공함
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드