From Kepler to Newton: Inductive Biases Guide Learned World Models in Transformers

저자: Ziming Liu, Surya Ganguli, Andreas S. Tolias | 날짜: 2026 | URL: https://openreview.net/forum?id=ij3UfXzgYp 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Visual abstract. Top left: The problem setup of Vafa et al. (2025): planetary motion prediction is formulated

본 논문은 transformer가 행성 운동 데이터를 학습할 때 뉴턴 세계 모델을 습득하지 못하는 원인을 규명하고, spatial smoothness, spatial stability, temporal locality라는 세 가지 최소한의 inductive bias를 도입함으로써 GPT-2 규모의 transformer가 Kepler적 곡선 맞춤(curve-fitting) 모델을 넘어 실제 Newtonian force 기반 세계 모델을 학습할 수 있음을 보인다.

Motivation

Achievement

Figure 1

Figure 1. Visual abstract. Top left: The problem setup of Vafa et al. (2025): planetary motion prediction is formulated

  1. Spatial smoothness 문제 규명: 기존 tokenization 방식이 물리적으로 가까운 점들을 embedding 공간에서 멀리 떨어뜨려(포인트 클라우드가 4분면으로 분절되는 등) spatial map 형성을 방해함을 실증적으로 보였다 (Figure 2, 3).
  2. Regression 기반 해법: classification 대신 continuous regression으로 문제를 재정의하여 spatial smoothness를 보장하고, noisy context learning으로 error accumulation 문제를 해결해 모든 데이터 규모에서 classification을 능가하는 성능을 달성했다 (Figure 4, 5).
  3. Temporal locality의 발견적 역할: context length를 짧게 제한하면 transformer가 Newtonian force representation(가속도, 힘)을 학습하고, context length가 길면 Kepler적 타원 맞춤(LRL vector 등 기하학적 파라미터)에 의존하는 모델을 학습한다는 것을 규명했다 (Figure 1).
  4. 일반적 함의 도출: 물리 법칙 자체에 대한 구체적 지식 없이도, 단순하고 일반적인 inductive bias만으로 올바른 특정 세계 모델을 유도할 수 있음을 보여, 아키텍처 설계가 curve-fitter와 physicist를 가르는 결정적 요인임을 입증했다.

How

Figure 4

Figure 4. Error accumulation and fixing it by adding context noise in training. Each subplot shows the ground truth traj

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: Vafa et al.의 유명한 실패 사례를 체계적으로 진단하고 최소한의 구조적 개입만으로 해결한 명료하고 통찰력 있는 연구로, AI 기반 과학적 발견 분야에 실질적인 기여를 한다. 다만 단순한 물리계에 국한된 검증이라는 점에서 일반화 가능성에 대한 추가 검토가 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.91로 Scientific Machine Learning for Dynamics와 Scientific AI for Physics and Environment가 맞닿아, 'Physics Informed Deep Learning (Part I): Data-driven Solutions of Nonlinear Partial Differential Equations'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 Scientific Machine Learning for Dynamics와 Scientific AI for Physics and Environment가 맞닿아, 'Neural Ordinary Differential Equations'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 Scientific Machine Learning for Dynamics와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구world model 학습의 inductive bias에 대한 이론적 기반을 공유함
기반 연구spatial-temporal inductive bias의 이론적 기반을 제공한다.
기반 연구예측 정확도와 내부 표현 간 괴리 현상 분석을 확장한다.
후속 연구spatial/temporal locality 관련 inductive bias 연구를 확장함
다른 접근transformer의 학습 실패 원인 규명이라는 유사 문제를 다른 도메인에서 다룸
후속 연구inductive bias 개념을 다른 물리 시스템 학습으로 확장한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드