Sim2Reason: Solving Physics Olympiad via Reinforcement Learning on Physics Simulators

저자: Mihir Prabhudesai, Aryan Satpathy, Yangmin Li, Zheyang Qin, Nikash Bhardwaj, Amir Zadeh, Chuan Li, Katerina Fragkiadaki, Deepak Pathak | 날짜: 2026 | URL: https://openreview.net/forum?id=rQ7eobSCZZ 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 2

Figure 2. Overview of the SIM2REASON (Sim2Reason) pipeline. From left to right: we procedurally generate diverse physics

물리 시뮬레이터(MuJoCo)로 절차적으로 생성한 장면과 그 물리적 상호작용으로부터 합성 QA 데이터를 만들고, 이를 RLVR(강화학습)로 LLM 학습에 활용하여 실제 물리 올림피아드(IPhO) 등 벤치마크에서 zero-shot sim-to-real 전이 성능을 향상시킨다.

Motivation

Achievement

Figure 1

Figure 1. We present SIM2REASON: a method for turning physics simulators into scalable generators of question–answer pai

  1. Zero-shot sim-to-real 전이 입증: 합성 시뮬레이션 데이터만으로 학습했음에도 IPhO(International Physics Olympiad) 문제에서 3B~32B 규모 모델 전반에 걸쳐 5–10 퍼센트포인트의 성능 향상을 달성했다.
  2. 다양한 실제 벤치마크에서의 일관된 개선: JEE-Bench(32B 모델 기준 +17.9%), PHYSICS, OlympiadBench 등 여러 벤치마크에서 일관된 성능 향상을 확인하여 단순 암기가 아닌 일반화된 물리 추론 능력 습득을 입증했다.
  3. 자동화된 벤치마킹 도구로서의 가치 발견: 자체 생성 QA에서의 모델 정확도와 실제 물리 벤치마크 성능 간 높은 상관관계를 발견하여, 특정 물리 영역에 대한 확장 가능하고 자동화된 모델 평가 도구로 활용 가능함을 보였다.

How

Figure 3

Figure 3. Overview of our synthetic data-generation pipeline. We procedurally generate simulatable scenes by randomly se

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 4/5

총평: 인터넷 QA 데이터의 도메인 편중과 규모 한계를 물리 시뮬레이터 기반 합성 데이터로 극복하려는 시도로, 실질적인 sim-to-real 전이 성능 향상을 여러 벤치마크에서 입증한 인상적인 연구이다. 다만 시뮬레이터가 다루는 물리 현상의 범위에 여전히 의존적이라는 근본적 한계가 남아 있어 향후 더 폭넓은 도메인으로의 확장이 중요한 과제가 될 것이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구OCR 기반 시각 증거 강화의 실제 응용 사례
다른 접근합성 QA 데이터를 활용한 강화학습 기반 LLM 훈련이라는 유사한 방법론.
기반 연구Newtonian mechanics 평가 프레임워크를 실제 물리 현상 데이터셋에 적용한 사례로 볼 수 있다.
다른 접근물리 추론 벤치마크에서 LLM 성능 향상을 다루는 application 관계이다
다른 접근sim-to-real 전이를 위한 RLVR 학습 프레임워크라는 점에서 foundation 관계이다
다른 접근물리 시뮬레이션 데이터를 활용한 RL 기반 LLM 학습이라는 유사한 접근.
후속 연구curriculum RL과 agentic augmentation 기법의 기반이 되는 연구로 판단됨
다른 접근sim-to-real 전이를 통한 물리 추론 능력 향상이라는 공통 목표를 공유.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드