PhysMent: An Interactive Approach For LLM Reasoning In Physics Problems

저자: Joseph Chan, Utkarsh Jha, Xiyin Yang, Abhinav Jarajapu, Anik Sahai, Eddie Hu, Robin Jeshua Deepak, Stefano Saravalle, Aditya Shah | 날짜: 2026 | URL: https://openreview.net/forum?id=D6PzVeGKhe 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Accuracy vs. iteration budget Imax across the four major scene categories. Models show three distinct patterns

PhysMent는 LLM의 물리적 추론 능력을 MuJoCo 물리 시뮬레이터와의 반복적·도구 매개 상호작용을 통해 평가하는 벤치마크로, 정적 문제풀이가 아니라 능동적 실험 설계 능력을 측정한다.

Motivation

Achievement

Figure 1

Figure 1. Accuracy vs. iteration budget Imax across the four major scene categories. Models show three distinct patterns

  1. 최초의 다중 턴 실험형 물리 벤치마크: Mind's Eye의 단발성 oracle 호출이나 PHYRE의 non-LLM 퍼즐 에이전트와 달리, 3D rigid-body 시뮬레이터와의 지속적인 다중 턴 실험적 대화를 통해 LLM을 평가하는 최초의 벤치마크를 구축했다.
  2. 105개 장면 및 13개 난이도-모달리티 카테고리 설계: Easy/Hard × Single/Multi의 4개 난이도 체제, 3개 장면 모달리티(standard, object creation, hidden objects), scene-manipulation 카테고리를 포함해 학부 수준 고전역학의 핵심 주제를 폭넓게 다룬다.
  3. 6차원 채점 프레임워크 정의: 이진 정확도를 넘어 실험 전략의 질을 진단할 수 있는 6차원 스코어링 체계를 제시했다.
  4. 프론티어 모델 대상 베이스라인 확립: 7개 모델, 다양한 프롬프팅 전략에 걸쳐 결과를 비교해 정량적·다단계 물리 추론에서의 체계적 실패 양상(조기 답변 제출, 비효율적 탐색, 시뮬레이터 피드백에 대한 grounding 불일치)을 노출했다.

How

Figure 1

Figure 1. Accuracy vs. iteration budget Imax across the four major scene categories. Models show three distinct patterns

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 정적 문제풀이를 넘어 능동적 실험 설계라는 중요하지만 저평가된 LLM 능력을 체계적으로 조명한 시의적절하고 잘 설계된 벤치마크이나, 본문 발췌만으로는 실험 세부사항과 결과 분석의 완전성을 판단하기 어렵다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Scientific Information Extraction and QA가 맞닿아, 'Pelican: Correcting Hallucination in Vision-LLMs via Claim Decomposition and Program of Thought Verification'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 AI-Driven Drug and Materials Discovery가 맞닿아, 'SciCode: A Research Coding Benchmark Curated by Scientists'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Scaling physical reasoning with the physics dataset'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구지각과 계산 분리 아이디어를 확장한 후속 연구로 판단됨
다른 접근물리 시뮬레이터와 LLM의 상호작용을 평가하는 유사한 벤치마크 설계이다.
기반 연구앙상블 기반 후보 답안 생성을 확장한 연구
기반 연구자연어 지시 기반 물리 구조물 생성의 실제 응용
기반 연구rollout diversity 문제를 확장하여 다루는 후속 연구로 추정된다.
기반 연구GeoGebra류 엔진을 활용한 기하 추론을 실제 문제에 적용한다.
기반 연구기존 spatial reasoning 데이터셋을 통합·확장하는 유사 접근
다른 접근능동적 실험 설계를 통한 LLM 평가 방법론을 공유한다.
다른 접근LLM의 물리적 추론 능력을 평가하는 다른 벤치마크를 제시한다.
후속 연구2D MLLM을 3D 데이터에 적용하는 방법론적 기초를 제공함
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드