SimulCost: A Cost-Aware Benchmark and Toolkit for Automating Physics Simulations with LLMs

저자: Yadi Cao, Sicheng Lai, Jiahe Huang, Yang Zhang, Zach Lawrence, Rohan Bhakta, Izzy F. Thomas, Mingyun Cao, Chung-Hao Tsai, Zihao Zhou, Yidong Zhao, Hao Liu, Alessandro Marinoni, Alexey Arefiev, Rose Yu | 날짜: 2026 | URL: https://openreview.net/forum?id=ww57OvgpP9 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Overview of SIMULCOST. Our benchmark evaluates LLM agents on cost-sensitive parameter tuning across 13 physics

LLM 에이전트가 물리 시뮬레이션의 비용에 민감한 파라미터를 튜닝할 때 정확도뿐 아니라 계산 비용까지 함께 평가하는 최초의 벤치마크 SimulCost를 제안하고, 13개 시뮬레이터에 걸쳐 frontier LLM들을 전통적 스캐닝 및 베이지안 최적화와 비교 분석한다.

Motivation

Achievement

Figure 2

Figure 2. Overall performance across models, accuracy levels, and inference modes. SR = Single-Round, MR = Multi-Round;

  1. 최초의 비용 인식 벤치마크: 물리 시뮬레이션에서 성공률과 계산 비용을 동시에 측정하는 최초의 벤치마크를 구축함.
  2. 대규모 태스크셋 구성: 13개 시뮬레이터에 걸쳐 2,947개 단일 라운드와 1,931개 다중 라운드 과제를 확장 가능한 툴킷과 함께 제공함.
  3. 핵심 성능 발견: frontier LLM들이 단일 라운드에서 46-65%(고정확도 요구 시 35-55%)의 성공률을 보이고, 다중 라운드에서는 72-81%로 개선되지만 전통적 스캐닝보다 1.5-2.5배 느려 비경제적임을 규명함.
  4. 파라미터 그룹 상관성 및 in-context/reasoning effort 분석: 파라미터 간 지식 전이 가능성이 낮고, in-context 예시가 단일 라운드 성능은 향상시키지만 다중 라운드에서는 오히려 저해함을 발견함.

How

Figure 2

Figure 2. Overall performance across models, accuracy levels, and inference modes. SR = Single-Round, MR = Multi-Round;

Originality

Limitation & Further Study

Evaluation

Novelty: 5/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 비용 인식이라는 중요하지만 간과되어 온 차원을 물리 시뮬레이션 LLM 에이전트 평가에 체계적으로 도입한 견고하고 실용적인 벤치마크 연구로, 향후 비용 효율적 과학 에이전트 설계 연구에 중요한 기반을 제공할 것으로 기대된다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92 기준으로 'SimulCost: A Cost-Aware Benchmark and Toolkit for Automating Physics Simulations with LLMs'의 AI4S 방법론을 'Self-Driving Laboratories for Chemistry and Materials Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'LLM-based Multi-Agent Copilot for Quantum Sensor'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구극한 산업 환경에서의 실시간 검출 응용이라는 유사한 문제 설정을 공유한다.
기반 연구물리적 경계 조건을 만족하는 PDE 대리 모델 설계를 확장한다.
기반 연구basin-hopping과 LLM 결합 방법을 확장한 연구이다.
다른 접근LLM 에이전트를 물리 시뮬레이션 파라미터 튜닝에 활용하는 유사한 벤치마크 구축 방법론이다
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 LLMs for Molecular Biology & Chemistry가 맞닿아, 'Automating Computational Chemistry Workflows via OpenClaw and Domain-Specific Skills'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Bridging decision-making engines and workflow design in self-driving laboratories: A NIMO-IvoryOS integration study'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 AI-Driven Drug and Materials Discovery가 맞닿아, 'MatClaw: An Autonomous Code-First LLM Agent for End-to-End Materials Exploration'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근비용 인지적 벤치마크 설계라는 동일한 문제의식을 공유한다
다른 접근동일한 연합학습 기반 과학 데이터 처리 문제를 다른 접근법으로 다루는 연구
후속 연구이질적 물리 도메인 통합 학습의 이론적 기반이 된다.
후속 연구CAD 생성 평가 체계의 기초 프레임워크 제공
후속 연구hand-tuned 커널 대비 AI 생성 커널 평가의 방법론적 기초를 제공한다.
후속 연구플라즈마 제어 시뮬레이션의 기초적 방법론을 제공한다.
응용 사례비용 인지형 최적화 기법을 실제 시뮬레이터에 적용한 유사 응용 사례이다.
반론/비판코드 실행/기억 대신 순수 추론 여부를 검증한다는 대비되는 관점을 제시한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드