저자: Yadi Cao, Sicheng Lai, Jiahe Huang, Yang Zhang, Zach Lawrence, Rohan Bhakta, Izzy F. Thomas, Mingyun Cao, Chung-Hao Tsai, Zihao Zhou, Yidong Zhao, Hao Liu, Alessandro Marinoni, Alexey Arefiev, Rose Yu | 날짜: 2026 | URL: https://openreview.net/forum?id=ww57OvgpP9 📄 PDF
Essence
Figure 1. Overview of SIMULCOST. Our benchmark evaluates LLM agents on cost-sensitive parameter tuning across 13 physics
LLM 에이전트가 물리 시뮬레이션의 비용에 민감한 파라미터를 튜닝할 때 정확도뿐 아니라 계산 비용까지 함께 평가하는 최초의 벤치마크 SimulCost를 제안하고, 13개 시뮬레이터에 걸쳐 frontier LLM들을 전통적 스캐닝 및 베이지안 최적화와 비교 분석한다.
Evaluation
Novelty: 5/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: 비용 인식이라는 중요하지만 간과되어 온 차원을 물리 시뮬레이션 LLM 에이전트 평가에 체계적으로 도입한 견고하고 실용적인 벤치마크 연구로, 향후 비용 효율적 과학 에이전트 설계 연구에 중요한 기반을 제공할 것으로 기대된다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.92 기준으로 'SimulCost: A Cost-Aware Benchmark and Toolkit for Automating Physics Simulations with LLMs'의 AI4S 방법론을 'Self-Driving Laboratories for Chemistry and Materials Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'LLM-based Multi-Agent Copilot for Quantum Sensor'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구극한 산업 환경에서의 실시간 검출 응용이라는 유사한 문제 설정을 공유한다.
기반 연구물리적 경계 조건을 만족하는 PDE 대리 모델 설계를 확장한다.
기반 연구basin-hopping과 LLM 결합 방법을 확장한 연구이다.
다른 접근LLM 에이전트를 물리 시뮬레이션 파라미터 튜닝에 활용하는 유사한 벤치마크 구축 방법론이다
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 LLMs for Molecular Biology & Chemistry가 맞닿아, 'Automating Computational Chemistry Workflows via OpenClaw and Domain-Specific Skills'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Bridging decision-making engines and workflow design in self-driving laboratories: A NIMO-IvoryOS integration study'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 AI-Driven Drug and Materials Discovery가 맞닿아, 'MatClaw: An Autonomous Code-First LLM Agent for End-to-End Materials Exploration'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근비용 인지적 벤치마크 설계라는 동일한 문제의식을 공유한다
다른 접근동일한 연합학습 기반 과학 데이터 처리 문제를 다른 접근법으로 다루는 연구
후속 연구이질적 물리 도메인 통합 학습의 이론적 기반이 된다.
후속 연구CAD 생성 평가 체계의 기초 프레임워크 제공
후속 연구hand-tuned 커널 대비 AI 생성 커널 평가의 방법론적 기초를 제공한다.
후속 연구플라즈마 제어 시뮬레이션의 기초적 방법론을 제공한다.
응용 사례비용 인지형 최적화 기법을 실제 시뮬레이터에 적용한 유사 응용 사례이다.
반론/비판코드 실행/기억 대신 순수 추론 여부를 검증한다는 대비되는 관점을 제시한다.