Essence
Figure 1. Feynman 문제와 LLM-SRBench 데이터셋(LSR-Transform, LSR-Synth)에서 단순 LLM 샘플링(Llama-3.1-8B)의 오차 분석. Feynman 문제에서 수치 오차 곡선의 급격한 하강과 낮은 기호 오차는 실제 발견보다 암기를 시사함.
본 논문은 대규모 언어 모델(LLM) 기반 과학 방정식 발견의 진정한 능력을 평가하기 위해 암기를 방지하는 종합적 벤치마크 LLM-SRBench를 제안한다. 4개 과학 분야에서 239개 도전 문제로 구성되어 있으며, 최고 성능 모델도 31.5% 기호 정확도에 불과함을 보여준다.
Evaluation
Novelty: 4.5/5 Technical Soundness: 4.5/5 Significance: 4.5/5 Clarity: 4/5 Overall: 4.4/5
총평: LLM-SRBench는 과학 방정식 발견 분야에서 실질적 필요에 응하는 도전적이고 엄격한 벤치마크를 제공하며, 암기 방지 설계와 다중 도메인 커버리지가 장점이나, 합성 문제 생성의 자동화 및 기존 SR 방법과의 비교 확대가 후속 개선 과제이다.
같이 보면 좋은 논문
기반 연구LLM 기반 과학 방정식 발견 방법론의 기반이 되는 연구로 벤치마크 설계에 참조되었을 가능성이 높다.
다른 접근LLM을 활용한 과학적 발견이라는 유사한 목표를 다른 접근법으로 다룬다.
기반 연구기호 회귀 기반 방정식 발견의 기초 평가 방법론을 제공한다.
기반 연구LLM-Feynman의 발견 능력을 평가하기 위한 벤치마크로 활용될 수 있다.
기반 연구LLM-ODE의 성능을 평가하기 위한 벤치마크로 사용될 수 있다.
다른 접근미분방정식 발견을 위한 다른 대칭성 활용 접근법을 제시한다.
다른 접근미분방정식의 해석적 해를 구하는 문제에 대해 다른 neuro-symbolic 접근을 제시한다.
다른 접근과학 방정식 발견 성능 평가라는 동일 문제를 다루는 대안적 벤치마크 또는 방법론이다.
후속 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'LLM-SRBench: A New Benchmark for Scientific Equation Discovery with Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근과학적 방정식 발견을 위한 다른 벤치마킹 접근법을 제시한다.
후속 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 Formal Methods and Computational Reasoning가 맞닿아, 'LLM-SRBench: A New Benchmark for Scientific Equation Discovery with Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'LLM-SRBench: A New Benchmark for Scientific Equation Discovery with Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.89로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'LLM-SRBench: A New Benchmark for Scientific Equation Discovery with Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.90로 Scientific Machine Learning for Dynamics와 Formal Methods and Computational Reasoning가 맞닿아, 'LLM-SRBench: A New Benchmark for Scientific Equation Discovery with Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구올림피아드 수준 기하 문제 평가의 기초를 제공한다.
후속 연구SPECTER2 유사도 0.92로 Computational Molecular Design와 Formal Methods and Computational Reasoning가 맞닿아, 'LLM-SRBench: A New Benchmark for Scientific Equation Discovery with Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.90로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'LLM-SRBench: A New Benchmark for Scientific Equation Discovery with Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 Computational Molecular Design와 Formal Methods and Computational Reasoning가 맞닿아, 'LLM-SRBench: A New Benchmark for Scientific Equation Discovery with Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'LLM-SRBench: A New Benchmark for Scientific Equation Discovery with Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 Computational Molecular Design와 Formal Methods and Computational Reasoning가 맞닿아, 'LLM-SRBench: A New Benchmark for Scientific Equation Discovery with Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 Computational Molecular Design와 Formal Methods and Computational Reasoning가 맞닿아, 'LLM-SRBench: A New Benchmark for Scientific Equation Discovery with Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'LLM-SRBench: A New Benchmark for Scientific Equation Discovery with Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구기존 기호 회귀 벤치마크를 확장하여 암기 방지 문제를 다룬 후속 연구로 볼 수 있다.
후속 연구SPECTER2 유사도 0.93로 Scientific Machine Learning for Dynamics와 Formal Methods and Computational Reasoning가 맞닿아, 'LLM-SRBench: A New Benchmark for Scientific Equation Discovery with Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.90로 Scientific Machine Learning for Dynamics와 Formal Methods and Computational Reasoning가 맞닿아, 'LLM-SRBench: A New Benchmark for Scientific Equation Discovery with Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.