⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
본 논문은 LLM이 수치 함수 문제(multifidelity surrogate modeling, numerical integration, global optimization)를 코드 실행이나 함수 기억(recall)이 아닌 순수 추론(reasoning)으로 풀 수 있는지를 blind 프로토콜로 검증한다. 결과적으로 LLM 응답 중 일부가 sparse-sample interpolation으로는 불가능한 수준의 정확도로 ground truth와 일치하는 현상을 발견하고, 이는 reasoning이 아닌 recall에 기인함을 새로 구성한 control function 실험으로 입증한다.
Motivation
Known: 기존 LLM과 surrogate modeling 연구들은 code generation 능력이나 정보 recall 능력을 측정해왔으며, 이 둘을 결합한 형태로 LLM의 수치적 능력을 평가해왔다. Bayesian optimization 등 특정 task에서 LLM이 observed feedback을 생산적으로 활용하지 못한다는 선행연구(Gupta et al., 2025)도 존재한다.
Gap: 기존 연구들은 code execution이나 함수 인식(function recognition)을 허용하기 때문에, 관찰된 성공이나 실패가 순수한 reasoning 능력에 기인하는지 명확히 구분할 수 없었다. 또한 여러 numerical task(MF, INT, OPT)를 동일한 elicitation protocol 하에 cross-task로 비교한 연구가 없었다.
Why: UQ(uncertainty quantification) 문제처럼 함수 formula가 알려지지 않은 상황에서 LLM이 순수하게 sample 데이터로부터 추론할 수 있는 능력을 분리해 측정하는 것은, LLM을 numerical/scientific computing 파이프라인에 신뢰성 있게 통합하기 위한 전제 조건이 된다.
Approach: anonymous function name, unit-cube normalization, no code execution, closed-form recall 억제라는 4가지 요소로 구성된 blind protocol을 MF, INT, OPT 세 task에 동일하게 적용하고, 4개의 최신 LLM(Claude, GPT, Gemini, Muse)과 SFU library 기반 표준 test function들로 실험한다.
Achievement
Blind cross-task 평가 프로토콜 제시: code execution과 function-name recognition을 동시에 제거하는 프로토콜을 MF, INT, OPT 세 task에 동일하게 적용한 최초의 cross-task LLM numerical evaluation을 수행했다.
4단계 오류 지도(four-regime error map) 구축: recall, code execution, reasoning, no capability의 4가지 응답 범주를 구분하고, hand-composed novel function에서 near-exact match rate가 4개 LLM 전체에서 0/12로 떨어짐을 보임으로써 falsifiable recall test를 제시했다.
Recall과 reasoning의 분리 증거 확보: 4개 frontier LLM과 14개 함수에 대한 cross-task 실증 결과를 통해 LLM 응답 중 일부가 sparse-sample interpolation으로는 설명 불가능한 정밀도로 ground truth와 일치함을 확인하고, 이것이 recall 채널임을 alias probe와 control function 실험으로 입증했다.
How
SFU library에서 task별로 4개씩(총 12개 표준 함수) 선정하고, intrinsic difficulty(smooth, multimodal, discontinuous, pathological) 축을 아우르도록 구성
MF: Currin(d=2), Park 1/2(d=4), Borehole(d=8); INT: [0,1]^2 상의 G1, G2, G4, G6 (Genz integrand families); OPT: Branin, Ackley, Goldstein-Price, Rosenbrock
모든 도메인을 [0,1]^d로 정규화하여 LLM이 native domain으로부터 함수를 추측하지 못하도록 차단
4개 LLM(Claude Opus 4.7, GPT-5.5, Gemini 3.1 Pro, Muse Spark)을 각 모델의 가장 강력한 reasoning mode로 사용
system message로 tool 사용과 closed-form recall을 금지하고, 각 cell에서 strict-JSON 형식으로 method 선택(closed list) 및 예측값(bf, bI, 또는 (bx⋆, bf⋆))을 반환하도록 요구
task × function × sample size × LLM = 3×4×3×4 grid로 실험을 설계하고, 각 task별 tolerance 내 정확도로 채점
추가로 alias probe(함수 이름 변경)와 hand-composed novel function(recall 불가능한 통제 함수)을 통해 recall 여부를 검증
Originality
code execution과 recall을 동시에 배제하는 blind protocol을 처음으로 MF, INT, OPT 세 가지 서로 다른 수치 task에 통일된 방식으로 적용
recall/code execution/reasoning/no capability의 4단계 오류 분류 체계(Figure 2)를 제안하여 LLM 응답의 근본 원인을 구분 가능하게 함
hand-composed novel function을 이용한 falsifiable recall test라는 독창적인 통제 실험 설계로, recall과 reasoning을 구분할 수 있는 실증적 근거 제공
alias probe(함수 이름 바꾸기)를 통해 recall 지속성을 검증하는 신선한 방법론적 시도
Limitation & Further Study
평가에 사용된 LLM은 4개, 함수는 14개(및 추가 stretch cell 2개)로 제한적이며, 더 많은 모델·함수·차원으로의 일반화가 필요함
tolerance 기반의 binary pass/fail 채점 방식이 reasoning 품질의 세밀한 차이를 완전히 포착하지 못할 가능성이 있음
LLM의 "최신" 버전(Claude Opus 4.7, GPT-5.5 등, 2026년 시점)에 의존하므로, 모델 업데이트에 따라 recall 패턴이 달라질 수 있어 재현성 및 시간적 일반화에 한계가 있음
고차원(d>8) 함수나 실제 UQ 응용 문제로의 확장이 이루어지지 않음
후속 연구로 다양한 prompting 전략(chain-of-thought 세분화, few-shot 예시 등)이 reasoning 성능에 미치는 영향을 탐구할 필요가 있음
총평: LLM의 수치적 추론 능력을 code execution 및 recall과 명확히 분리해 측정하려는 시도는 방법론적으로 신선하고 시의적절하며, hand-composed control function을 통한 falsifiable recall test는 특히 설득력 있는 증거를 제공한다. 다만 평가 규모(모델 수, 함수 수)의 제한과 LLM 버전 의존성은 향후 후속 연구를 통해 보완될 필요가 있다.
기반 연구SPECTER2 유사도 0.90로 LLM Reasoning and Safety Benchmarks와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Targeted materials discovery using Bayesian algorithm execution'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.90 기준으로 'Reasoning or Recall? Blind Evaluation of LLMs on Numerical Function Tasks'의 AI4S 방법론을 'R&D-Agent: Automating Data-Driven AI Solution Building Through LLM-Powered Automated Research, Development, and Evolution'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구SPECTER2 유사도 0.90로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'Scaling Reproducibility: An AI-Assisted Workflow for Large-Scale Reanalysis'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 AI-Driven Drug and Materials Discovery가 맞닿아, 'MatClaw: An Autonomous Code-First LLM Agent for End-to-End Materials Exploration'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.