Reasoning or Recall? Blind Evaluation of LLMs on Numerical Function Tasks

저자: Ahmad A Rushdi, Kiana Jafari Meimandi, Mykel Kochenderfer | 날짜: 2026 | URL: https://openreview.net/forum?id=wZfssjcuxH 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

본 논문은 LLM이 수치 함수 문제(multifidelity surrogate modeling, numerical integration, global optimization)를 코드 실행이나 함수 기억(recall)이 아닌 순수 추론(reasoning)으로 풀 수 있는지를 blind 프로토콜로 검증한다. 결과적으로 LLM 응답 중 일부가 sparse-sample interpolation으로는 불가능한 수준의 정확도로 ground truth와 일치하는 현상을 발견하고, 이는 reasoning이 아닌 recall에 기인함을 새로 구성한 control function 실험으로 입증한다.

Motivation

Achievement

Figure 6
  1. Blind cross-task 평가 프로토콜 제시: code execution과 function-name recognition을 동시에 제거하는 프로토콜을 MF, INT, OPT 세 task에 동일하게 적용한 최초의 cross-task LLM numerical evaluation을 수행했다.
  2. 4단계 오류 지도(four-regime error map) 구축: recall, code execution, reasoning, no capability의 4가지 응답 범주를 구분하고, hand-composed novel function에서 near-exact match rate가 4개 LLM 전체에서 0/12로 떨어짐을 보임으로써 falsifiable recall test를 제시했다.
  3. Recall과 reasoning의 분리 증거 확보: 4개 frontier LLM과 14개 함수에 대한 cross-task 실증 결과를 통해 LLM 응답 중 일부가 sparse-sample interpolation으로는 설명 불가능한 정밀도로 ground truth와 일치함을 확인하고, 이것이 recall 채널임을 alias probe와 control function 실험으로 입증했다.

How

Figure 3

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: LLM의 수치적 추론 능력을 code execution 및 recall과 명확히 분리해 측정하려는 시도는 방법론적으로 신선하고 시의적절하며, hand-composed control function을 통한 falsifiable recall test는 특히 설득력 있는 증거를 제공한다. 다만 평가 규모(모델 수, 함수 수)의 제한과 LLM 버전 의존성은 향후 후속 연구를 통해 보완될 필요가 있다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.90로 LLM Reasoning and Safety Benchmarks와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Targeted materials discovery using Bayesian algorithm execution'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.90 기준으로 'Reasoning or Recall? Blind Evaluation of LLMs on Numerical Function Tasks'의 AI4S 방법론을 'R&D-Agent: Automating Data-Driven AI Solution Building Through LLM-Powered Automated Research, Development, and Evolution'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구생성된 tabular 문제를 통한 모델 평가 응용
다른 접근LLM의 순수 추론 능력 평가라는 유사한 목표를 다른 문제 유형으로 접근한다.
기반 연구LLM의 recall과 reasoning 구분에 대한 기초 개념을 제공한다.
기반 연구SPECTER2 유사도 0.90로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'Scaling Reproducibility: An AI-Assisted Workflow for Large-Scale Reanalysis'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 AI-Driven Drug and Materials Discovery가 맞닿아, 'MatClaw: An Autonomous Code-First LLM Agent for End-to-End Materials Exploration'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근수치적 추론 능력 검증을 위한 벤치마크 설계라는 확장된 접근을 제공한다.
다른 접근수치 함수 문제에 대한 LLM 평가라는 유사한 벤치마크 접근이다.
반론/비판코드 실행/기억 대신 순수 추론 여부를 검증한다는 대비되는 관점을 제시한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드