TabularMath: Evaluating Computational Extrapolation in Tabular Learning via Program-Verified Synthesis

저자: Zerui Cheng, Jiashuo Liu, Jianzhu Yao, Pramod Viswanath, Ge Zhang, Wenhao Huang | 날짜: 2026 | URL: https://openreview.net/forum?id=k3GS4CFGoB 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. The R2–consistency gap. On TABULARMATH-GSM8k

TabularMath은 GSM8K와 AIME 문제를 program-verified generator-verifier로 tabular 데이터셋(114개 문제, 233,472행)으로 변환하여, tabular 모델과 ICL이 통계적 interpolation을 넘어 결정론적 computational extrapolation을 수행할 수 있는지 진단하는 benchmark이다.

Motivation

Achievement

Figure 4

Figure 4. Scaling with more rows on GSM8K. Under OOD, ICL

  1. R^2-일관성 격차 발견: TabPFN v2.5는 in-distribution에서 R^2=0.998, OOD에서도 양의 R^2를 유지하는 유일한 tabular 모델이지만, rounded exact-match 정확도는 OOD에서 10% 미만으로 급락한다.
  2. 5배 extrapolation 격차: OOD 평가에서 ICL은 약 40% exact-match 정확도를 유지하는 반면 TabPFN v2.5는 8%, tree ensemble은 1% 미만으로 떨어진다.
  3. ICL의 뛰어난 sample efficiency: 단 32개 예제만으로 ICL은 55% 정확도를 달성하는 반면, TabPFN은 이에 도달하기 위해 약 500개 예제가 필요하다.
  4. 상호보완적 강점 규명: 충분한 in-distribution 데이터(2,048행)가 주어지면 TabPFN v2.5가 ICL을 능가(62% 정확도)하여, tabular 모델은 interpolation에, ICL은 rule induction에 강점이 있음을 보인다.

How

Figure 3

Figure 3. End-to-end construction and evaluation pipeline for TABULARMATH.

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 기존 tabular benchmark의 blind spot을 정교하고 검증 가능한 방식으로 드러낸 참신한 진단 벤치마크로, tabular learning과 LLM 기반 ICL의 상호보완적 특성에 대한 실용적 통찰을 제공한다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Through the lens of core competency: Survey on evaluation of large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구deterministic 시뮬레이터를 probabilistic으로 확장하는 유사한 방법론을 다룬다.
기반 연구PatternBoost나 강화학습 기법을 실제 문제에 적용하는 유사 사례
다른 접근generator-verifier 방식의 데이터셋 구축이라는 방법론적 공통점을 가진 연구
기반 연구유사한 최적화 기법을 다른 도메인에 응용
기반 연구교정된 벤치마크를 실제 분자 발굴 평가에 적용한다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'AutoNumerics: An Autonomous, PDE-Agnostic Multi-Agent Pipeline for Scientific Computing'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근GSM8K 등 수학 문제를 활용한 모델 평가라는 유사한 접근을 사용하는 연구
다른 접근LLM의 순수 추론 능력 평가라는 유사한 목표를 다른 문제 유형으로 접근한다.
응용 사례생성된 tabular 문제를 통한 모델 평가 응용
다른 접근동일하게 진화적 탐색을 통해 수학 함수 근사 알고리즘을 자동 발견하는 접근을 다룬다.
후속 연구tabular ICL의 extrapolation 능력을 확장 평가
다른 접근tabular 데이터셋을 통한 수학적 추론 능력 평가라는 동일한 벤치마크 설계 문제를 다룸
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드