ASyMOB: Algebraic Symbolic Mathematical Operations Benchmark

저자: Michael Shalyt, Rotem Elimelech, Ido Kaminer | 날짜: 2026 | URL: https://openreview.net/forum?id=W85McJPVMI 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Example seed question (top), its symbolically per-

ASyMOB은 integration, limits, differential equations, series, hypergeometrics 등 university-level symbolic mathematics 문제 100개의 seed question에 symbolic, numeric, equivalence-preserving perturbation을 체계적으로 적용해 35,368개의 검증된 문제로 구성한 고해상도 벤치마크로, LLM의 진짜 수학적 추론 능력과 pattern memorization을 구분하기 위한 진단 도구이다.

Motivation

Achievement

Figure 2

Figure 2. Degradation of success rate relative to seed-set performance. Both code-integrated models (left) and non-code

  1. 대규모 고해상도 데이터셋 구축: Integrals, Differential Equations, Series, Limits, Hypergeometric Functions 5개 카테고리에 걸쳐 100개 seed 문제로부터 35,368개의 검증된 symbolic math 문제를 생성했다.
  2. Robustness의 regime shift 발견: 대부분 모델은 사소한 perturbation에도 성능이 붕괴하지만, 최상위 시스템은 이러한 붕괴에 대해 뚜렷한 저항성(regime shift)을 보였다(unperturbed 74.6% → 전체 46.8%).
  3. Code tool의 효과 규명: code 실행 도구 통합이 약한 모델의 성능을 안정화시키지만, 이미 강력한 모델에는 별다른 영향을 주지 않음을 확인했다.
  4. CAS-LLM 상호보완성 규명: Mathematica, WolframAlpha, SymPy 같은 CAS가 실패하지만 LLM이 성공하는 사례, 그리고 CAS와 LLM 단독으로는 실패하나 하이브리드 접근으로만 풀리는 문제를 제시했다.

How

Figure 2

Figure 2. Degradation of success rate relative to seed-set performance. Both code-integrated models (left) and non-code

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 순수 symbolic mathematics에 특화된 체계적 perturbation 기반의 대규모 고해상도 벤치마크로서, LLM의 진짜 수학적 추론과 pattern memorization을 구분하는 데 실질적으로 기여하는 견고한 연구이다. CAS-LLM 하이브리드 가능성을 실증적으로 보여준 점도 향후 연구 방향에 유의미한 시사점을 제공한다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'CodePDE: An Inference Framework for LLM-driven PDE Solver Generation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'LLM-SRBench: A New Benchmark for Scientific Equation Discovery with Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근과학 방정식 발견 성능 평가라는 동일 문제를 다루는 대안적 벤치마크 또는 방법론이다.
기반 연구물리학자-AI 협업 워크플로우를 확장한 연구이다.
후속 연구다양한 수학 연산 유형에 대한 벤치마크를 확장하여 구성한다.
기반 연구symbolic mathematics 문제 seed question 구성의 이론적 토대
기반 연구진화적 symbolic regression 기법을 확장한 연구이다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'AutoNumerics: An Autonomous, PDE-Agnostic Multi-Agent Pipeline for Scientific Computing'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구ASyMOB의 문제 유형을 hypergeometrics 등으로 확장
응용 사례대학 수준 수학 문제를 실제 벤치마크에 적용한 사례이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드