Essence
Figure 2. Overall solve rate and token cost across models and evaluation setups. Left: solve rates for each model withou
본 논문은 SageMath 및 Context7 문서 검색 도구를 결합한 ReAct 스타일 에이전트 프레임워크를 제안하고, RealMath 벤치마크를 정제하여 frontier LLM들이 연구 수준의 계산수학 문제를 얼마나 잘 푸는지 평가한다. CAS 접근이 모든 모델에서 solve rate를 크게 향상시키며, GPT-5.5가 75.2%로 최고 성능과 최저 토큰 사용을 동시에 달성함을 보인다.
Evaluation
Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: CAS를 agentic LLM 워크플로우에 통합하는 상대적으로 덜 탐구된 방향을 실증적으로 조명하고 벤치마크 정제까지 함께 제시한 실용적이고 시의적절한 워크숍 논문이나, 단일 CAS와 제한된 문제 유형에 국한된 점에서 후속 연구로의 확장이 필요하다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.95로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근대학 수준 과학 문제 해결 평가를 위한 다른 벤치마크
기반 연구RL 기반 추론 능력을 실제 벤치마크에 적용한 연구
기반 연구SPECTER2 유사도 0.95로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'From LLM Reasoning to Autonomous AI Agents: A Comprehensive Review'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근다중 에이전트 협업 프레임워크에 대한 포괄적 리뷰라는 공통 주제
기반 연구reasoning depth 조절 벤치마크를 활용한 후속 평가 연구이다.
기반 연구ReAct 스타일 에이전트 프레임워크의 방법론적 기반이 되는 연구이다.
기반 연구에이전트 간 상호작용이 결과에 미치는 영향을 확장하여 분석한다.
기반 연구정적 벤치마크를 지속 유지되는 평가 플랫폼으로 확장하는 유사 시도
후속 연구수학 벤치마크를 확장하여 frontier LLM들의 계산수학 능력을 재평가한 연구이다.
기반 연구first-principles 계산 자동화라는 공통 목표를 가진 물리 시뮬레이션 코드 연구이다.
기반 연구수학적 정리 통합 및 증명 발견을 확장하는 연구이다.
기반 연구지식 그래프 기반 연구 지도 구축 방법을 확장하거나 응용하는 연구로 보임
기반 연구market 기반 인센티브 구조를 실제 다중 에이전트 시스템에 적용한다.
기반 연구generator-verifier gap을 활용한 자동 검증 벤치마크 설계 방법론을 확장하여 적용한 연구이다.
기반 연구SPECTER2 유사도 0.95로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Accelerating Scientific Research with Gemini: Case Studies and Common Techniques'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구인간-AI 협력 기법의 이론적 기초를 제공하는 연구
기반 연구다중에이전트 프레임워크를 활용한 과학적 문제 해결이라는 공통 목표를 확장한다.
기반 연구LLM 평가 벤치마크의 구조적 복잡도를 확장한 후속 연구
다른 접근언어모델의 알고리즘적 추론 능력을 다른 방식으로 평가한다.
다른 접근대규모 수학 추론 데이터셋 구축에 다른 distillation 전략을 사용한다.
다른 접근에이전트 성능 평가를 위한 유사한 harness 기반 접근을 취한다.
다른 접근수학적 추론 강화를 위한 다른 retrieval 전략을 다룬다.
다른 접근물리학 등 특정 과학 도메인에서 LLM 추론 성능을 다룸
다른 접근CAS 도구를 활용한 LLM 에이전트 평가라는 동일 문제를 다른 도구 조합으로 접근한다.
다른 접근multi-turn agentic reasoning 및 test-time 개선이라는 공통 시스템 설계 목표를 공유함
응용 사례RealMath 벤치마크와 유사한 계산수학 평가 응용 사례이다.
다른 접근shortcut 문제 필터링이라는 유사 목표를 다른 방법으로 달성한다.
다른 접근reward-hacking 방지를 위한 대안적 아키텍처
다른 접근특정 전문 분야 LLM 파인튜닝의 대안적 접근을 제시한다.
다른 접근물리 시뮬레이션 검증을 위한 LLM 활용이라는 공통 주제를 다룬다.
다른 접근동일한 물리 계산 가속화 및 자동 미분 활용이라는 목표를 가진 대안적 코드 개발 연구이다.
다른 접근LLM의 continual learning을 위한 다른 메모리 기반 접근을 제시
다른 접근Mathlib 생태계 내에서 LLM/agent의 실제 기여 준비도를 평가하는 유사한 벤치마크 접근이다.
후속 연구정리 증명 및 자기개선 메커니즘의 기초적 설계를 제공함
후속 연구수학 추론 평가 벤치마크의 기초를 제공
후속 연구answer-only 검증의 한계를 지적하는 이론적 기반을 공유한다.
후속 연구사이클 카운트 통계량 계산의 이론적 토대를 제공한다.
후속 연구다중 목적 증명 재구성의 방법론적 기초를 제공하는 연구로 판단됨
후속 연구SFT 이후 RL 적용이라는 학습 파이프라인의 방법론적 기반을 제공하는 것으로 추정됨
후속 연구reasoning token 기반 평가 방법론의 기초를 제공한다.