저자: Erik Y. Wang, Sumeet Ramesh Motwani, James V Roggeveen, Eliot Hodges, Dulhan Jayalath, Charles London, Kalyan Ramakrishnan, Cheng Zhang, Flaviu Cipcigan, Philip Torr, Alessandro Abate | 날짜: 2026 | URL: https://openreview.net/forum?id=7R8PuCMlqR 📄 PDF
Essence
Figure 1. Benchmark composition by solvability level (top) and
LLM이 미해결 수학 문제에 대해 진정한 연구적 발견(discovery)을 수행할 수 있는지 측정하기 위해, generator-verifier gap을 활용한 자동 검증 가능한 벤치마크 HorizonMath를 제안한다. 113개의 대부분 미해결된 문제와 오픈소스 검증 프레임워크를 통해 GPT 5.4 Pro가 실제로 3개 문제에서 기존 미해결 질문을 해결하거나 최고 기록을 개선하는 새로운 해를 제시했음을 보인다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 4/5
총평: AI의 진정한 수학적 발견 능력을 측정하기 위한 새롭고 실용적인 접근을 제시하며, 실제 미해결 문제 해결 사례까지 확보한 점에서 임팩트가 크다.다만 수치적 검증의 엄밀성 한계와 상대적으로 작은 벤치마크 규모는 향후 보완이 필요한 지점이다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.95로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Fimo: A challenge formal dataset for automated theorem proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'TheoremQA: A Theorem-driven Question Answering Dataset'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구LLM 기반 정리 증명 기법을 실제 수학 벤치마크에 적용한 사례이다.
기반 연구generator-verifier gap 개념의 이론적 기초를 제공한다.
후속 연구에이전트 간 debate 구조의 기초적 설계 원리를 제공함
기반 연구자동 verifier를 통한 후보 해 검증 방법론을 확장한다.
기반 연구다양한 도메인에 걸친 추론 평가를 확장하는 관련 연구이다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Accelerating Scientific Research with Gemini: Case Studies and Common Techniques'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근다른 형식 논리 체계 설계 방식을 제시한다.
다른 접근LLM의 수학적 추론 실패를 실증하는 유사한 벤치마크 연구
다른 접근LLM 증명 품질 평가를 위한 대안적 벤치마크 접근
다른 접근수학 정리 검색을 위한 다른 접근법을 제시하는 벤치마크 연구임
다른 접근유전자 조절 네트워크 추론을 위한 신경망 기반 접근법을 공유함
다른 접근생의학 계산 검증이라는 유사한 문제를 다른 방식으로 접근하는 연구이다.
다른 접근수학 문제 해결을 위한 다른 파이프라인 접근법
후속 연구미해결 수학 문제 벤치마크를 정형 증명 검증으로 확장한다.
다른 접근MCTS 기반 탐색을 통한 수학적 구조 발견이라는 유사한 문제 설정을 다룸.
다른 접근수학적 발견 능력 평가라는 동일한 문제를 다른 벤치마크 설계로 접근한 연구이다.
다른 접근LLM의 수학 연구 능력을 측정하는 벤치마크라는 공통 목표를 가지되, HorizonMath는 미해결 문제 발견에, MathlibLemma는 정형 증명 라이브러리 구축에 중점을 둔다.
후속 연구정리 증명 맥락에서의 LLM 평가 프레임워크 기초 제공
후속 연구generator-verifier gap을 활용한 자동 검증 벤치마크 설계 방법론을 확장하여 적용한 연구이다.
후속 연구LLM 기반 수학 conjecture 생성 및 형식 검증의 기반 방법론을 제공함
응용 사례LLM 기반 수학적 발견 평가를 실제 연구 문제에 응용한다.