저자: Junqi Liu, Xiaohan Lin, Bolton Bailey, Jonas Bayer, Yaël Dillies, Weijie Jiang, Xiaodan Liang, Roman Soletskyi, Haiming Wang, Yunzhou Xie, Beibei Xiong, Zhengfeng Yang, Jujian Zhang, Lihong Zhi, Zekai Zhu, Jia LI, Zhengying Liu | 날짜: 2026 | URL: https://openreview.net/forum?id=qeZStJVYnc 📄 PDF
Essence
Figure 2. Pipeline of the two-stage FINE-EVAL.
CombiBench는 조합수학(combinatorics) 분야에 특화된 100개의 Lean 4 정형화 문제와 비정형 진술을 함께 제공하는 벤치마크이며, 서술형(proof-based) 문제뿐 아니라 빈칸 채우기(fill-in-the-blank) 문제도 평가할 수 있는 Fine-Eval이라는 표준화된 평가 프레임워크를 함께 제안한다.
Evaluation
Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: 조합수학이라는 formal theorem proving의 취약 영역을 정면으로 겨냥한 시의적절하고 실용적인 벤치마크이며, fill-in-the-blank 평가 프레임워크라는 방법론적 기여도 함께 제시하여 향후 LLM 기반 정형 수학 연구에 중요한 진단 도구가 될 것으로 기대된다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Fimo: A challenge formal dataset for automated theorem proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.90로 LLM Reasoning and Safety Benchmarks와 Formal Methods & Code Generation가 맞닿아, 'Mustard: Mastering uniform synthesis of theorem and proof data'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구AC 문제와 유사한 조합적 탐색 문제로 RL 방법을 확장한다.
다른 접근formal theorem proving 평가를 위한 대안적 벤치마크
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Advancing Mathematics Research with AI-Driven Formal Proof Search'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구ultra-large chemical space 탐색을 실제 신약개발 문제에 적용
기반 연구Lean 4 정형화 문제 벤치마크의 기초 방법론을 제공함
기반 연구SPECTER2 유사도 0.90로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Accelerating Scientific Research with Gemini: Case Studies and Common Techniques'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근수학 정리 증명 벤치마크의 다른 도메인 특화 버전
후속 연구형식 검증 벤치마크를 조합수학 도메인으로 확장함