CombiBench: Benchmarking LLM Capability for Combinatorial Mathematics

저자: Junqi Liu, Xiaohan Lin, Bolton Bailey, Jonas Bayer, Yaël Dillies, Weijie Jiang, Xiaodan Liang, Roman Soletskyi, Haiming Wang, Yunzhou Xie, Beibei Xiong, Zhengfeng Yang, Jujian Zhang, Lihong Zhi, Zekai Zhu, Jia LI, Zhengying Liu | 날짜: 2026 | URL: https://openreview.net/forum?id=qeZStJVYnc 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 2

Figure 2. Pipeline of the two-stage FINE-EVAL.

CombiBench는 조합수학(combinatorics) 분야에 특화된 100개의 Lean 4 정형화 문제와 비정형 진술을 함께 제공하는 벤치마크이며, 서술형(proof-based) 문제뿐 아니라 빈칸 채우기(fill-in-the-blank) 문제도 평가할 수 있는 Fine-Eval이라는 표준화된 평가 프레임워크를 함께 제안한다.

Motivation

Achievement

Figure 1

Figure 1. Code length distribution

  1. CombiBench 구축: 2000년 이후 모든 IMO combinatorics 문제(이미지 포함된 IMO 2004 Problem 3 제외)를 포함해 100개의 Lean 4 정형화 문제와 대응 비정형 진술을 제작했다.
  2. Lean 4 친화적 combinatorics 특화 벤치마크 최초 제공: 기존 벤치마크 대비(Table 1) combinatorics 문제 비율이 100%로, PutnamBench(4.4%)나 다른 벤치마크(0%)를 크게 상회한다.
  3. Fine-Eval 프레임워크 제안: 서술형 증명뿐 아니라 fill-in-the-blank 문제의 해 생성과 검증을 모두 지원하는 최초의 표준화된 정형수학 평가 방법을 제시했다.
  4. 최신 LLM 벤치마킹: state-of-the-art LLM들이 CombiBench 문제의 48%만 해결함을 보여, combinatorics 영역의 난이도와 평가 필요성을 입증했다.

How

Figure 2

Figure 2. Pipeline of the two-stage FINE-EVAL.

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 조합수학이라는 formal theorem proving의 취약 영역을 정면으로 겨냥한 시의적절하고 실용적인 벤치마크이며, fill-in-the-blank 평가 프레임워크라는 방법론적 기여도 함께 제시하여 향후 LLM 기반 정형 수학 연구에 중요한 진단 도구가 될 것으로 기대된다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Fimo: A challenge formal dataset for automated theorem proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.90로 LLM Reasoning and Safety Benchmarks와 Formal Methods & Code Generation가 맞닿아, 'Mustard: Mastering uniform synthesis of theorem and proof data'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구AC 문제와 유사한 조합적 탐색 문제로 RL 방법을 확장한다.
다른 접근formal theorem proving 평가를 위한 대안적 벤치마크
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Advancing Mathematics Research with AI-Driven Formal Proof Search'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구ultra-large chemical space 탐색을 실제 신약개발 문제에 적용
기반 연구Lean 4 정형화 문제 벤치마크의 기초 방법론을 제공함
기반 연구SPECTER2 유사도 0.90로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Accelerating Scientific Research with Gemini: Case Studies and Common Techniques'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근수학 정리 증명 벤치마크의 다른 도메인 특화 버전
후속 연구형식 검증 벤치마크를 조합수학 도메인으로 확장함
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드