APE-Bench: Evaluating Automated Proof Engineering for Formal Math Libraries

저자: Huajian Xin, Zheng Yuan, Jacques D. Fleuriot, Wenda Li | 날짜: 2026 | URL: https://openreview.net/forum?id=OjeKfGXLOn 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

이 논문은 저장소 규모(repository-scale)의 formal mathematics proof engineering을 평가하기 위한 최초의 체계적 프레임워크인 Automated Proof Engineering(APE)을 제안하며, Mathlib 커밋 히스토리에서 태스크를 자동 추출하는 APE-Bench와 task contract 기반 통합 실행 인프라 APE-Harness를 제공한다.

Motivation

Achievement

Figure 2
  1. APE 형식화 및 APE-Bench: pinned repository/toolchain 환경, 자연어 지시문, dual verification을 갖춘 APE 태스크 형식을 정의하고, 2026-01-06~01-12 기간 67개 Mathlib 커밋에서 100개 태스크를 추출해 학습 데이터 오염 없는 벤치마크를 구축했다.
  2. LLM Judge 검증 벤치마크: semantic correctness, requirement alignment, scope control 3차원 품질 평가를 포함한 64개 전문가 주석 에이전트 솔루션을 구축해 LLM-as-Judge 파이프라인이 인간 전문가 판단과 일치함을 검증했다.
  3. APE-Harness 인프라: task contract 추상화를 통해 task specification과 execution strategy를 분리, 다양한 formal math 태스크에 대한 통합 평가, self-hosted functional workflow, scaffold 상호교환성을 지원한다.
  4. APE-Agent: 통합 검증 기능을 갖춘 file system tool 기반 ReAct-style scaffold를 제공, Claude Code·Codex CLI 등 성숙한 코드 에이전트와의 비교를 가능하게 한다.
  5. 다중 버전 실행/검색 서비스: content deduplication을 통해 67개 라이브러리 버전에 걸친 컴파일 검증과 의미 검색을 자릿수 단위로 자원 절약하며 지원한다.

How

Figure 1

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 고립된 정리 증명 평가에서 저장소 규모 proof engineering 평가로 패러다임을 확장한 시의적절하고 실용적인 인프라·벤치마크 제안으로, formal mathematics 에이전트 연구에 SWE-bench에 준하는 새로운 평가 표준을 제시할 잠재력이 크다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 Formal Proof Verification Automation와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Autoreproduce: Automatic AI Experiment Reproduction with Paper Lineage'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Formal Proof Verification Automation와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구end-to-end workflow 평가 방법을 확장하여 더 복잡한 태스크에 적용한다.
기반 연구자율 실험실 환경에 무결성 검증 계약을 실제 적용한다.
기반 연구SPECTER2 유사도 0.95로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'M2F: Automated Formalization of Mathematical Literature at Scale'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근동일한 formal mathematics 검증 벤치마크를 다른 접근법으로 평가하는 연구
다른 접근Mathlib 등 실제 수학 라이브러리를 이용한 유사한 벤치마크 구축
다른 접근저장소 규모의 formal proof engineering 평가와 감사를 다룬 밀접한 관련 연구로 동일 문제의 대안적 벤치마크를 제시함.
다른 접근수학적 추론 검증을 위한 다른 결합 방식을 제안한다.
다른 접근형식 증명 번역을 위한 다른 벤치마크 설계
다른 접근실험실 자동화를 위한 다른 3D 레이아웃 생성 방식을 사용한다.
다른 접근저장소 규모의 formal mathematics proof engineering 평가라는 동일한 문제 설정
후속 연구자동화된 증명 공학 평가 프레임워크의 확장된 버전
후속 연구repository-scale proof engineering 평가를 확장하는 후속 연구
응용 사례formal proof 자동화 방법을 실제 수학 라이브러리에 적용한 사례
반론/비판검증 가능한 과학적 객체 생성의 한계에 대해 비판적 관점을 제공하는 연구
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드