Essence
이 논문은 저장소 규모(repository-scale)의 formal mathematics proof engineering을 평가하기 위한 최초의 체계적 프레임워크인 Automated Proof Engineering(APE)을 제안하며, Mathlib 커밋 히스토리에서 태스크를 자동 추출하는 APE-Bench와 task contract 기반 통합 실행 인프라 APE-Harness를 제공한다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: 고립된 정리 증명 평가에서 저장소 규모 proof engineering 평가로 패러다임을 확장한 시의적절하고 실용적인 인프라·벤치마크 제안으로, formal mathematics 에이전트 연구에 SWE-bench에 준하는 새로운 평가 표준을 제시할 잠재력이 크다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.94로 Formal Proof Verification Automation와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Autoreproduce: Automatic AI Experiment Reproduction with Paper Lineage'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Formal Proof Verification Automation와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구end-to-end workflow 평가 방법을 확장하여 더 복잡한 태스크에 적용한다.
기반 연구자율 실험실 환경에 무결성 검증 계약을 실제 적용한다.
기반 연구SPECTER2 유사도 0.95로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'M2F: Automated Formalization of Mathematical Literature at Scale'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근동일한 formal mathematics 검증 벤치마크를 다른 접근법으로 평가하는 연구
다른 접근Mathlib 등 실제 수학 라이브러리를 이용한 유사한 벤치마크 구축
다른 접근저장소 규모의 formal proof engineering 평가와 감사를 다룬 밀접한 관련 연구로 동일 문제의 대안적 벤치마크를 제시함.
다른 접근수학적 추론 검증을 위한 다른 결합 방식을 제안한다.
다른 접근형식 증명 번역을 위한 다른 벤치마크 설계
다른 접근실험실 자동화를 위한 다른 3D 레이아웃 생성 방식을 사용한다.
다른 접근저장소 규모의 formal mathematics proof engineering 평가라는 동일한 문제 설정
후속 연구자동화된 증명 공학 평가 프레임워크의 확장된 버전
후속 연구repository-scale proof engineering 평가를 확장하는 후속 연구
응용 사례formal proof 자동화 방법을 실제 수학 라이브러리에 적용한 사례
반론/비판검증 가능한 과학적 객체 생성의 한계에 대해 비판적 관점을 제공하는 연구