Essence
Figure 1. Overview of ITPEval. The figure summarizes the cross-ITP translation setting, natural-language round-trip task
ITPEval은 Lean 4, Rocq, Isabelle, HOL Light 네 가지 주요 ITP 간 형식 증명 번역(cross-ITP translation)을 평가하기 위한 최초의 벤치마크로, controlled tier와 ecosystem tier로 구성된 6,848개 정리와 통합 검증 인프라를 제공한다.
Evaluation
Novelty: 5/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: 형식 증명 생태계의 파편화 문제를 정면으로 다루며 최초의 균형 잡힌 4-way cross-ITP 벤치마크와 통합 검증 인프라를 제공한 견실한 기여로, type-checking의 한계를 드러낸 BEq 검사 도입도 방법론적으로 의미 있으나, 더 넓은 라이브러리 커버리지와 다중 ITP 대상 의미 동치 검사로의 확장이 향후 과제로 남는다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.93로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'Towards large language models as copilots for theorem proving in lean'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'Grammars of formal uncertainty: When to trust llms in automated reasoning tasks'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SV-COMP 벤치마크에 검증 방법을 실제 적용
기반 연구Lean 형식화 검증 작업의 확장으로 axiom-level 감사를 추가한다.
기반 연구감사된 ground truth 데이터를 활용한 실제 정리 증명 평가에 적용한다.
다른 접근형식 증명 시스템 간 변환을 다른 tier 구조로 평가하는 대안적 벤치마크이다.
기반 연구cross-ITP translation의 기초적 평가 프레임워크 제공
기반 연구ITP 간 번역 평가의 기초적인 프로토콜을 제공하는 선행 연구이다.
기반 연구SPECTER2 유사도 0.94로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'M2F: Automated Formalization of Mathematical Literature at Scale'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근형식 증명 번역을 위한 다른 벤치마크 설계
다른 접근형식 증명 번역 평가를 위한 유사한 벤치마크 설계를 다른 ITP 조합으로 제시한다.
다른 접근동일하게 증명 보조기 간 번역/변환을 다루는 대안적 접근 방식을 제시한다.
후속 연구ITP 간 번역 평가를 확장한 유사 벤치마크
후속 연구Lean 4 기반 정리 형식화 파이프라인이라는 공통 기반을 공유한다.
후속 연구컴파일 성공 기반 커널 승인 방식의 형식화 파이프라인이라는 공통 기반을 공유한다.