ITPEval: Benchmarking Formal Translation Across Interactive Theorem Provers

저자: Jiayi Wu, Robert Joseph George, Anima Anandkumar | 날짜: 2026 | URL: https://openreview.net/forum?id=4PShGfBOMG 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Overview of ITPEval. The figure summarizes the cross-ITP translation setting, natural-language round-trip task

ITPEval은 Lean 4, Rocq, Isabelle, HOL Light 네 가지 주요 ITP 간 형식 증명 번역(cross-ITP translation)을 평가하기 위한 최초의 벤치마크로, controlled tier와 ecosystem tier로 구성된 6,848개 정리와 통합 검증 인프라를 제공한다.

Motivation

Achievement

Figure 3

Figure 3. Statement translation pass@1 across all 4,680 directed

  1. 4-way aligned cross-ITP benchmark 구축: 1,560개 소스 파일과 6,848개 정리를 포함하며 controlled tier(64개 파일, 660개 lemma)와 ecosystem tier(232개 Formalizing 100 Theorems 파일, 1,264개 miniF2F statement)로 구성해 12개 directed translation pair를 산출했다.
  2. 통합 다중 ITP 검증 인프라 공개: 이질적인 theorem prover들을 공통 인터페이스로 노출하는 environment-keyed scheduling, state-isolated warm backend, per-artifact 진단 기능을 갖춘 검증기를 제공했다.
  3. LLM 5종에 대한 체계적 평가: GPT-5.5, Claude Sonnet 4.6, Gemini 3.1 Pro, DeepSeek-V4-Pro, Qwen3-235B-A22B를 대상으로 statement translation은 최고 29.1% pass@1, proof translation은 최고 10.5% pass@1을 기록했으며, controlled 정리는 29.7% 대 ecosystem 정리 5.2%로 라이브러리 불일치가 지배적 병목임을 확인했다.
  4. BEq(Bidirectional Extended Definitional Equivalence) 검사 도입: type-checking을 통과한 miniF2F statement 번역 322개 중 54.0%(174개)만이 실제 의미적 동치를 만족함을 보여, native type-checking만으로는 의미적 충실도를 과대평가할 수 있음을 규명했다.
  5. autoformalization/auto-informalization round-trip 연구: Rocq와 HOL Light가 Lean 4, Isabelle보다 형식화 대상으로서 더 용이하며, multi-ITP context 제공 시 Lean 4의 pooled 성공률이 4.8%에서 10.6%로 향상됨을 확인했다.

How

Figure 2

Figure 2. ITPEVAL verification infrastructure. Generated artifacts are filtered, cached, scheduled by environment, and c

Originality

Limitation & Further Study

Evaluation

Novelty: 5/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 형식 증명 생태계의 파편화 문제를 정면으로 다루며 최초의 균형 잡힌 4-way cross-ITP 벤치마크와 통합 검증 인프라를 제공한 견실한 기여로, type-checking의 한계를 드러낸 BEq 검사 도입도 방법론적으로 의미 있으나, 더 넓은 라이브러리 커버리지와 다중 ITP 대상 의미 동치 검사로의 확장이 향후 과제로 남는다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'Towards large language models as copilots for theorem proving in lean'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'Grammars of formal uncertainty: When to trust llms in automated reasoning tasks'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SV-COMP 벤치마크에 검증 방법을 실제 적용
기반 연구Lean 형식화 검증 작업의 확장으로 axiom-level 감사를 추가한다.
기반 연구감사된 ground truth 데이터를 활용한 실제 정리 증명 평가에 적용한다.
다른 접근형식 증명 시스템 간 변환을 다른 tier 구조로 평가하는 대안적 벤치마크이다.
기반 연구cross-ITP translation의 기초적 평가 프레임워크 제공
기반 연구ITP 간 번역 평가의 기초적인 프로토콜을 제공하는 선행 연구이다.
기반 연구SPECTER2 유사도 0.94로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'M2F: Automated Formalization of Mathematical Literature at Scale'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근형식 증명 번역을 위한 다른 벤치마크 설계
다른 접근형식 증명 번역 평가를 위한 유사한 벤치마크 설계를 다른 ITP 조합으로 제시한다.
다른 접근동일하게 증명 보조기 간 번역/변환을 다루는 대안적 접근 방식을 제시한다.
후속 연구ITP 간 번역 평가를 확장한 유사 벤치마크
후속 연구Lean 4 기반 정리 형식화 파이프라인이라는 공통 기반을 공유한다.
후속 연구컴파일 성공 기반 커널 승인 방식의 형식화 파이프라인이라는 공통 기반을 공유한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드