Agentic Proving for Program Verification

저자: Alessandro Sosso, Akhil Arora, Bas Spitters | 날짜: 2026 | URL: https://openreview.net/forum?id=rlWpAywUII 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Schematic overview of our experimental pipeline. The four generation and proof tasks are identified in yellow:

Claude Code 기반 agentic proving 시스템을 CLEVER(Lean 4 검증 가능 코드 생성 벤치마크)에 적용하여, 명세 생성·검증부터 구현 생성·정합성 증명까지 전체 파이프라인에서 기존 최고 성능을 크게 뛰어넘는 결과(end-to-end 98.1%)를 달성했음을 보인 실증 연구이다.

Motivation

Achievement

Figure 4

Figure 4. Overview of prover performance on the CLEVER and VERINA benchmarks. Solid bars indicate the number of tests so

  1. Specification certification: Claude가 98.8%의 문제에서 arguably valid한 specification을 생성했으며, 이 중 81.3%는 CLEVER의 isomorphism-based scoring에서도 정답(ground-truth 결함 없는 부분 기준)으로 인정되었다.
  2. Implementation certification: 올바른 ground-truth specification에 대해 87.5%의 문제에서 구현을 생성하고 정합성을 증명하는 데 성공했다.
  3. End-to-end pipeline: 전제(premise)가 self-consistent한 항목들에 대해 specification+implementation+proof 전체 파이프라인에서 98.1%의 성공률을 달성하여, 기존 최고 기록(원 논문 0.62%, 최신 follow-up 최대 약 54%/23.6%)을 크게 상회했다.
  4. Self-diagnostic feedback: Claude는 자신의 실패 원인과 벤치마크 내 잔존 버그를 식별·분류하는 고품질 분석을 자체적으로 생성했으며, 수작업 검토를 통해 이 피드백의 타당성이 확인되었다.
  5. Methodological insight: isomorphism-against-ground-truth 방식의 평가가 구조적 한계를 지님을 실증적으로 드러내고, 대안적 평가 전략의 필요성을 제기했다.

How

Figure 1

Figure 1. Schematic overview of our experimental pipeline. The four generation and proof tasks are identified in yellow:

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 최신 agentic proving 시스템이 program verification 벤치마크에서 기존 한계를 극적으로 뛰어넘음을 보인 시의성 있고 임팩트 있는 실증 연구로, 벤치마크와 prover 역량 간 mismatch를 지적하며 평가 방법론에 대한 중요한 논의를 제기하지만 단일 모델·단일 벤치마크에 기반한 제한적 범위는 향후 검증이 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 Formal Proof Verification Automation와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Autoreproduce: Automatic AI Experiment Reproduction with Paper Lineage'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'Grammars of formal uncertainty: When to trust llms in automated reasoning tasks'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구테스트가 아닌 formal proof 기반 평가가 필요하다는 주장과 직접 연결되는 실증 사례이다.
기반 연구자동화된 증명 공학 평가 프레임워크의 확장된 버전
기반 연구Lean 기반 검증 가능 코드 생성의 방법론적 기초를 제공한다.
기반 연구임상 진단과 같은 고위험 도메인에 LLM 검증 기법을 적용한다.
기반 연구그래프 이론 추측 생성 및 검증 루프를 자율적 형태로 확장한다.
응용 사례유사한 agentic proving 기법을 다른 검증 벤치마크에 적용한다.
기반 연구메타데이터 기반 연구 지도를 실제 서비스에 적용한 사례이다.
기반 연구Lean 커널 인증 기반 검증을 확장한다.
기반 연구SPECTER2 유사도 0.94로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'M2F: Automated Formalization of Mathematical Literature at Scale'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근수학 문제 자동 검증에서 다른 verifier 설계 방식을 제안하는 대안적 접근이다.
다른 접근agentic proving을 프로그램 검증에 적용하는 유사한 문제를 다른 명세 언어로 접근한다.
후속 연구동일한 agentic 검증 접근을 separation logic 명세 합성이라는 다른 도메인으로 확장한다.
다른 접근identity/property 기반 검증이라는 유사한 인증 방법론
다른 접근verified code generation을 위한 다른 agentic 접근법을 제시한다.
다른 접근LLM 기반 formalization 신뢰성 검증이라는 동일 목표를 다른 방식으로 접근한다.
후속 연구autoformalization 평가의 기초 방법론을 제공한다.
후속 연구코드 생성과 정합성 증명을 결합한 파이프라인을 확장한다.
후속 연구Lean 기반 형식 검증의 이론적 토대를 공유함
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드