DafnyProver: Agentic Verified Code Generation in Dafny

저자: Benjamin Breen, Austin Letson, Borja Requena, Leopoldo Sarra | 날짜: 2026 | URL: https://openreview.net/forum?id=gDzS44BgiM 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Dafny를 대상으로 한 agentic verified code generation 프레임워크 DafnyProver(AxDafny)를 제안하고, verifier feedback을 활용한 iterative repair를 통해 program synthesis와 proof synthesis를 동시에 수행하며, 새로운 벤치마크 LiveCodeBench-Pro-Dafny(LCB-Pro-Dafny)를 통해 이를 평가한다.

Motivation

Achievement

Figure 3

Figure 3. Cumulative AxDafny pass rate on LCB-Pro-Dafny across

  1. DafnyBench 성능 향상: AxDafny(Gemini-3.1-Pro)가 DafnyBench에서 725/782(92.7%) 검증 성공률을 달성하여 기존 최강 proof-hint baseline 대비 6.5%p 향상시켰다.
  2. 새 벤치마크 LCB-Pro-Dafny 구축: 250개의 경쟁 프로그래밍 스타일 문제를 formal specification과 함께 Dafny로 번역하고 verifier 기반 평가 harness를 구축하여 program synthesis와 proof synthesis를 동시에 평가할 수 있게 했다.
  3. Baseline 대비 큰 폭 개선: LCB-Pro-Dafny에서 GPT-5.5의 direct generation 성공률 11.6% 대비 AxDafny는 56.4%의 검증 성공률을 기록했다.
  4. Verification과 runtime test의 차이 규명: 검증된 LCB-Pro-Dafny 솔루션을 Python으로 컴파일해 원본 LiveCodeBench-Pro 테스트 하네스에서 실행한 결과, 대부분의 실행 실패가 자원 제한(resource limit)에서 기인함을 보여, verification success와 runtime test 성능이 서로 다른 코드 측면을 측정함을 입증했다.

How

Figure 2

Figure 2. Cumulative AxDafny pass rate on DafnyBench vs. itera-

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: Verifier-guided agentic repair를 통해 program synthesis와 proof synthesis를 통합적으로 다루고, 새로운 대규모 벤치마크와 함께 실증적 성능 개선을 보인 견실한 연구로, formal methods와 LLM 코드 생성의 결합 가능성을 잘 보여준다. 다만 경쟁 프로그래밍 수준의 자원 제약 문제는 여전히 해결되지 않은 채 남아 있어 향후 연구의 여지가 크다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'Draft, sketch, and prove: Guiding formal theorem provers with informal proofs'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'Fimo: A challenge formal dataset for automated theorem proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구verifier feedback 기반 iterative repair의 이론적 기초를 제공하는 연구로 판단됨
기반 연구SPECTER2 유사도 0.94로 Formal Proof Verification Automation와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'SEVerA: Verified Synthesis of Self-Evolving Agents'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근유사한 자기진화 에이전트 합성 접근을 제안한다.
다른 접근LLM 기반 정리 증명을 위한 다른 검증 프레임워크를 제안한다.
다른 접근verified code generation을 위한 다른 agentic 접근법을 제시한다.
다른 접근포화된 코딩 벤치마크 문제에 대한 유사한 task synthesis 접근법을 제시한다.
다른 접근자동 생성된 수학적 추측 검증을 위한 다른 정형 증명 접근을 사용한다.
후속 연구executable specification 개념의 기초를 제공한다.
후속 연구machine-checkable proof 생성 기술의 핵심 기초를 제공한다.
후속 연구정형화 검증을 위한 기반 기술을 제공하는 관련 연구이다.
후속 연구program synthesis와 proof 생성 자동화를 확장하는 관련 연구로 보임
응용 사례LLM 기반 정리 증명 및 코드 검증이라는 유사한 응용 영역을 다룬다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드