BRIDGE: Building Representations in Domain-Guided Verified Program Synthesis

저자: Robert Joseph George, Carson Eisenach, Udaya Ghai, Dominique Perrault-Joncas, Anima Anandkumar, Dean Foster | 날짜: 2026 | URL: https://openreview.net/forum?id=JKUFAIvl6x 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. BRIDGE methodology and key results. BRIDGE decomposes verifiable coding into linked Code, Specification, and

BRIDGE는 LEAN4 기반 검증 가능한 코드 생성을 Code, Specification, Theorem/Proof 세 개의 상호 연결된 도메인으로 분해하는 structured prompting framework로, artifact 간 semantic drift를 줄여 executable correctness를 향상시킨다.

Motivation

Achievement

Figure 2

Figure 2. Main quantitative results. Functional scaffolding improves executable Lean synthesis, reaches comparable succe

  1. Executable correctness 향상: 178개 문제로 구성된 자체 Lean benchmark에서 direct prompting 대비 최대 1.5배 executable correctness 향상을 달성했다.
  2. 평가 효율성 개선: 비슷한 성공률을 약 2배 적은 Lean evaluation 횟수로 도달할 수 있음을 보였다.
  3. Specification guided 생성 개선: specification guided code generation에서 최대 17.5 percentage point의 성능 향상을 보였다.
  4. 공개 benchmark로의 전이: VERINA, CLEVER, DafnyBench 등 공개 검증 benchmark에서도 BRIDGE의 향상 효과가 전이됨을 확인했다.
  5. Fine-tuning 내재화: BRIDGE 스타일 functional trace로 supervised fine-tuning 시 matched direct trace fine-tuning보다 우수했으며, Goedel-Code-Prover-8B는 VERINA에서 20.3%에서 29.4%로 향상되어 표현이 prompt 없이도 내재화될 수 있음을 시사했다.

How

Figure 3

Figure 3. Specification and theorem/proof diagnostics. Generated specifications often have useful discriminative power,

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: LEAN4 기반 검증 가능한 코드 생성을 세 도메인으로 분해하는 구조화된 접근으로 실질적인 executable correctness 향상과 평가 효율성 개선을 실험적으로 입증했으며, prompting을 넘어 fine-tuning까지 확장 가능함을 보인 의미 있는 연구이나 완전한 formal verification까지는 아직 갈 길이 남아있다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'Draft, sketch, and prove: Guiding formal theorem provers with informal proofs'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'Grammars of formal uncertainty: When to trust llms in automated reasoning tasks'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구GenSelect와 LLM-as-a-Judge 결합 프레임워크를 확장한 연구이다.
기반 연구Lean compiler 출력 압축을 통한 증명 실패 분석을 확장함
기반 연구structured prompting을 통한 정형 증명 생성의 이론적 기반
다른 접근rationale faithfulness 문제를 다른 방식으로 다룸
기반 연구신경-기호적 추론을 법률 도메인에 적용한 사례로 볼 수 있다.
기반 연구LLM 기반 실험 설계 파이프라인을 확장한 형태이다.
기반 연구SPECTER2 유사도 0.95로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'M2F: Automated Formalization of Mathematical Literature at Scale'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구Lean 기반 형식 증명 검증 방법론의 이론적 토대를 제공한다.
다른 접근포화된 벤치마크 문제를 해결하는 다른 task 생성 방법론
다른 접근LEAN4 기반 검증 가능한 코드 생성을 위한 다른 프롬프팅 전략
반론/비판커널 검증만으로 벤치마크 신뢰성을 확보할 수 있다는 기존 관점을 비판한다.
다른 접근LLM 기반 형식 검증을 다른 방식으로 접근하는 유사 연구
다른 접근semantic drift 감소를 위한 다른 접근법 제시
다른 접근traceability 기반 명세 검증의 다른 접근을 제시한다.
후속 연구code-specification-proof 분해 구조를 확장하는 연구
후속 연구형식 검증 산출물의 품질 평가에 필요한 property 기반 검증 방법론의 기초를 제공한다.
후속 연구formal 증명 검증의 기초가 되는 방법론을 제공한다.
후속 연구Isabelle 기반 정형 검증 피드백 활용이라는 공통 기반을 공유한다.
후속 연구형식 검증 방법론의 이론적 토대 제공
응용 사례검증 가능한 정형 코드 생성 프레임워크의 실제 적용 사례
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드