An Auditable Harness for AI-Assisted Lean Formalization: Pilot Logs from Finite Differential Privacy

저자: Bright Liu | 날짜: 2026 | URL: https://openreview.net/forum?id=QIiCQojqnf 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

AI(gpt-5 계열)가 생성한 Lean 4 증명이 실제로 컴파일되고 원래 정리 진술을 그대로 보존하는지 감사(audit)할 수 있는 24-trial 재현성 파일럿 하네스를 제안하고, finite differential privacy의 6개 보조정리에 대해 이를 시연한다.

Motivation

Achievement

  1. 높은 컴파일 성공률과 완전한 진술 보존: 24회 시도 중 21회(87.5%, Wilson 95% CI 69.0-95.7%)가 컴파일에 성공했고, 24/24 모두 할당된 정리 진술과 로컬 Lean 컨텍스트를 그대로 보존했으며 escape hatch 사용은 전무했다.
  2. 실패 모드의 세밀한 분류: 3건의 실패를 hallucinated lemma(존재하지 않는 Mathlib 상수 참조) 1건과 tactic-script 오류 2건으로 명확히 구분해 기록했다.
  3. 재현 가능한 로깅 스키마와 감사 도구 제공: task_id, prompt_sha256, compile_log_path, first_error_message 등을 포함한 JSON 스키마와 audit_statement_matches.py라는 구문 감사 스크립트를 공개해 다른 연구가 채택 가능한 실무적 산출물을 제공했다.

How

Originality

Limitation & Further Study

Evaluation

Novelty: 3/5 Technical Soundness: 4/5 Significance: 3/5 Clarity: 4/5 Overall: 3/5

총평: 모델 성능 주장이 아닌 재현 가능한 감사 인프라 자체를 기여로 삼은 겸손하고 방법론적으로 견고한 파일럿 연구로, 규모는 작지만 AI-assisted formal mathematics 커뮤니티가 채택할 만한 실용적인 로깅/감사 템플릿을 제공한다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.90로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Evaluating large language models trained on code'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Scientific Information Extraction and QA가 맞닿아, 'Claimver: Explainable claim-level verification and evidence attribution of text through knowledge graphs'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구AI 기반 형식 증명 생성 및 검증의 방법론적 기반이 되는 연구이다.
기반 연구SPECTER2 유사도 0.90로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'M2F: Automated Formalization of Mathematical Literature at Scale'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.90로 LLM Reasoning and Safety Benchmarks와 Applied Bibliometrics Across Domains가 맞닿아, 'A Bibliometric Study of Internal Audit Research Development'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근형식 증명 재현성 검증을 위한 다른 하네스 방식이다.
다른 접근형식 증명 자동화의 신뢰성 확보를 위한 유사한 방법론적 기반을 제공함.
다른 접근저장소 규모의 formal proof engineering 평가와 감사를 다룬 밀접한 관련 연구로 동일 문제의 대안적 벤치마크를 제시함.
응용 사례특정 수학 분야(differential privacy)에 AI 증명 생성을 적용한 사례
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드