Graffiti3Loop: Generating and Resolving Formal Machine-Generated Graph Conjectures in a Loop

저자: William Hu, Michael R Douglas, Randy Davila, Philip Vonderlind, Simon Frieder | 날짜: 2026 | URL: https://openreview.net/forum?id=obF2i1dK5w 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. GRAFFITI3LOOP pipeline. GRAFFITI3 selects conjec-

GRAFFITI3LOOP은 GRAFFITI3가 생성한 그래프 이론 추측을 Lean 4로 자동 번역하고 Comparator로 검증하는 자율 루프이며, 330개 추측으로 구성된 GRAFFITI3BENCH-330 벤치마크를 통해 zero-tool prover와 tool-using agentic triage의 성능을 비교 분석한다.

Motivation

Achievement

Figure 2

Figure 2. Failure-mode counts for evaluated completions. Since no

  1. GRAFFITI3BENCH-330 벤치마크 구축: GRAFFITI3에서 선택된 330개 그래프 이론 추측을 Lean 4 챌린지로 번역하고 provenance 메타데이터를 포함한 정적 벤치마크를 구성했다.
  2. Lean-facing invariant interface 설계: native mathlib 개념, wrapper, 벤치마크 정의, deferred 항목을 분리하는 인터페이스를 구축했다.
  3. Zero-tool 부정적 결과: Goedel-ProverV2-32B, DeepSeek-Prover-V2-7B, KiminaProver-72B 세 개 오픈웨이트 Lean prover가 330개 추측 전부에서 하나도 수락되지 않았으며, 이에 대한 실패 모드 분석(Lean API 누락, unsolved goal, answer block 누락, 부적절한 shortcut, 손상된 증명 조각)을 제공했다.
  4. Tool-using agentic triage 성과: Claude Code 기반의 tool-using, human-guided triage가 42개의 Lean-checked 라벨(17개 증명, 25개 반증)을 산출했고, 85개는 계산적 counterexample을 찾았으며, 203개는 bounded counterexample search 후에도 참으로 남았다.
  5. Tool 사용 vs 비사용 비교: tool 미사용 agentic baseline과의 대조를 통해 tool 사용이 novel mathematical problem 해결에 미치는 영향을 정량화했다.

How

Figure 2

Figure 2. Failure-mode counts for evaluated completions. Since no

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: machine-generated conjecture와 formal verification을 결합한 새로운 벤치마크 패러다임을 제시한 흥미로운 초기 연구이나, human-guided triage에 의존한 결과 해석과 낮은 해결률은 완전한 자율 시스템으로 나아가기 위한 추가 검증이 필요함을 시사한다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'Fimo: A challenge formal dataset for automated theorem proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'Lean-star: Learning to interleave thinking and proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구유사한 agentic proving 기법을 다른 검증 벤치마크에 적용한다.
후속 연구그래프 이론 추측 생성 및 검증 루프를 자율적 형태로 확장한다.
기반 연구Lean 기반 정리 증명 시스템에 대한 응용 연구이다.
기반 연구coding agent 기반 형식화 작업의 확장 연구
기반 연구Lean 기반 정리 증명 파이프라인 구조를 공유하는 선행 연구이다.
기반 연구frozen LLM 기반 증명 검증 프레임워크를 확장하는 관련 연구로 보임
기반 연구Lean 기반 증명 작업을 확장하여 관련 데이터셋이나 벤치마크를 구축한다.
기반 연구Lean 증명 자동화 시스템을 최적화 단계로 확장하는 연구로 판단됨.
기반 연구SPECTER2 유사도 0.94로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'M2F: Automated Formalization of Mathematical Literature at Scale'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근증명 에이전트의 후보 랭킹 문제에 대한 다른 해결책 제시
응용 사례Lean4 기반 자동 번역 및 검증 루프를 유사한 벤치마크 문제에 적용한다.
다른 접근자동 생성된 수학적 추측 검증을 위한 다른 정형 증명 접근을 사용한다.
다른 접근정형화 벤치마크 평가의 결함을 다루는 유사한 문제의식을 공유한다.
다른 접근Lean 4 기반 자동 정리 증명의 다른 접근법을 제시한다.
다른 접근Lean/Mathlib 기반 평가 데이터셋 구축이라는 유사한 문제를 다른 방식으로 접근한다.
다른 접근LLM 에이전트 기반 Lean 자동화 시스템이라는 유사한 문제를 다루는 대안적 접근
후속 연구동적으로 업데이트되는 벤치마크 설계의 기초를 제공한다.
후속 연구tactic search 및 exact replay 검증이라는 방법론적 기반을 공유
후속 연구Lean 커널 인증 기반 tri-state 검증 방법론의 토대를 제공하는 연구로 판단됨
응용 사례formal reasoning 벤치마크를 실제 수학 문제에 적용한 사례이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드