CRAFT: Counterexample-guided Repair And Falsification of Theorems in ML and Optimization

저자: Yirui Liu, Jiayu Qin, Penghang Liu, Jian Chen | 날짜: 2026 | URL: https://openreview.net/forum?id=W82BF2XUxy 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Overview of CRAFT. CRAFT obtains a round-1 LLM judgment for a claim c, performs executable checking with vc, f

CRAFT는 ML/최적화 분야의 수학적 주장(claim)을 LLM이 1차 판정한 뒤, 실행 가능한 violation function 기반 verifier가 반례(counterexample)를 탐색하여 그 신호를 LLM에 피드백함으로써 판정을 교정하고 수정안(repair)을 제안·재검증하는 counterexample-first workflow이다.

Motivation

Achievement

Figure 1

Figure 1. Overview of CRAFT. CRAFT obtains a round-1 LLM judgment for a claim c, performs executable checking with vc, f

  1. 50-claim 벤치마크 구축: ML/최적화 분야 25개 claim family에 대해 각각 true claim과 이를 약화시킨 false claim(가정 삭제, 상수 완화, 조건 약화 등)으로 구성된 재현 가능한 실행형 벤치마크(formal_eval)를 제시하고, 각 claim에 violation function을 부여해 반례 탐색을 기계적으로 테스트 가능하게 만들었다.
  2. verifier-in-the-loop 워크플로우 제시: 발견된 반례로 false acceptance를 교정하고, calibrated no-counterexample 신호로 false alarm을 재고하며, 동일한 실행형 인터페이스로 수정안을 검증하는 구조를 설계했다.
  3. 7개 모델에 걸친 정확도 개선: verifier 피드백이 round-1 정확도를 개선하거나 최소한 유지시켰으며, 특히 qwen2.5-7b-instruct에서는 정확도가 78%에서 94%로 크게 향상되었다.
  4. repair 검증 성공률 100%: 25개의 canonical repair target 전부가 재검사(re-checking)를 통과하였다.

How

Figure 1

Figure 1. Overview of CRAFT. CRAFT obtains a round-1 LLM judgment for a claim c, performs executable checking with vc, f

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 수학적 주장 검증의 병목을 증명 대신 실행 가능한 반례 탐색으로 전환하는 실용적이고 명확한 워크플로우를 제안하며, 다수 모델에서 일관된 정확도 개선을 보여준 점이 인상적이나, 벤치마크 규모와 claim 다양성 확장이 향후 중요한 과제로 남는다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.95로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'Fimo: A challenge formal dataset for automated theorem proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근형식적 수학 증명을 위한 유사한 벤치마크나 방법론을 다룬다.
기반 연구SPECTER2 유사도 0.94로 Formal Proof Verification Automation와 Scientific Information Extraction and QA가 맞닿아, 'Automated justification production for claim veracity in fact checking: A survey on architectures and approaches'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근팩트체킹 정당화 생성에 대한 다른 접근 방식을 제안한다.
기반 연구SPECTER2 유사도 0.93로 Formal Proof Verification Automation와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Can language models falsify? evaluating algorithmic reasoning with counterexample creation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구CRAFT는 CounterExample-Carrying FormalRx와 동일한 counterexample 기반 검증 프레임워크를 다른 도메인(ML claim)에 확장한 연구이다.
기반 연구LLM 기반 수학적 발견 평가를 실제 연구 문제에 응용한다.
다른 접근형식 검증 가능한 반례 생성이라는 유사한 목표를 가진 접근이다.
다른 접근LLM 기반 수학적 주장 검증을 다른 반례 탐색 전략으로 수행하는 대안적 접근이다.
후속 연구counterexample-guided repair 개념을 다른 최적화 이론 검증으로 확장한 연구이다.
응용 사례counterexample-guided repair를 formal verification 문제에 적용한 사례이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드