Counterexample-Carrying FormalRx: Lean-Checkable Witnesses for Autoformalization Misalignment

저자: Joy Zheyun Yang, Socrates Osorio | 날짜: 2026 | URL: https://openreview.net/forum?id=OknxQMSpnn 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

FormalRx-CC는 자동정형화(autoformalization) 오정렬 진단이 단순히 correction만 제시하는 것이 아니라, candidate와 intended Lean 명제가 실제로 의미상 다르다는 것을 Lean이 기계적으로 검증 가능한 counterexample witness로 증명하도록 요구하는 벤치마크 확장이다. GPT-4.1-mini, GPT-4.1, Claude Haiku에 대한 204-example 실행 결과, Lean-feedback repair는 raw acceptance를 크게 높이지만 의미적 방향까지 맞는 joint metric은 여전히 매우 낮다.

Motivation

Achievement

  1. Task 정의 및 taxonomy: counterexample-carrying semantic alignment task를 정의하고, candidate_weaker, candidate_stronger, candidate_incomparable, candidate_vacuous, local_delta 등 semantic relation 라벨과 7개 witness family 분류체계를 제시했다.
  2. 검증 프로토콜: sorry, admit, blocked proof escape, statement mutation을 거부하고 선택적으로 axiom inspection을 수행하는 adversarial Lean 검증 프로토콜을 설계했다.
  3. 실행 가능한 204-example artifact: 25개 synthetic seed, 26개 FormalRx-derived, 153개 확장 커버리지 예제로 구성된 실행 가능한 stress artifact를 구축했다.
  4. 모델 평가 결과: GPT-4.1-mini, GPT-4.1, Claude Haiku에 대해 204-example 실행을 완료하고, Lean-feedback repair가 raw Lean acceptance를 23-61% 향상시키지만 semantic direction까지 맞는 joint metric은 GPT-4.1-mini strict funnel에서 13/204에 불과함을 보였다.
  5. mode 비교 분석: GPT-4.1-mini에서 full mode(33/204 raw, 48/204 repair 후)가 gold-target mode(21/204)보다 Lean을 더 자주 통과함을 보여, raw Lean 성공이 witness construction과 self-target selection을 혼동할 수 있음을 시사했다.

How

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: Autoformalization 진단 벤치마크에 형식적으로 검증 가능한 counterexample witness라는 개념을 도입해 raw Lean acceptance와 실제 의미 이해를 구분하는 중요한 통찰을 제공하지만, 아직 초기 단계의 소규모 stress artifact이며 hidden test split, inter-annotator reliability, specialized prover 비교 등 후속 검증이 필요한 워크숍 페이퍼 수준의 기여이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Minif2f: a cross-system benchmark for formal olympiad-level mathematics'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Draft, sketch, and prove: Guiding formal theorem provers with informal proofs'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Grammars of formal uncertainty: When to trust llms in automated reasoning tasks'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구자동정형화 오정렬 진단의 방법론적 기초를 제공한다.
다른 접근정리 증명 지원을 위한 pre-proof layer 설계라는 유사한 방법론적 기초를 공유한다.
후속 연구Lean 검증 가능한 반례 생성 기법을 다른 도메인으로 확장한 연구이다.
후속 연구CRAFT는 CounterExample-Carrying FormalRx와 동일한 counterexample 기반 검증 프레임워크를 다른 도메인(ML claim)에 확장한 연구이다.
후속 연구counterexample 생성 기법을 확장한 연구이다.
응용 사례counterexample 기반 검증을 실제 autoformalization 문제에 적용한 사례이다.
반론/비판AUROC 편차의 원인을 다르게 진단하는 대비 연구
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드