Not All Proofs Are Equal: Evaluating LLM Proof Quality Beyond Correctness

저자: Ivo Petrov, Jasper Dekoninck, Dimitar Iliev Dimitrov, Martin Vechev | 날짜: 2026 | URL: https://openreview.net/forum?id=d2jgqlEweL 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Example of proof quality. Even for the same problem, correct LLM-generated proofs can differ substantially in

이 논문은 LLM이 생성한 수학 증명을 정답 여부(correctness)만이 아니라 간결성, 계산 부담, 인지적 단순성, 다양성, 적응성이라는 5가지 척도로 평가하는 벤치마크 PROOFRANK를 제안한다. 이를 통해 correctness만으로는 드러나지 않는 모델 간 증명 품질 차이와 correctness-품질 간 trade-off를 실증적으로 보여준다.

Motivation

Achievement

Figure 2

Figure 2. Main results for several models.

  1. PROOFRANK 벤치마크 구축: 대수, 기하, 조합론, 미적분, 정수론에 걸친 382개의 고난도 high-school-level final-answer 경시대회 문제로 구성된 최초의 proof quality 평가 벤치마크를 제시했다.
  2. 5가지 scalable proxy metric 정의: conciseness, computational ease, cognitive simplicity(이상 proof-level), diversity, adaptivity(이상 problem-level)라는 다섯 가지 측정 가능한 proof quality 지표를 설계했다.
  3. Pairwise 비교 및 correctness 필터링 기법: 절대 점수 산정의 어려움을 해결하기 위해 동일 문제 내에서 정답이면서 완전한 증명끼리만 pairwise 비교하여 model-level rating을 산출하는 방법론을 제시했다.
  4. 프론티어 LLM 평가를 통한 실증적 발견: GPT-5.4가 accuracy와 다수 품질 지표에서 우수한 반면 GEMINI-3.1-PRO는 conciseness가 매우 낮고(3.5배 장황), QWEN3.5-397B는 낮은 accuracy에도 품질 지표가 좋으며 GLM-5는 준수한 accuracy에도 품질 지표가 낮다는, correctness와 proof quality 간의 trade-off 및 비상관성을 발견했다.

How

Figure 3

Figure 3. Tradeoff between accuracy and conciseness under differ-

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: Correctness 일변도의 수학 증명 평가 관행에 신선한 문제의식을 제기하며 실용적인 다차원 평가 프레임워크를 제시한 의미 있는 연구로, workshop paper로서 향후 본격적인 벤치마크 확장과 human validation이 뒤따른다면 임팩트가 클 것으로 기대된다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Fimo: A challenge formal dataset for automated theorem proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구멀티모달 설명 생성을 실제 교육적 맥락에 적용한 유사 연구이다.
기반 연구research-level 수학 문제에 대한 LLM 검증 능력을 확장하여 다룸
기반 연구correctness 외 다양한 평가 척도의 이론적 기초
기반 연구LLM 평가 벤치마크 설계의 방법론적 기반을 제공한다.
다른 접근VLM의 수학적 추론 능력을 평가하는 유사한 벤치마크 접근이다.
다른 접근LLM judge 정렬 문제를 다루는 유사한 평가 벤치마크 접근이다.
다른 접근LLM 증명 품질 평가를 위한 대안적 벤치마크 접근
후속 연구correctness를 넘어선 평가 척도를 확장하여 다루는 관련 연구이다.
후속 연구간결성, 적응성 등 다차원 평가를 확장하는 연구
응용 사례실제 수학 증명 평가에 대한 유사한 응용 사례
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드