QEDBench: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs

저자: Santiago Gonzalez, Alireza Amiri Bavandpour, Peter Ye, Edward Zhang, Ruslans Aleksejevs, Todor Antić, Polina Baron, Sujeet Bhalerao, Shubhrajit Bhattacharya, Zachary Burton, John Byrne, Hyungjun Choi, Nujhat Ahmed Disha, Koppány István Encz, Yuchen Fang, Robert Joseph George, Ebrahim Ghorbani, Alan Goldfarb, Jing Guo, Meghal Gupta, Stefano Huber, Annika Kanckos, Minjung Kang, Hyun Jong Kim, Dino Lorenzini, Levi Lorenzo, Tianyi Mao, Giovanni Marzenta, Ariane M. Masuda, Lukas Mauth, Ana Mickovic, Andrés Miniguano-Trujillo, Antoine Moulin, Wenqi Ni, Tomos Parry, Kevin Ren, Hossein Roodbarani, Mathieu Rundström, Manjil Saikia, Detchat Samart, Rebecca Steiner, Connor Stewart, Dhara Thakkar, Jeffrey Tse, Vasiliki Velona, Yunhai Xiang, Sibel Yalçın, Jun Yan, Ji Zeng, Arman Cohan, Quanquan C. Liu | 날짜: 2026 | URL: https://openreview.net/forum?id=aOL0RPDfTQ 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 4

Figure 4. Evaluator Bias Heatmap. The delta between AI and

이 논문은 LLM을 자동 채점자(judge)로 사용할 때 대학 수준 수학 증명 평가에서 발생하는 체계적인 정렬 격차(Alignment Gap)를 정량화하는 벤치마크인 QEDBench를 제안한다. 7개의 judge 모델과 5개의 solver 모델을 조합한 이중 평가 매트릭스와 1,000시간 이상의 인간 전문가 평가를 통해, 다수의 프론티어 judge들이 결함 있는 증명에도 긍정 편향(score inflation)을 보이며, 특정 reasoning 모델은 이산수학(discrete math) 영역에서 성능이 급락함을 보인다.

Motivation

Achievement

Figure 1

Figure 1. Pass Rates by Discipline. The pass rates (score ≥0.9)

  1. 정렬 격차의 정량화: Claude Opus 4.5, DeepSeek-V3, Qwen 2.5 Max, Llama 4 Maverick 등 프론티어 judge 모델들이 인간 전문가 대비 최대 +0.18~+0.36의 평균 점수 인플레이션(체계적 긍정 편향)을 보임을 입증했다.
  2. 이산-연속 성능 격차 발견: Gemini 3.0 Pro는 전반적으로 0.91의 state-of-the-art 인간 평가 점수를 달성했으나, GPT-5 Pro와 Claude Sonnet 4.5 같은 reasoning 모델은 Discrete Math(0.72, 0.63)와 Graph Theory(0.74, 0.50)에서 급격히 성능이 저하됨을 밝혔다.
  3. 대규모 검증된 벤치마크 공개: 1,000시간 이상의 PhD급 전문가 수기 평가에 기반한 최초의 통계적으로 견고한 대학 수준 수학 증명 자동 평가 표준(QEDBench)을 데이터셋, 이중 루브릭 시스템, 평가 로그와 함께 공개하여 향후 AI judge 벤치마킹을 지원한다.

How

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 4/5

총평: LLM judge의 신뢰성이라는 시의적절하고 중요한 문제를 대규모 인간 전문가 평가와 이중 루브릭 설계로 체계적으로 정량화한 견고한 벤치마크 연구로, AI 평가 신뢰성 연구에 실질적으로 기여할 것으로 평가된다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Deepseek-prover: Advancing theorem proving in llms through large-scale synthetic data'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Sciglm: Training scientific language models with self-reflective instruction annotation and tuning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 AI-Assisted Academic Scholarly Communication가 맞닿아, 'AAAR-1.0: Assessing AI's Potential to Assist Research'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구수학 증명 평가의 정렬 문제를 확장하여 다루는 관련 벤치마크이다.
기반 연구QED로 생성된 증명의 품질을 평가하는 벤치마크로 QED 시스템을 직접 확장하여 평가한다.
응용 사례QED와 같은 자동 증명 생성 시스템을 평가하는 벤치마크로 직접 응용된다.
기반 연구자동 평가 벤치마크 설계의 공통 방법론적 기초를 공유한다.
기반 연구MCQA calibration 분석을 truncation 효과로 확장함
기반 연구rubric 기반 자동 채점 시스템의 신뢰성 검증을 확장한다.
후속 연구자동 채점 평가 방법론을 확장한 연구로 판단된다.
다른 접근LLM judge 정렬 문제를 다루는 유사한 평가 벤치마크 접근이다.
후속 연구수학 증명 평가의 정렬 격차를 정량화하여 확장한 연구
응용 사례LLM judge를 실제 평가 태스크에 적용한 사례
반론/비판inoculation prompting의 실제 교정 효과를 비판적으로 재검토한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드