저자: Santiago Gonzalez, Alireza Amiri Bavandpour, Peter Ye, Edward Zhang, Ruslans Aleksejevs, Todor Antić, Polina Baron, Sujeet Bhalerao, Shubhrajit Bhattacharya, Zachary Burton, John Byrne, Hyungjun Choi, Nujhat Ahmed Disha, Koppány István Encz, Yuchen Fang, Robert Joseph George, Ebrahim Ghorbani, Alan Goldfarb, Jing Guo, Meghal Gupta, Stefano Huber, Annika Kanckos, Minjung Kang, Hyun Jong Kim, Dino Lorenzini, Levi Lorenzo, Tianyi Mao, Giovanni Marzenta, Ariane M. Masuda, Lukas Mauth, Ana Mickovic, Andrés Miniguano-Trujillo, Antoine Moulin, Wenqi Ni, Tomos Parry, Kevin Ren, Hossein Roodbarani, Mathieu Rundström, Manjil Saikia, Detchat Samart, Rebecca Steiner, Connor Stewart, Dhara Thakkar, Jeffrey Tse, Vasiliki Velona, Yunhai Xiang, Sibel Yalçın, Jun Yan, Ji Zeng, Arman Cohan, Quanquan C. Liu | 날짜: 2026 | URL: https://openreview.net/forum?id=aOL0RPDfTQ 📄 PDF
라이선스: OpenReview 공개(오픈액세스)
Figure 4. Evaluator Bias Heatmap. The delta between AI and
이 논문은 LLM을 자동 채점자(judge)로 사용할 때 대학 수준 수학 증명 평가에서 발생하는 체계적인 정렬 격차(Alignment Gap)를 정량화하는 벤치마크인 QEDBench를 제안한다. 7개의 judge 모델과 5개의 solver 모델을 조합한 이중 평가 매트릭스와 1,000시간 이상의 인간 전문가 평가를 통해, 다수의 프론티어 judge들이 결함 있는 증명에도 긍정 편향(score inflation)을 보이며, 특정 reasoning 모델은 이산수학(discrete math) 영역에서 성능이 급락함을 보인다.
Figure 1. Pass Rates by Discipline. The pass rates (score ≥0.9)
총평: LLM judge의 신뢰성이라는 시의적절하고 중요한 문제를 대규모 인간 전문가 평가와 이중 루브릭 설계로 체계적으로 정량화한 견고한 벤치마크 연구로, AI 평가 신뢰성 연구에 실질적으로 기여할 것으로 평가된다.