저자: Ivo Petrov, Jasper Dekoninck, Dimitar Iliev Dimitrov, Martin Vechev | 날짜: 2026 | URL: https://openreview.net/forum?id=d2jgqlEweL 📄 PDF
라이선스: OpenReview 공개(오픈액세스)
Figure 1. Example of proof quality. Even for the same problem, correct LLM-generated proofs can differ substantially in
이 논문은 LLM이 생성한 수학 증명을 정답 여부(correctness)만이 아니라 간결성, 계산 부담, 인지적 단순성, 다양성, 적응성이라는 5가지 척도로 평가하는 벤치마크 PROOFRANK를 제안한다. 이를 통해 correctness만으로는 드러나지 않는 모델 간 증명 품질 차이와 correctness-품질 간 trade-off를 실증적으로 보여준다.
Figure 2. Main results for several models.
Figure 3. Tradeoff between accuracy and conciseness under differ-
총평: Correctness 일변도의 수학 증명 평가 관행에 신선한 문제의식을 제기하며 실용적인 다차원 평가 프레임워크를 제시한 의미 있는 연구로, workshop paper로서 향후 본격적인 벤치마크 확장과 human validation이 뒤따른다면 임팩트가 클 것으로 기대된다.