⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
Figure 2. Viviani’s theorem (PWW #012). The pictured proof
PWW-Bench는 "Proofs Without Words" (PWW) 컬렉션의 403개 시각적 증명 도해를 기반으로, VLM이 그림만 보고 정리를 식별하고 기하학적 구성요소를 파악하며 논리적 증명 사슬을 복원할 수 있는지를 평가하는 벤치마크이다.
Motivation
Known: 기존 수학 비전 벤치마크(MathVista, MathVerse, MMMU, We-Math)는 문제 설명이 주어지고 그림이 파라미터나 제약을 제공하는 얕은 계산 기반 과제에 초점을 맞추고 있다.
Gap: 인간 수학적 직관과 발견, 소통에서 중요한 역할을 하는 시각적·증명 기반 추론(그림만으로 정리를 파악하고 증명 논리를 복원하는 능력)은 어떤 기존 벤치마크에서도 다루지 않는다.
Why: 수학자가 실제로 수행하는 시각적 표현에서 형식적 수학 내용을 추출하는 핵심 인지 과정을 평가함으로써, VLM의 진짜 수학적 시각 이해 능력을 드러낼 수 있는 중요한 도구가 된다.
Approach: Nelsen의 세 권의 저서에서 수집한 403개의 PWW 도해를 바탕으로 diagram-only와 theorem-given 두 가지 과제 형식을 정의하고, LLM judge(claude-opus-4-6)와 인간 보정 rubric을 이용한 3축(정리 식별, 시각적 근거, 증명 재구성) 채점 체계를 구축하여 8개의 frontier 및 open-weight VLM을 평가한다.
Achievement
Figure 4. Theorem recognition (Axis 1) on the diagram-only
포괄적 데이터셋 구축: Nelsen의 세 권 저서에서 총 403개의 PWW 문제를 수집하고, 6개 수학 카테고리와 5개 시각적 증명 원형(dissection, lattice counting, nested figures, shaded-area equality, staged reveal)으로 분류했다.
이중 과제 형식 설계: diagram-only와 theorem-given 형식을 통해 정리 식별 실패와 증명 복원 실패를 구분할 수 있게 했다.
rubric 기반 judge 시스템 개발: 3축(0-3점) 채점 체계와 axis3final = min(axis3raw, axis2)라는 결정론적 교차축 제약을 도입하고, 문항별 anchor list와 not pictured 정보로 LLM judge를 보정했다.
파일럿 실험 및 핵심 발견: 15문제 균형 부분집합에서 8개 VLM을 평가한 결과, 모든 모델이 심각한 시각적 이해 실패를 보였으며, 특히 정답 정리를 제공받아도 올바른 증명을 재구성하지 못했다. frontier 모델의 주된 실패는 정리 식별이 아니라 증명 서술 오류(존재하지 않는 기하학적 단계를 주장)였다.
크라우드소싱 인터페이스 개발: 전체 벤치마크에 대한 rubric 보정을 위한 크라우드소싱 인터페이스를 구축했다.
How
Figure 5. Proof-description quality (Axes 2+3, max 6) for diagram-
PWW 아이템을 (I, T) 튜플(이미지, 정리 서술문)로 정의하고 diagram-only(9점 만점)와 theorem-given(6점 만점) 두 프롬프트 형식을 설계
각 응답을 Axis 1(정리 식별), Axis 2(시각적 근거), Axis 3(증명 재구성) 세 축으로 0-3점 채점하며 axis3final = min(axis3raw, axis2) 규칙으로 논리적 일관성 강제
채점 후 실패 유형 태그(theorem misid, key element miss, alternative proof, hallucinated objects, invalid grounded chain, panel order, refusal)를 수집해 정성 분석 수행
rubric 보정을 위해 각 문제마다 prose proof(P), anchor list(A), not pictured(N) 메타데이터를 인간이 작성하여 LLM judge(claude-opus-4-6)에 제공
시스템 프롬프트 수준의 human-graded calibration 예시(Calibration A, B 등)를 추가하여 judge의 오류 방지(예: 다른 유효한 논증으로 대체하는 것을 막음)
15문제 균형 부분집합에서 3개 frontier 모델과 5개 open-weight 모델 총 8개 VLM에 대해 파일럿 실험 수행
Originality
기존 벤치마크가 다루지 않은 "그림에서 형식적 증명을 추출"하는 과제를 최초로 정의하고 벤치마크화함
단순 정답 여부가 아닌 시각적 근거(visual grounding)와 증명 메커니즘의 정확성을 분리하여 평가하는 3축 rubric 설계
axis3final = min(axis3raw, axis2)라는 논리적 종속성을 명시적으로 반영한 채점 규칙 도입
LLM judge의 신뢰성을 높이기 위한 문항별 human-checked 메타데이터(anchor, not pictured) 기반 보정 기법 제안
diagram-only와 theorem-given 두 형식을 대조하여 정리 식별 실패와 증명 복원 실패를 분리 진단하는 실험 설계
Limitation & Further Study
파일럿 실험이 15문제, 8개 모델로 규모가 매우 작아 통계적 일반화에 한계가 있으며, 전체 403개 벤치마크에 대한 대규모 평가 결과가 아직 제시되지 않음
LLM judge(claude-opus-4-6) 자체의 편향이나 판단 오류 가능성에 대한 심층적 검증이 부족하며, judge와 인간 평가자 간 일치도에 대한 정량적 보고가 제한적
rubric 보정을 위한 크라우드소싱 확장 작업이 아직 진행 중이며, 전체 데이터셋에 대한 최종 결과는 후속 연구로 남아있음
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Scientific Information Extraction and QA가 맞닿아, 'Every part matters: Integrity verification of scientific figures based on multimodal large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.