⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
MLLM 기반 judge가 시각적 근거와 텍스트 서술이 충돌할 때 텍스트 서술(response text)에 편향되어 perceptually incorrect한 답을 오히려 높게 평가하는 Perceptual Judgment Bias를 규명하고, 이를 완화하기 위한 perception-grounded 데이터셋과 GRPO 기반 batch-ranking reward 학습법을 제안한다.
Motivation
Known: MLLM-as-a-Judge 패러다임은 LLM-as-a-Judge를 멀티모달로 확장하여 vision-language 응답의 추론 정확성을 평가하는 데 널리 활용되고 있으며, 최근에는 RL과 verifiable reward를 통해 채점 신뢰성과 선호 일관성을 높이려는 시도들이 이루어지고 있다.
Gap: 기존 MLLM judge들은 supervised fine-tuning에 의존하며 시각적 근거보다 응답 텍스트에 anchoring하는 경향이 있어, 시각 정보와 텍스트 서술이 충돌할 때 perceptually 틀린 응답에 높은 점수를 주는 systematic bias가 존재하는데, 이를 정량화하고 완화하는 verifiable한 학습 프레임워크는 부재했다.
Why: 수학/과학 도형·차트 추론 평가는 verifiable하고 perception에 기반한 판정이 필수적인데, 현재 judge들이 linguistically plausible하지만 visually ungrounded한 평가를 내리면 벤치마크 비교의 공정성뿐 아니라 RL 정렬을 위한 reward signal의 신뢰성까지 훼손되므로 이 문제 해결은 매우 중요하다.
Approach: Perceptual Judgment Bias를 insufficient perceptual capability와 response anchoring이라는 두 실패 모드로 분해하여 정량화하고, minimally edited counterfactual response로 구성된 Perceptually Perturbed Judgment Dataset(PPJD)을 기반으로 GRPO를 통해 verifiable batch-ranking reward를 갖는 judge를 학습시킨다.
Achievement
Perceptual Judgment Bias의 정량화: baseline judge들이 20% 이상의 전체 오류율을 보이며, 특히 perceptual inconsistency만 존재하는 경우 정확도가 10% 이상 하락함을 실험적으로 입증했다.
PPJD 데이터셋 구축: correct response(rc), perceptually perturbed response(rrp), perceptual+reasoning error가 결합된 response(rrp+r)로 구성된 quadruplet을 통해 perceptual 실패를 reasoning 오류와 명확히 분리하는 verifiable supervision을 제공했다.
GRPO 기반 batch-ranking reward 학습: 명시적 pairwise label 없이도 coherent한 global ordering을 유도하는 구조화된 reward objective를 설계했다.
벤치마크 성능 개선: MathVista, ScienceQA, ChartQA, InfographicVQA, MM-Vet 등에서 batch-level metric을 Qwen3-VL-4B-Thinking 기준 최대 8.0%, single-score accuracy를 Flex-Judge-7B 기준 10.7% 향상시켰으며, 일부 설정에서는 proprietary evaluator를 능가했다.
How
baseline judge의 오류를 insufficient perceptual capability와 response anchoring으로 분해하여 controlled visual perturbation 실험으로 각 실패 모드를 분석 (Table 1, Figure 2)
PPJD를 이용해 judge가 fully correct response와 perceptual error가 있는 response를 구분하도록 하고, perceptual과 reasoning 오류가 동시에 발생하는 경우까지 explicit graded ordering으로 세분화하는 reward objective 설계
총평: MLLM judge의 근본적인 perception-reasoning misalignment 문제를 명확히 정의하고 이를 해결하기 위한 verifiable한 데이터셋과 학습 방법을 제시한 실용적이고 의미 있는 연구로, 수학·과학 추론 평가의 신뢰성을 높이는 데 기여할 잠재력이 크다.
기반 연구SPECTER2 유사도 0.93로 Biomedical AI Knowledge Systems와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Sciknoweval: Evaluating multi-level scientific knowledge of large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Biomedical AI Knowledge Systems와 Scientific Information Extraction and QA가 맞닿아, 'Synchart: Synthesizing charts from language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Biomedical AI Knowledge Systems와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning Research'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.