Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge for Mathematical and Scientific Reasoning Evaluation

저자: Seojeong Park, Jiho Choi, Junyong Kang, Seonho Lee, Jaeyo Shin, Hyunjung Shim | 날짜: 2026 | URL: https://openreview.net/forum?id=QpABpBMzhZ 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

MLLM 기반 judge가 시각적 근거와 텍스트 서술이 충돌할 때 텍스트 서술(response text)에 편향되어 perceptually incorrect한 답을 오히려 높게 평가하는 Perceptual Judgment Bias를 규명하고, 이를 완화하기 위한 perception-grounded 데이터셋과 GRPO 기반 batch-ranking reward 학습법을 제안한다.

Motivation

Achievement

Figure 2
  1. Perceptual Judgment Bias의 정량화: baseline judge들이 20% 이상의 전체 오류율을 보이며, 특히 perceptual inconsistency만 존재하는 경우 정확도가 10% 이상 하락함을 실험적으로 입증했다.
  2. PPJD 데이터셋 구축: correct response(rc), perceptually perturbed response(rrp), perceptual+reasoning error가 결합된 response(rrp+r)로 구성된 quadruplet을 통해 perceptual 실패를 reasoning 오류와 명확히 분리하는 verifiable supervision을 제공했다.
  3. GRPO 기반 batch-ranking reward 학습: 명시적 pairwise label 없이도 coherent한 global ordering을 유도하는 구조화된 reward objective를 설계했다.
  4. 벤치마크 성능 개선: MathVista, ScienceQA, ChartQA, InfographicVQA, MM-Vet 등에서 batch-level metric을 Qwen3-VL-4B-Thinking 기준 최대 8.0%, single-score accuracy를 Flex-Judge-7B 기준 10.7% 향상시켰으며, 일부 설정에서는 proprietary evaluator를 능가했다.

How

Figure 3

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: MLLM judge의 근본적인 perception-reasoning misalignment 문제를 명확히 정의하고 이를 해결하기 위한 verifiable한 데이터셋과 학습 방법을 제시한 실용적이고 의미 있는 연구로, 수학·과학 추론 평가의 신뢰성을 높이는 데 기여할 잠재력이 크다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 Biomedical AI Knowledge Systems와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Sciknoweval: Evaluating multi-level scientific knowledge of large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Biomedical AI Knowledge Systems와 Scientific Information Extraction and QA가 맞닿아, 'Synchart: Synthesizing charts from language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Biomedical AI Knowledge Systems와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning Research'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구멀티모달 LLM 평가의 기초적 벤치마크를 제공한다.
기반 연구LLM-as-judge 평가 프레임워크의 기본적인 편향 문제를 다루는 토대 연구이다.
다른 접근MLLM judge의 편향 문제를 다루는 다른 완화 기법을 제시하는 대안적 접근이다.
다른 접근autoformalization 평가를 위한 다른 방법론 제시
후속 연구멀티모달 판단 편향 완화 기법을 확장하여 적용한 연구이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드