ReviewArena: A Large-Scale Cross-Conference Dataset and Benchmark for LLM Peer Review

저자: Samarth P, Motamarri Sai Sathvik, Vyoman Jain, Shiva Golugula | 날짜: 2026 | URL: https://openreview.net/forum?id=yugEO52gkR 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Overview of REVIEWARENA and REVIEWARENA-EVAL. Left: construction of REVIEWARENA from public OpenReview

ReviewArena은 7개 OpenReview venue(NeurIPS, ICLR, ICML, CoRL, COLM, EMNLP, TMLR)에서 수집한 51,529편 논문·196,099개 review로 구성된 대규모 cross-conference peer review 데이터셋과, 이를 기반으로 한 1,002편 규모의 venue-aware 평가 벤치마크 ReviewArena-Eval을 제안한다.

Motivation

Achievement

Figure 3

Figure 3. Calibration behaviour on REVIEWARENA-EVAL. Mean predicted rating as a function of binned mean human rating on

  1. 대규모 통합 데이터셋 구축: 56개 conference prefix를 감사하여 7개 venue, 14종의 review-form variant를 아우르는 51,529편 논문·196,099개 review를 수집하고 Hugging Face PdfFolder 형식으로 공개했다.
  2. Venue-aware 평가 벤치마크 제안: 6개 numerically rated venue에서 각 167편씩 총 1,002편을 추출한 ReviewArena-Eval을 구성하여, venue-year별 정확한 review form과 scale로 평가할 수 있게 했다.
  3. LLM peer review 능력의 분리 규명: text mimicry, numeric calibration, decision discrimination이 서로 독립적인 능력임을 실험적으로 보였다(예: Qwen3.6-Plus는 overall-rating MAE 0.700으로 최고 성능이지만, Gemma-4-26B와 GLM-5.1은 numeric 정확도 없이 text similarity에서 우수).
  4. NeurIPS 2025 post-rebuttal revision 기록: 명시적 review-revision invitation이 노출된 NeurIPS 2025에 대해 review 수정 여부와 reviewer의 최종 justification까지 기록했다.

How

Figure 5

Figure 5. Shared part of the REVIEWARENA-EVAL reviewer prompt. Venue-specific scale and JSON-schema blocks are inserted

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 규모, venue 다양성, native review-form 보존이라는 측면에서 실질적으로 유용한 인프라형 데이터셋·벤치마크 논문으로, LLM peer review 연구에 필요한 표준화된 평가 기반을 제공한다는 점에서 학계 기여도가 높다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.95로 Biomedical AI Knowledge Systems와 AI-Assisted Academic Scholarly Communication가 맞닿아, 'The open review-based (orb) dataset: Towards automatic assessment of scientific papers and experiment proposals in high-energy physics'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구cross-conference 벤치마크의 기초가 되는 연구이다.
기반 연구인간 유사 심사 과정 모방 프레임워크를 확장한다.
다른 접근peer review 데이터셋 구축을 위한 다른 접근을 제시한다.
다른 접근attention 기반 편집 메커니즘을 활용한 유사한 프레임워크를 제안한다.
다른 접근peer review 벤치마크 구축과 관련된 유사 접근이다.
다른 접근논문 리뷰 데이터를 활용한 유사한 벤치마크 구축 연구이다.
다른 접근peer review 관련 대규모 데이터셋 및 벤치마크를 다루는 유사 연구이다.
다른 접근학술 리뷰 프로세스 분석을 위한 대안적 데이터셋을 제공한다.
다른 접근cross-conference 데이터 기반 리뷰 분석의 유사 연구이다.
응용 사례LLM을 리뷰 평가에 응용하는 유사한 실험 설계를 공유한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드