LitReview Arena: Evaluating Literature Review Agents with Battle-style Peer Review Platform

저자: Ruotong Zhao, zhiyu chen, Xurui Liu, Haidong Xue, Dong Liang, Jigao Fu, Wu YanBiao, Yuanyi Zhen, Fengli Xu, Yong Li | 날짜: 2026 | URL: https://openreview.net/forum?id=VLWuEuQkCF 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. LitReviewBench construction overview. Left: topic extraction from high quality AI survey papers curated from O

본 논문은 자동 생성 literature review의 품질을 평가하기 어려운 문제를 해결하기 위해 battle-style 전문가 평가 플랫폼인 LitReview Arena를 제안하고, 이를 통해 3k개의 전문가 판단 데이터셋 LitReviewBench와 저비용 평가자 LitJudge를 구축한다.

Motivation

Achievement

Figure 2

Figure 2. Expert-aligned evaluator workflow and results. (a) Context construction for the calibrated evaluator. (b) Cali

  1. LitReview Arena 플랫폼과 프로토콜 제안: annotator 자격 제한, 실제 고인용 survey에서 파생된 query, 전문성 매칭, 5개 구조화된 평가 차원(D1-D5)을 포함하는 literature review 특화 battle 평가 프로토콜을 설계했다. 2. 대규모 전문가 판단 데이터셋 수집 및 시스템 분석: 3k개의 전문가 판단(각 5개 차원 포함)을 수집해 최상위 시스템도 human draft 대비 overall utility에서 23.0%의 decisive match 승률에 그치고, paper structure와 research suggestions에서 약 200점 격차가 남을 발견했으며, agentic LLM(Sonar Deep Research 등)이 base LLM보다 60% 이상 우수하지만 평균 15배의 token 비용이 든다는 trade-off를 규명했다. 3. 전문가 정렬 평가자 LitJudge 공개: 기존 LLM-as-a-judge 방식이 인간 전문가와 크게 불일치(Spearman's ρ≈0.467)함을 보이고, 수집된 preference 데이터로 calibration하여 ρ≈0.792까지 정렬도를 개선한 저비용 offline 평가자를 제공했다.

How

Figure 1

Figure 1. LitReviewBench construction overview. Left: topic extraction from high quality AI survey papers curated from O

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 4/5

총평: literature review 평가라는 중요하지만 정량화하기 어려운 문제에 대해 arena 방식의 구조화된 프로토콜과 대규모 전문가 preference 데이터, 그리고 실용적인 저비용 evaluator까지 완결성 있게 제시한 의미 있는 연구이다. 다만 데이터 규모와 도메인 다양성 측면에서 추가 검증이 필요하며 agentic 시스템의 비용 문제는 미해결 과제로 남는다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.95로 Biomedical AI Knowledge Systems와 Scientific Information Extraction and QA가 맞닿아, 'Language agents achieve superhuman synthesis of scientific knowledge'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근환각 문제를 극복하는 다른 LLM 기반 검색·요약 접근을 제시한다.
기반 연구SPECTER2 유사도 0.96로 Biomedical AI Knowledge Systems와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning Research'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.95로 Biomedical AI Knowledge Systems와 AI-Assisted Academic Scholarly Communication가 맞닿아, 'ReviewAgents: Bridging the Gap Between Human and AI-Generated Paper Reviews'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구LLM 기반 evidence-grounded feedback을 실제 저작 지원에 적용한 사례로 보임
기반 연구self-evolving 검색 시스템의 성능을 확장한다.
기반 연구VLM 기반 zoom loop 및 abstention 메커니즘을 확장한 후속 연구이다.
응용 사례자동 생성 문헌 리뷰 평가를 실제 사례에 적용한 연구이다.
기반 연구학술 연구 평가 자동화를 확장한 관련 연구이다.
기반 연구유사한 collective perception 기법을 다른 연구 자동화 태스크에 적용한다.
기반 연구hierarchical retrieval 기반 문헌 생성 방법론을 확장한 연구로 판단됨
다른 접근LLM 기반 평가자 구축이라는 유사한 문제를 다른 방식으로 접근한다.
기반 연구저자 응답 기반 학습 신호를 확장하여 피드백 생성 품질을 개선한다.
다른 접근전문가 평가 기반 벤치마크 구축이라는 유사 문제의 대안적 접근이다.
기반 연구실제 연구 저장소 기반 평가를 확장하여 신뢰성 문제를 다룬 후속 연구이다.
다른 접근지시어 조정 데이터셋 구축의 대안적 방법을 제시함
다른 접근학술 검색 자동화를 위한 다른 LLM 에이전트 접근법
다른 접근cross-conference 데이터 기반 리뷰 분석의 유사 연구이다.
다른 접근연구 파이프라인 단계별 AI 콘텐츠 탐지라는 유사 목표를 다른 방법으로 접근
다른 접근AI 과학 연구 능력 평가라는 공통 주제
다른 접근LLM 생성물 평가를 위한 다른 벤치마크 및 평가 방식을 제안한다.
다른 접근전문 도메인 텍스트 생성 능력 평가를 위한 다른 벤치마크를 제시함
다른 접근자동 생성 논문의 오류/조작 탐지라는 유사한 목표를 공유한다.
다른 접근autoformalization 평가에 있어 블랙박스 판정 방식 대신 다른 접근법을 제안한다는 점에서 유사한 문제를 다룸
후속 연구멀티모달 학술 콘텐츠 생성의 평가 기준을 제공하는 기반 연구이다.
후속 연구human-in-the-loop 에이전트 프레임워크 설계의 기반이 되는 연구이다.
후속 연구AI 연구 에이전트 학습의 기초가 되는 프레임워크를 제공한다.
후속 연구diffusion language model의 이론적 기초를 제공한다.
반론/비판벤치마크 순위 평가에 대한 다른 관점을 제시할 수 있다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드